DeepSeek OCR y DeepSeek OCR 2: guía para extraer documentos con modelos locales

DeepSeek OCR es una familia de modelos visuales orientada al reconocimiento y la reconstrucción de documentos. No es simplemente un lector de caracteres: recibe una imagen o una página de un PDF, comprime su contenido visual y genera una representación textual que puede conservar elementos como títulos, párrafos, tablas, fórmulas y orden de lectura. La versión original se publicó en octubre de 2025 y DeepSeek OCR 2, presentada el 27 de enero de 2026, modificó el codificador para interpretar mejor diseños visuales complejos.

Verificación editorial: 16 de julio de 2026.

Respuesta rápida

Para una implementación nueva, evalúa primero DeepSeek OCR 2, cuyo identificador oficial en Hugging Face es deepseek-ai/DeepSeek-OCR-2. Es un modelo de aproximadamente 3.000 millones de parámetros, distribuido bajo Apache 2.0, que puede ejecutarse en infraestructura propia con el código oficial. El modelo original, deepseek-ai/DeepSeek-OCR, continúa disponible bajo licencia MIT y resulta útil para reproducir el trabajo de compresión óptica publicado en 2025.

Ninguno de esos nombres es un identificador documentado para la API oficial de Chat Completions de DeepSeek. La API alojada documenta modelos V4 de texto. Para procesar imágenes con OCR u OCR 2 debes desplegar los pesos en tu entorno o contratar a un proveedor que declare expresamente ese modelo y sus condiciones.

Qué problema resuelve DeepSeek OCR

Un OCR clásico suele detectar caracteres y devolver texto plano. El procesamiento de documentos reales exige algo más: decidir qué bloque se lee primero, reconocer una tabla sin mezclar filas, conservar una fórmula, separar pies de página y comprender diseños con varias columnas. DeepSeek OCR trata la página como una entrada visual completa y utiliza un modelo generativo para reconstruirla según la instrucción recibida.

La investigación original también estudia la compresión óptica del contexto. En lugar de entregar al modelo de lenguaje miles de fragmentos visuales, DeepEncoder reduce la imagen a un conjunto más pequeño de tokens visuales. El artículo de DeepSeek OCR informa que el codificador combina percepción de alta resolución, conocimiento visual global y compresión; después, un decodificador MoE de 3B genera el resultado. El objetivo científico no equivale a prometer una compresión sin pérdidas para cualquier documento.

DeepSeek OCR frente a DeepSeek OCR 2

AspectoDeepSeek OCRDeepSeek OCR 2
Publicación oficial20 de octubre de 202527 de enero de 2026
ID de los pesosdeepseek-ai/DeepSeek-OCRdeepseek-ai/DeepSeek-OCR-2
Idea centralCompresión óptica con DeepEncoderFlujo causal visual con DeepEncoder V2
DecodificadorMoE de 3B; el artículo indica unos 570M activosMoE de 3B; el artículo indica alrededor de 500M activos
Tokens visualesModos nativos de 64 a 400; modo dinámico GundamEntre 256 y 1.120 según recortes dinámicos
Licencia del repositorioMITApache 2.0
Uso recomendadoReproducción, comparación y flujos ya validadosPrimera opción para una evaluación nueva de documentos

La diferencia principal está en el orden visual. El primer DeepEncoder procesa los tokens con una estructura visual convencional. DeepEncoder V2 sustituye parte de esa estructura por un codificador con estilo de modelo de lenguaje y consultas causales aprendibles. Esas consultas pueden reorganizar la información antes de pasarla al decodificador. La intención es aproximarse mejor al recorrido lógico que requiere una tabla, un formulario o una página con columnas, en vez de asumir siempre una lectura rígida de izquierda a derecha y de arriba abajo.

En OmniDocBench v1.5, el artículo de OCR 2 informa una puntuación global de 91,09 frente a 87,36 para OCR con nueve recortes, junto con una mejora de 3,73 puntos porcentuales. También informa menos repeticiones en dos flujos internos de producción. Son resultados de las condiciones descritas por los autores, no una garantía para cada factura, idioma, escaneo o configuración.

Arquitectura y resolución de DeepSeek OCR 2

OCR 2 conserva la estructura general codificador–decodificador. Su tokenizador visual incluye un componente SAM-base de unos 80M de parámetros y compresión de tokens; DeepEncoder V2 utiliza una arquitectura inspirada en un modelo de lenguaje compacto para añadir el flujo causal. Solo las consultas causales reorganizadas pasan al decodificador DeepSeek MoE.

  • Vista global: una entrada de 1024 × 1024 produce 256 tokens visuales.
  • Vistas locales: el modo dinámico añade entre cero y seis recortes de 768 × 768, con 144 tokens por recorte.
  • Presupuesto total: de 256 a 1.120 tokens visuales por imagen según el número de recortes.
  • Salida: texto generado; para conservar estructura documental, el prompt oficial solicita conversión a Markdown con grounding.

Más resolución no siempre significa mejor resultado. Los recortes aumentan el detalle disponible, pero también el consumo de memoria y el tiempo de inferencia. Conviene crear un conjunto representativo y seleccionar resolución, recortes y longitud de salida mediante pruebas, no mediante una regla universal.

Qué puede extraer y qué debe revisarse

Tareas apropiadas

  • Convertir páginas escaneadas en Markdown.
  • Recuperar texto de informes, libros y presentaciones.
  • Interpretar tablas, fórmulas y ciertos gráficos.
  • Proponer el orden de lectura de diseños complejos.
  • Preparar borradores para indexación o revisión humana.

No debe asumirse

  • Exactitud del 100 % en texto, cifras o fórmulas.
  • Compatibilidad garantizada con todo idioma o caligrafía.
  • Validación jurídica, contable o médica del contenido.
  • Conservación perfecta del diseño original.
  • Disponibilidad en la API comercial de DeepSeek.

Los documentos en español requieren una evaluación específica. El estudio de OCR 2 centra su tabla principal de OmniDocBench en páginas en chino e inglés; por tanto, esa puntuación no demuestra por sí sola el mismo rendimiento en español. Incluye acentos, eñes, fechas, decimales con coma, nombres propios y distintos tipos de documento en el conjunto de control.

¿Está DeepSeek OCR disponible en la API o en la app?

No debe confundirse un repositorio de pesos con un producto alojado. La documentación oficial de la API de DeepSeek enumera deepseek-v4-flash y deepseek-v4-pro para Chat Completions. No enumera DeepSeek-OCR ni DeepSeek-OCR-2 como valores de model. Además, su guía de compatibilidad Anthropic marca los bloques de imagen y documento como no compatibles.

La app oficial de DeepSeek puede incorporar funciones visuales como producto, pero eso no permite afirmar que una función concreta utilice los pesos públicos de OCR 2. DeepSeek no documenta en esas páginas un mapeo entre cada función de la aplicación y un repositorio de Hugging Face. Si necesitas una arquitectura controlable, despliega y versiona el modelo específico.

Instalación local basada en el repositorio oficial

El proyecto oficial documenta Python 3.12.9, CUDA 11.8, PyTorch 2.6.0 y FlashAttention 2.7.3 como entorno probado para OCR 2. Eso describe la configuración de los autores, no todas las combinaciones posibles. Usa un entorno aislado, fija las versiones aprobadas por tu equipo y revisa el código antes de habilitar trust_remote_code=True.

git clone https://github.com/deepseek-ai/DeepSeek-OCR-2.git
cd DeepSeek-OCR-2
conda create -n deepseek-ocr2 python=3.12.9 -y
conda activate deepseek-ocr2

# Instala las dependencias siguiendo el README oficial y
# la matriz CUDA/PyTorch validada para tu infraestructura.

El ejemplo oficial de Transformers carga el tokenizador y el modelo desde deepseek-ai/DeepSeek-OCR-2, usa BF16 en una GPU NVIDIA y llama al método infer. El prompt principal para preservar estructura es:

<image>
<|grounding|>Convert the document to markdown.

Para texto sin información de diseño, el repositorio propone <image> Free OCR.. No insertes rutas, documentos sensibles o salidas sin escapar directamente en comandos o páginas web. Si expones el modelo mediante una API propia, limita tamaño y tipo de archivo, analiza contenido malicioso, aísla el proceso, establece tiempos máximos y elimina temporales según una política comprobable.

Requisitos de hardware y rendimiento

La ficha oficial indica 3B parámetros y tensores BF16. Sin embargo, el espacio que ocupan los pesos no representa toda la memoria necesaria: hay que sumar el codificador visual, activaciones, caché, recortes, longitud generada y sobrecarga del motor. El repositorio usa una A100 de 40 GB como referencia para algunos experimentos de PDF en OCR original, pero no publica una garantía universal de memoria mínima para OCR 2.

  1. Empieza con una sola página y límites conservadores.
  2. Mide memoria máxima, latencia y longitud de salida.
  3. Aumenta recortes únicamente cuando mejoren tu métrica.
  4. Procesa PDFs página por página y conserva su numeración.
  5. Prueba concurrencia con documentos reales antes de dimensionar producción.

Cómo evaluar la calidad antes de producción

La mejor versión no es la que obtiene una cifra superior en un benchmark general, sino la que reduce errores en tu flujo. Construye un conjunto bloqueado de documentos que no se utilice para ajustar prompts. Incluye páginas limpias y degradadas, columnas, tablas combinadas, fórmulas, sellos, firmas, texto pequeño y rotaciones.

  • Texto: tasa de error de caracteres y palabras, con atención a cifras.
  • Estructura: encabezados, listas, columnas, tablas y orden de lectura.
  • Fidelidad: contenido omitido, duplicado o inventado.
  • Operación: latencia, memoria, páginas por hora, fallos y reintentos.
  • Riesgo: porcentaje que debe pasar a revisión humana.

En facturas, contratos, expedientes clínicos o documentos regulatorios, verifica campos críticos con reglas deterministas y revisión humana. Un modelo generativo puede producir una salida plausible pero incorrecta; por eso no basta con que el Markdown tenga buen aspecto.

Privacidad y seguridad de un despliegue OCR

Ejecutar pesos localmente puede ayudarte a controlar el recorrido del documento, pero no garantiza privacidad por sí solo. Revisa registros del servidor, almacenamiento temporal, copias de seguridad, telemetría, permisos, dependencias y acceso administrativo. Una interfaz, un proveedor de nube o un complemento pueden conservar datos aunque la inferencia se ejecute en tu infraestructura.

  • Cifra datos en tránsito y en reposo.
  • Aplica control de acceso por mínimo privilegio.
  • Define retención y borrado de originales, recortes y resultados.
  • No registres el texto extraído completo por defecto.
  • Consulta nuestra guía de seguridad y la política de privacidad antes de usar el chat de este sitio.

Licencias: OCR y OCR 2 no usan la misma

El repositorio y los pesos de DeepSeek OCR original se publican con licencia MIT. DeepSeek OCR 2 muestra licencia Apache 2.0 tanto en GitHub como en su ficha oficial de Hugging Face. Conserva avisos, atribución y una copia de la licencia aplicable. Revisa también licencias de dependencias, imágenes de contenedor, cuantizaciones y modelos derivados: una versión creada por terceros no hereda automáticamente todas las garantías del repositorio oficial.

La disponibilidad pública de pesos no elimina obligaciones sobre derechos de autor, datos personales o el contenido de los documentos. Para un producto comercial o regulado, realiza una revisión jurídica sobre la versión exacta que distribuyes y sobre tus fuentes de datos.

Preguntas frecuentes sobre DeepSeek OCR

¿DeepSeek OCR 2 sustituye por completo a DeepSeek OCR?

Es la revisión posterior y mejora resultados reportados por los autores, pero OCR original sigue siendo útil para reproducibilidad, compatibilidad de un flujo existente o comparación. Prueba ambas versiones si cambiar el modelo afecta documentos críticos.

¿Puedo llamar a deepseek-ai/DeepSeek-OCR-2 en api.deepseek.com?

No según la documentación oficial verificada. Es un ID de repositorio para pesos descargables, no uno de los modelos documentados por la API de Chat Completions. Consulta la guía de API para los identificadores alojados.

¿Puede convertir un PDF completo?

El repositorio incluye scripts de procesamiento de PDF con vLLM, pero el modelo interpreta imágenes de páginas. Tu canalización debe renderizar, numerar, procesar y recomponer las páginas, además de manejar fallos y documentos protegidos.

¿Reconoce documentos en español?

La ficha clasifica el modelo como multilingüe y el trabajo original muestra reconocimiento multilingüe, pero el benchmark principal de OCR 2 se centra en chino e inglés. Valida el español y cada variante documental con tus propias métricas antes de automatizar decisiones.

¿DeepSeek OCR es lo mismo que DeepSeek VL?

No. OCR está especializado en lectura y estructuración documental. DeepSeek VL es una familia visual-lingüística general para preguntas sobre imágenes, grounding y comprensión multimodal, aunque también puede realizar tareas de OCR.

Fuentes oficiales