Última actualización editorial: 23 de agosto de 2026.
Alcance de esta guía: mantiene la historia y las características de los pesos locales DeepSeek VL y VL2. deepseek-v4-flash-vision-exp, experimental desde el 21 de agosto de 2026, es el modelo visual alojado actual de DeepSeek; no es VL2, no reemplaza sus checkpoints y no convierte deepseek-vl2 en un ID válido de la API.
DeepSeek VL designa una familia de modelos que combina imágenes y texto. Puede describir una fotografía, responder preguntas visuales, leer elementos de documentos, interpretar gráficos y localizar objetos. La primera generación se publicó en marzo de 2024 con variantes de 1,3B y 7B; DeepSeek VL2 llegó en diciembre de 2024 con una arquitectura Mixture-of-Experts y tres tamaños: Tiny, Small y VL2 completo.
Qué elegir: pesos VL2 o Vision API
Para una prueba nueva con pesos públicos y despliegue propio, DeepSeek VL2 Tiny es el punto de partida más manejable. Usa deepseek-ai/deepseek-vl2-tiny, conserva las funciones esenciales de la familia y el repositorio oficial indica que puede ejecutarse en una GPU con menos de 40 GB. Si prefieres una API visual alojada, evalúa por separado deepseek-v4-flash-vision-exp; sus capacidades, contexto, costes y canal de acceso no deben atribuirse a VL2.
Los identificadores de Hugging Face de VL y VL2 sirven para descargar o desplegar pesos y no son IDs de la API oficial de DeepSeek. La alternativa visual alojada es deepseek-v4-flash-vision-exp, que acepta texto e imágenes mediante Chat Completions, Responses, Anthropic y las integraciones de Codex. En la compatibilidad Anthropic, los bloques nativos de documento continúan sin estar admitidos.
Qué significa un modelo de visión y lenguaje
Un VLM —vision-language model— transforma una o varias imágenes en representaciones que un modelo de lenguaje puede utilizar junto al prompt. Esto permite formular una pregunta sobre una escena, pedir una descripción, localizar un elemento o extraer información. No se limita a clasificar la imagen con una etiqueta cerrada: genera una respuesta textual condicionada por el contenido visual y la conversación.
DeepSeek VL fue diseñado para escenarios como diagramas lógicos, páginas web, reconocimiento de fórmulas, literatura científica, imágenes naturales y percepción en entornos físicos. VL2 amplía esa orientación con comprensión de documentos, tablas y gráficos, OCR, preguntas visuales y visual grounding, es decir, relacionar una expresión con coordenadas dentro de la imagen.
Evolución de DeepSeek VL a VL2
| Familia | Versiones oficiales | Contexto publicado | Arquitectura principal | Fecha |
|---|---|---|---|---|
| DeepSeek VL | 1.3B Base, 1.3B Chat, 7B Base, 7B Chat | 4.096 tokens | Modelo denso con codificador visual híbrido | 11 de marzo de 2024 |
| DeepSeek VL2 | Tiny, Small y VL2 | 4.096 tokens | Modelos de lenguaje MoE con codificación visual dinámica | 13 de diciembre de 2024 |
La primera familia ofrece versiones Base y Chat. Base está orientada a investigación, adaptación y evaluación del modelo preentrenado; Chat incorpora ajuste para seguir instrucciones. La ficha de 7B explica que emplea SigLIP-L y SAM-B como codificador visual híbrido, admite imágenes de hasta 1024 × 1024 y se apoya en DeepSeek LLM 7B.
VL2 cambia el modelo de lenguaje base por una arquitectura MoE. Un modelo MoE contiene muchos parámetros totales, pero activa solo una parte para cada token. Por eso el tamaño completo de los pesos determina almacenamiento y memoria, mientras que los parámetros activados ayudan a entender el cálculo por paso. No es correcto presentar la cifra activa como si fuera el tamaño total que hay que descargar.
Versiones de DeepSeek VL2 y parámetros
| Modelo | ID oficial | Parámetros totales indicados | Parámetros activos del resumen | Uso inicial |
|---|---|---|---|---|
| VL2 Tiny | deepseek-ai/deepseek-vl2-tiny | 3,37B MoE | 1,0B | Prototipos y evaluación con menor memoria |
| VL2 Small | deepseek-ai/deepseek-vl2-small | 16,1B MoE | 2,8B | Calidad intermedia con infraestructura amplia |
| VL2 | deepseek-ai/deepseek-vl2 | 27,5B MoE | 4,5B | Evaluación de la variante mayor |
Existe una inconsistencia dentro del propio README oficial: la introducción informa 1,0B, 2,8B y 4,5B parámetros activados, mientras que los comentarios del ejemplo Gradio indican 1,0B, 2,4B y 4,2B. La tabla anterior conserva las cifras del resumen del modelo y no oculta la discrepancia. Para capacidad y costes, utiliza los tamaños totales, inspecciona la configuración de la revisión descargada y mide el consumo real.
Cómo procesa imágenes DeepSeek VL2
VL2 utiliza un codificador visual y una estrategia de resolución dinámica. Puede dividir una imagen grande en mosaicos para conservar detalles, añadir una vista global y entregar las representaciones al modelo de lenguaje MoE. Esto ayuda con páginas, gráficos o texto pequeño, pero incrementa el número de tokens visuales y el uso de memoria.
- Una imagen: puede usar mosaicos dinámicos para mantener detalle y contexto global.
- Dos imágenes: el repositorio también aplica mosaicos dinámicos.
- Tres imágenes o más: la documentación indica que las redimensiona directamente a 384 × 384 sin mosaicos para controlar el contexto.
- Temperatura: los autores recomiendan un valor igual o inferior a 0,7 cuando se utiliza muestreo, porque valores mayores redujeron la calidad observada.
El límite de secuencia publicado para los tres checkpoints de VL2 es 4.096. No debe confundirse con el contexto de un millón de tokens que DeepSeek documenta para DeepSeek V4: son familias, pesos y canales de acceso diferentes. Tampoco significa que puedan introducirse 4.096 tokens de texto además de cualquier número de imágenes; la representación visual ocupa parte del presupuesto.
Capacidades prácticas de DeepSeek VL2
Comprensión visual
- Describir escenas y elementos visibles.
- Responder preguntas sobre una o varias imágenes.
- Interpretar relaciones espaciales básicas.
- Comparar imágenes dentro de una conversación.
Documentos y grounding
- Leer texto, fórmulas, tablas y gráficos.
- Analizar capturas de páginas o interfaces.
- Relacionar una descripción con una caja delimitadora.
- Generar explicaciones condicionadas por una imagen.
El grounding usa tokens especiales. El ejemplo oficial encierra la referencia entre <|ref|> y <|/ref|>; la respuesta puede incluir coordenadas entre <|det|> y <|/det|>. Para obtener una respuesta con localización y razonamiento, el README pide anteponer <|grounding|>. Las coordenadas deben transformarse y validarse con la utilidad oficial; no deben tratarse como píxeles sin revisar su escala.
Limitaciones que deben aparecer en un producto real
- Alucinaciones: puede mencionar objetos, texto o relaciones que no están presentes.
- Texto pequeño: recortes, compresión, ruido y resolución afectan al reconocimiento.
- Coordenadas: una caja puede ser aproximada o apuntar al elemento equivocado.
- Variación lingüística: los benchmarks publicados no garantizan igual calidad para todas las variedades del español.
- Razonamiento: una explicación convincente no prueba que la interpretación visual sea correcta.
- Seguridad: una imagen puede contener instrucciones, datos privados o contenido manipulado.
No utilices una respuesta sin verificación para diagnosticar una imagen médica, autenticar una identidad, decidir un crédito, interpretar una prueba jurídica o controlar maquinaria. En procesos de alto impacto, combina el modelo con validaciones específicas, registros de versión y revisión humana competente.
DeepSeek VL2 no es un identificador de la API alojada
La distinción entre pesos y API evita integraciones fallidas. deepseek-vl2-tiny, deepseek-vl2-small y deepseek-vl2 identifican repositorios de Hugging Face. La API oficial de DeepSeek no los acepta como valores de model; para visión alojada documenta deepseek-v4-flash-vision-exp.
| Familia | Identificador | Forma de acceso | Relación |
|---|---|---|---|
| DeepSeek VL2 | deepseek-vl2-tiny, deepseek-vl2-small, deepseek-vl2 | Pesos para despliegue propio | Familia local publicada en 2024, con contexto de 4.096 |
| V4 Flash Vision Exp | deepseek-v4-flash-vision-exp | API alojada y experimental | Familia V4 separada, con contexto de 1M y salida máxima de 384K |
Vision recibe imágenes como entrada y las factura como tokens de entrada. También admite Responses y el formato Anthropic, pero los bloques nativos de documento no están admitidos. Ninguna de estas propiedades debe trasladarse retrospectivamente a los checkpoints VL2 ni a sus benchmarks.
La aplicación oficial puede mostrar una función de visión, pero su interfaz no prueba que el backend utilice DeepSeek VL, VL2 o un ID concreto de la API. Las fuentes citadas no publican un mapeo estable entre cada función de la app y estos checkpoints. Comprueba cada canal por separado y no reutilices IDs entre pesos locales, la app y la API alojada.
Instalación local con el código oficial
El repositorio de VL2 requiere Python 3.8 o posterior y se instala como paquete editable. El ejemplo siguiente reproduce la ruta oficial de instalación; ejecútalo en un entorno aislado y revisa el repositorio antes de cargar código remoto.
git clone https://github.com/deepseek-ai/DeepSeek-VL2.git
cd DeepSeek-VL2
python -m venv .venv
source .venv/bin/activate
pip install -e .
El flujo de inferencia oficial crea DeepseekVLV2Processor, carga DeepseekVLV2ForCausalLM con AutoModelForCausalLM, convierte el modelo a BF16 y prepara las imágenes con load_pil_images. Para una primera prueba, establece:
model_path = "deepseek-ai/deepseek-vl2-tiny"
conversation = [
{
"role": "<|User|>",
"content": "<image>\nDescribe los elementos visibles sin inventar texto.",
"images": ["./imagen-de-prueba.jpg"],
},
{"role": "<|Assistant|>", "content": ""},
]
Este fragmento no es una API completa. Debes seguir el ejemplo íntegro del README para procesar imágenes, crear embeddings y generar la respuesta. Fija una revisión del repositorio en producción, valida extensiones y contenido real, limita dimensiones y no permitas que una ruta proporcionada por un usuario acceda a archivos arbitrarios. trust_remote_code=True ejecuta código del repositorio descargado; revisarlo y bloquear la versión es una medida de seguridad esencial.
Hardware y despliegue
El README indica que VL2 Tiny puede ejecutarse en una sola GPU con menos de 40 GB. Para VL2 Small, el ejemplo simple puede necesitar alrededor de 80 GB; si se usa una A100 de 40 GB, los autores proponen incremental prefilling con --chunk_size 512, advirtiendo que puede ser lento. El VL2 completo requiere más memoria que Small en ese flujo. Son referencias del código oficial, no compromisos de rendimiento.
La memoria real depende de precisión, número y resolución de imágenes, longitud del prompt, caché, salida y motor. Una cuantización creada por terceros puede reducir requisitos, pero introduce otra implementación y otra cadena de confianza. Verifica su autor, licencia, método de cuantización y degradación antes de incorporarla.
- Mide primero Tiny con imágenes representativas.
- Registra memoria máxima, latencia y calidad por categoría.
- Compara Small y VL2 únicamente en los errores relevantes.
- Prueba concurrencia, límites y recuperación de fallos.
- Separa el entorno de evaluación del servicio público.
Cómo evaluar VL2 para una aplicación
Crea un conjunto de imágenes que refleje tu distribución real, no solo ejemplos limpios. Incluye orientaciones distintas, baja luz, compresión, capturas pequeñas, tablas densas, fotografías parciales y casos donde la respuesta correcta sea “no se puede determinar”. Mantén ese conjunto separado de los prompts utilizados durante la configuración.
- Preguntas visuales: exactitud por tipo y tasa de respuestas no sustentadas.
- OCR: errores de caracteres, números, fórmulas y tablas.
- Grounding: intersección de cajas, objetos omitidos y falsas localizaciones.
- Robustez: cambios al recortar, redimensionar o alterar el prompt.
- Operación: memoria, latencia, rendimiento y coste de revisión humana.
Para casos empresariales, consulta las rutas de implementación y documenta quién valida las salidas, qué datos pueden cargarse y cómo se comunica la incertidumbre al usuario.
Privacidad y seguridad de imágenes
Una imagen puede revelar rostros, matrículas, direcciones, pantallas, historiales o metadatos. Un despliegue propio permite decidir dónde viaja la entrada, pero la privacidad depende de toda la arquitectura: interfaz, registros, almacenamiento, telemetría, copias, cuentas y proveedor de infraestructura.
- Elimina metadatos innecesarios y aplica minimización de datos.
- Rechaza formatos inesperados y limita píxeles, tamaño y páginas.
- Aísla decodificadores de imagen y mantén dependencias actualizadas.
- Controla acceso a originales, miniaturas y resultados.
- Define retención y borrado verificable.
- Revisa nuestras páginas de seguridad y privacidad antes de usar cualquier función del sitio.
Licencia del código y licencia de los modelos
Los repositorios oficiales de DeepSeek VL y VL2 separan LICENSE-CODE de LICENSE-MODEL. El código se publica bajo MIT. Los pesos se rigen por la DeepSeek Model License, que permite uso comercial según el README, pero incorpora obligaciones y restricciones de uso. No describas todos los archivos como “MIT” solo porque GitHub muestre esa etiqueta en la cabecera.
La licencia del modelo exige conservar avisos, trasladar determinadas restricciones a quienes reciben el modelo o derivados y cumplir las restricciones del anexo. También aclara que DeepSeek no concede automáticamente derechos sobre marcas, datos personales ni obras protegidas. Revisa el texto oficial y la revisión exacta antes de distribuir pesos, una imagen de contenedor o un modelo ajustado.
Preguntas frecuentes sobre DeepSeek VL
¿DeepSeek VL2 es una actualización de DeepSeek V4?
No. VL2 es una familia multimodal publicada en 2024, con contexto de 4.096 y pesos propios. V4 es una familia posterior de modelos generales de texto y razonamiento con otros tamaños, contexto y endpoints.
¿Existe un DeepSeek VL3 oficial?
En las fuentes oficiales de los repositorios revisadas el 23 de agosto de 2026, esta familia pública continúa siendo VL2 y no aparece un checkpoint oficial llamado DeepSeek VL3. El lanzamiento posterior de deepseek-v4-flash-vision-exp corresponde a la API alojada y no debe renombrarse como VL3.
¿Cuál es la diferencia entre Base y Chat?
La primera generación VL ofrece modelos Base preentrenados y modelos Chat ajustados para instrucciones. VL2 se distribuye como Tiny, Small y VL2 sin esa pareja Base/Chat en los IDs oficiales principales.
¿Puedo enviar una imagen a la API oficial usando deepseek-vl2?
No con ese identificador. deepseek-vl2 corresponde a pesos de Hugging Face y no es un valor admitido por la API alojada. Para enviar imágenes mediante la API actual, utiliza deepseek-v4-flash-vision-exp. Es un modelo experimental separado de VL2; los bloques nativos de documento no están admitidos en la compatibilidad Anthropic.
¿VL2 Tiny siempre es más rápido?
Tiene menos parámetros y suele ser más manejable, pero la velocidad depende también de resolución, número de imágenes, motor, precisión, hardware y longitud generada. Mídelo en tu entorno en lugar de prometer una latencia fija.
Fuentes oficiales
- Repositorio oficial de DeepSeek VL2.
- Ficha oficial de DeepSeek VL2.
- Pesos oficiales de DeepSeek VL2 Tiny.
- Informe técnico DeepSeek-VL2.
- Repositorio oficial de la primera familia DeepSeek VL.
- Informe técnico DeepSeek-VL.
- Licencia oficial de los modelos VL2.
- Actualizaciones oficiales de la API de DeepSeek.
- Guía oficial de Vision.
- Modelos y precios oficiales.
- Compatibilidad oficial con Anthropic.
