Última actualización documental: 24 de agosto de 2026. La familia actual incluye deepseek-v4-flash (DeepSeek-V4-Flash-0731), deepseek-v4-pro (DeepSeek-V4-Pro-0813, GA desde el 13 de agosto) y deepseek-v4-flash-vision-exp (experimental desde el 21 de agosto). Los tres modelos admiten 1 millón de tokens de contexto y hasta 384K tokens de salida.
Esta guía separa las capacidades oficiales vigentes de un benchmark propio de 120 solicitudes realizado el 10 de agosto de 2026. Esa prueba es anterior a Pro-0813 y a Vision Exp: se conserva sin recalcular sus resultados ni atribuirlos a los modelos actuales.
Aviso de independencia: DeepSeek Español es un sitio independiente operado por Ahmed Aly. No pertenece a DeepSeek, no representa a la empresa y no está afiliado ni respaldado por ella. Las especificaciones y tarifas de esta página se han contrastado con las fuentes oficiales enlazadas.
Contenido de la guía
- Resumen de DeepSeek V4
- Modelos actuales: Flash, Pro y Vision
- Benchmark en español: 120 solicitudes
- Diferencias entre Flash y Pro
- Contexto de 1M y salida de 384K
- Thinking Mode y parámetros de la API
- Compatibilidad, FIM, Vision y razonamiento
- Precios actuales
- Migración de los alias anteriores
- Preguntas frecuentes
DeepSeek V4 en pocas palabras
- Flash: modelo de texto rápido y económico; versión actual DeepSeek-V4-Flash-0731.
- Pro: modelo de texto DeepSeek-V4-Pro-0813, GA desde el 13 de agosto de 2026.
- Vision Exp: modelo experimental de texto e imágenes desde el 21 de agosto de 2026.
- Capacidad común: contexto de 1M, salida máxima de 384K, JSON, Tool Calls, Responses, Anthropic y Codex.
Captura histórica — 22 de julio de 2026. La imagen siguiente muestra la tabla de Flash y Pro publicada entonces. Es anterior a Pro-0813 y Vision Exp y no representa por sí sola el catálogo actual.

Modelos actuales de DeepSeek V4
| ID de API | Versión o estado | Entrada | Contexto | Salida máxima |
|---|---|---|---|---|
deepseek-v4-flash | DeepSeek-V4-Flash-0731 | Texto | 1M | 384K |
deepseek-v4-pro | DeepSeek-V4-Pro-0813; GA desde el 13 de agosto de 2026 | Texto | 1M | 384K |
deepseek-v4-flash-vision-exp | Experimental desde el 21 de agosto de 2026 | Texto e imágenes | 1M | 384K |
Los tres admiten JSON, Tool Calls, Responses API, la interfaz compatible con Anthropic y Codex. Pro-0813 sí admite Responses y Codex. Vision Exp admite texto e imágenes mediante Chat Completions, Responses, Anthropic y Codex; las imágenes se facturan como tokens de entrada.
deepseek-v4-flash-vision-exp es un modelo alojado independiente. No es un ID alternativo de OCR2 ni de VL2 y no sustituye retroactivamente a esos proyectos locales.
Consulta la guía de la API, la integración con Codex y la guía de Anthropic SDK para la configuración de cada interfaz.
Benchmark independiente de DeepSeek V4 en español
Benchmark histórico — 10 de agosto de 2026. Este bloque conserva los resultados de 120 solicitudes realizadas en esa fecha. La prueba es anterior a DeepSeek-V4-Pro-0813, cuya disponibilidad general comenzó el 13 de agosto, y no mide el Pro actual ni Vision Exp. Sus resultados y costes originales se mantienen sin recalcularlos con las tarifas de hoy.
El 10 de agosto de 2026, DeepSeek Español ejecutó 120 solicitudes reales mediante Chat Completions: cuatro fichas lingüísticas prescritas —España, México, Colombia y Argentina—, cinco tareas cerradas, dos modelos y tres repeticiones. Las 120 respuestas devolvieron HTTP 200. Se añadió un preflight separado de dos solicitudes para confirmar los IDs deepseek-v4-flash y deepseek-v4-pro.
El cumplimiento estricto fue del 65,00 % para Flash y del 66,67 % para Pro. La puntuación media de criterios fue 92,94 % y 93,56 %, respectivamente. La diferencia es pequeña: en las 20 celdas comparables de país y tarea hubo 14 empates, tres ventajas para Flash y tres para Pro. Esta muestra no respalda declarar un ganador universal.
| Métrica observada | V4 Flash | V4 Pro |
|---|---|---|
| Solicitudes principales | 60 | 60 |
| HTTP 200 | 60/60 | 60/60 |
| Cumplimiento estricto | 65,00 % | 66,67 % |
| Puntuación media de criterios | 92,94 % | 93,56 % |
| Latencia total p50 | 998 ms | 1.233 ms |
| Latencia total p95 | 1.252 ms | 1.765 ms |
| Tiempo al primer contenido p50 | 711 ms | 913 ms |
| Tokens totales | 11.027 | 10.992 |
| Coste calculado de 60 solicitudes | US$0,00177254 | US$0,005477085 |

Qué tareas superó cada modelo
| Tarea cerrada | Flash: cumplimiento estricto | Pro: cumplimiento estricto | Qué se comprobó |
|---|---|---|---|
| Adaptación regional | 25,00 % | 66,67 % | Dos oraciones, marcadores exigidos y ausencia de formas prohibidas |
| Recuperación exacta | 100 % | 66,67 % | Coincidencia exacta de ciudad, código y hora |
| Extracción JSON | 100 % | 100 % | JSON válido, claves y valores exactos, sin Markdown |
| Resumen de 24 palabras | 0 % | 0 % | Longitud exacta, una oración y cuatro hechos obligatorios |
| Política con contexto cerrado | 100 % | 100 % | Decisión, formato, longitud y frases obligatorias |
Los dos modelos conservaron todos los hechos obligatorios en los resúmenes, pero ninguno respetó el requisito de 24 palabras en las 12 ejecuciones de esa tarea. Pro cumplió mejor la adaptación regional prescrita; Flash conservó exactamente las mayúsculas y minúsculas de ciudad, código y hora en las 12 recuperaciones, mientras Pro convirtió cuatro ciudades a mayúsculas. No se penalizó la naturalidad de estilo: solo reglas binarias publicadas.

Metodología reproducible
- Diseño: 4 fichas lingüísticas × 5 tareas × 2 modelos × 3 repeticiones = 120 solicitudes.
- Configuración:
thinkingdesactivado, temperatura 0, streaming coninclude_usagey límites de salida de 50 a 150 tokens según la tarea. - Ejecución: secuencial, con el orden Flash/Pro alternado. No hubo reintentos en la muestra principal; un error habría contado como fallo.
- Evaluación: criterios binarios deterministas definidos antes de ejecutar; no se utilizó otro modelo como juez. Se comprobó formato, coincidencia exacta, JSON, conteo de palabras y presencia o ausencia de cadenas.
- Datos: todos los nombres, pedidos, políticas y registros de los prompts son ficticios. No se enviaron datos personales ni secretos.
- Caché: un identificador experimental único abrió cada mensaje de sistema. Se observaron 0 tokens de cache hit y 18.786 de cache miss; la prueba específica de Context Caching estudia el comportamiento con prefijos repetidos.
El coste de la muestra principal fue US$0,007249625, calculado con los campos de uso devueltos por la API y las tarifas oficiales verificadas el 10 de agosto. Los dos preflights añadieron un coste calculado de US$0,000042115. Son cálculos técnicos, no una verificación de factura.
Datos descargables y trazabilidad
La descarga incluye las 120 filas en CSV, resultados y criterios en JSON, análisis agregado, manifiesto, archivo LEEME y el evaluador utilizado. No contiene la clave API, cabeceras de autenticación ni identificadores de respuesta.
SHA-256 del ZIP: 8B84D90DBBB5BD014EE437AF2788AEDB9E87DD132430089E929FACC628D8C708. Tamaño: 49.143 bytes.
Límites de la prueba
- No es una prueba geográfica: todas las solicitudes salieron de una sola sesión, no desde cuatro países.
- Las fichas regionales son reglas experimentales explícitas; no definen una única forma correcta de hablar en cada país ni miden naturalidad cultural completa.
- Las cinco tareas son sintéticas y cerradas. Tres repeticiones por combinación describen esta muestra, pero no ofrecen significación estadística fuerte ni cubren todos los usos.
- No se probaron thinking, búsqueda web, visión, herramientas, seguridad integral, contexto de un millón de tokens, chat web ni aplicaciones.
- La latencia depende de red, carga, ubicación y momento. Una ejecución futura o una versión distinta puede producir otros resultados.
- La puntuación automatizable no evalúa elegancia, utilidad subjetiva, sesgos implícitos ni exactitud fuera del contexto proporcionado.
El test anterior de 16 solicitudes sigue documentado en la página principal de DeepSeek Español como registro histórico. El benchmark de 120 solicitudes amplía aquella muestra, pero también es histórico: no demuestra cómo elegir entre Flash y DeepSeek-V4-Pro-0813. Para comparar los modelos actuales se necesita una prueba nueva, emparejada y ejecutada bajo las mismas condiciones.
¿Qué es DeepSeek V4?
DeepSeek presentó V4 Preview como una familia de modelos de lenguaje MoE con dos tamaños. El anuncio oficial describe V4 Pro con 1,6 billones de parámetros totales y 49.000 millones activados, y V4 Flash con 284.000 millones totales y 13.000 millones activados. En ambos casos, la ventana de contexto publicada es de un millón de tokens.
La familia se lanzó como V4 Preview. Flash sirve actualmente DeepSeek-V4-Flash-0731; Pro sirve DeepSeek-V4-Pro-0813 y está disponible de forma general desde el 13 de agosto de 2026; Vision Exp está disponible de forma experimental desde el 21 de agosto. Comprueba el ID, el estado y la modalidad antes de cada despliegue.
DeepSeek V4 Flash vs V4 Pro: diferencias prácticas
Cuándo empezar con V4 Flash
Flash ofrece las tarifas más bajas. Según la tabla oficial de concurrencia revisada el 24 de agosto de 2026, Flash y Vision Exp comparten el límite estándar más alto, con 2500 solicitudes concurrentes por cuenta; Pro tiene 500. Flash es una primera opción razonable para chats de gran volumen, clasificación, extracción, resúmenes, borradores, soporte interno y automatizaciones donde el coste y el tiempo de respuesta son prioritarios. Puede funcionar tanto con razonamiento como sin él: elegir Flash no obliga a desactivar thinking.
Cuándo evaluar V4 Pro
Pro activa 49B parámetros y sigue siendo una opción que merece evaluación en razonamiento, programación y flujos agentic. Sin embargo, DeepSeek publicó el 31 de julio resultados de agentes en los que Flash-0731 superó a V4-Pro-Preview. Son resultados del proveedor y no justifican elegir Flash o Pro sin una prueba propia, pero sí impiden asumir que Pro gana automáticamente por tamaño o precio.
Ninguno de los dos modelos garantiza exactitud. Empiece la evaluación con Flash-0731 y compare Pro con el mismo conjunto de casos cuando la complejidad o el riesgo lo justifiquen. Mida precisión, cumplimiento de formato, uso de herramientas, latencia, tokens y coste por resultado aceptado.
| Necesidad | Primera opción para probar | Por qué |
|---|---|---|
| Chat general de gran volumen | Flash non-thinking | Menor coste y respuesta directa |
| Extracción o clasificación en JSON | Flash non-thinking | JSON Output y menor precio |
| Razonamiento difícil | Flash y Pro, misma evaluación | El tamaño no predice por sí solo el resultado |
| Agente con varias herramientas | Flash-0731 primero; comparar Pro | Flash mejoró específicamente en tareas de agente |
| Resumen de documentos largos | Flash primero | Ambos admiten 1M; Flash reduce el coste |
| Programación compleja | Flash-0731 y Pro | Compare sobre repositorios y criterios propios |
Contexto de un millón de tokens y salida máxima de 384K
La tabla oficial publica una longitud de contexto de 1M y una salida máxima de 384K para Flash y Pro. El límite total de una solicitud sigue condicionado por la longitud de contexto: reservar una salida grande reduce el espacio práctico disponible para la entrada.
- No envíe el contexto completo si solo necesita unas secciones.
- Elimine duplicados, navegación y texto irrelevante antes de la llamada.
- Conserve títulos, fechas e identificadores que permitan verificar la respuesta.
- Mida la recuperación de información en distintas posiciones; una ventana grande no garantiza atención uniforme.
- No confunda contexto con búsqueda web ni con una base de conocimiento actualizada.
DeepSeek aplica Context Caching en disco con criterio best effort. Si un prefijo repetido produce un cache hit, esos tokens de entrada se facturan a una tarifa inferior; repetir texto no garantiza por sí mismo un hit. El diseño de privacidad y la retención de datos son cuestiones distintas del funcionamiento del caché.
Thinking Mode y niveles de razonamiento
Flash, Pro y Vision Exp admiten los niveles nativos low, high y max. El nivel modifica el esfuerzo de razonamiento y puede afectar la longitud de la salida; no crea una tarifa unitaria distinta, aunque más tokens de salida pueden elevar el coste total.
| Valor solicitado | Nivel aplicado |
|---|---|
low | low |
medium | high |
high | high |
xhigh | high |
max | max |
En Codex, medium y xhigh se normalizan a high. No los presentes como niveles nativos adicionales de DeepSeek.

presence_penalty y frequency_penalty.Compatibilidad, FIM, Vision y razonamiento
| Función | Flash | Pro | Vision Exp |
|---|---|---|---|
| JSON y Tool Calls | Sí | Sí | Sí |
| Responses API | Sí | Sí | Sí |
| Anthropic | Sí | Sí | Sí |
| Codex | Sí | Sí | Sí |
| Entrada de imágenes | No | No | Sí |
| FIM | Sí, solo non-thinking | Sí, solo non-thinking | No |
JSON y Tool Calls
Los tres modelos pueden producir JSON y proponer llamadas a herramientas. La aplicación debe validar los argumentos, aplicar permisos y ejecutar cada acción en el servidor; una propuesta del modelo no autoriza compras, borrados ni cambios sensibles.
FIM
FIM está disponible en modo non-thinking con los dos modelos de texto, Flash y Pro. Vision Exp no admite FIM. No presentes FIM como una función del modo de razonamiento.
Imágenes y documentos
Vision Exp acepta texto e imágenes; Flash y Pro son modelos de texto. En la interfaz Anthropic, los bloques image requieren Vision Exp y los bloques document no están admitidos. Las imágenes cuentan como tokens de entrada.
Niveles de razonamiento
Los niveles nativos actuales son low, high y max. Cuando un cliente utiliza una escala más amplia, el mapeo es: low → low, medium → high, high → high, xhigh → high y max → max.
Precios actuales de DeepSeek V4
| Modelo | Período | Cache hit | Cache miss | Salida |
|---|---|---|---|---|
| Flash / Vision Exp | Off-peak | $0.007 | $0.22 | $0.66 |
| Flash / Vision Exp | Peak | $0.014 | $0.44 | $1.32 |
| Pro | Off-peak | $0.022 | $0.66 | $1.98 |
| Pro | Peak | $0.044 | $1.32 | $3.96 |
En días laborables, peak corresponde a 01:00–04:00 y 06:00–10:00 UTC; el resto es off-peak. Desde el 23 de agosto de 2026, los sábados y domingos según la hora de Pekín son off-peak durante todo el día. Consulta la página de precios y su calculadora antes de presupuestar.
Captura histórica — 22 de julio de 2026. La imagen siguiente conserva los precios y límites publicados en esa fecha. No representa las tarifas actuales y no se ha recalculado.

Casos de uso y criterios de evaluación
- Atención y autoservicio: empiece con Flash, limite las acciones de las herramientas y escale los casos inciertos.
- Extracción estructurada: utilice JSON Output, un esquema de validación y pruebas con documentos reales.
- Programación: compare Flash y Pro sobre repositorios y tareas propias; no extrapole un benchmark aislado.
- Agentes: registre cada llamada, valide los argumentos y aplique permisos mínimos.
- Contexto largo: mida recuperación, citas internas, coste y latencia a varias longitudes.
- Contenido en español: especifique país, público, registro y terminología; revise localización y hechos.
V4 puede recibir y generar texto en español, pero la documentación revisada no publica una certificación específica para español de España ni garantiza adaptación automática a cada variedad latinoamericana. Incluya ejemplos aprobados y revise fechas, monedas, citas, textos legales y decisiones de alto impacto.
Migración desde deepseek-chat y deepseek-reasoner
Registro histórico a 10 de agosto de 2026: DeepSeek había anunciado la retirada de deepseek-chat y deepseek-reasoner para el 24 de julio. El benchmark no llamó a esos aliases, por lo que no atribuye una respuesta o código de error. La documentación vigente enumera deepseek-v4-flash, deepseek-v4-pro y deepseek-v4-flash-vision-exp; no diseñes código nuevo que dependa de los aliases retirados.
- Localice los alias antiguos en código, variables de entorno, paneles y pruebas.
- Sustitúyalos por
deepseek-v4-flashodeepseek-v4-pro. - Controle el modo con
thinking.type. - Elimine
presence_penaltyyfrequency_penalty; están obsoletos en todos los modos. - En thinking, elimine también
temperatureytop_pporque no tienen efecto. - Pruebe JSON, herramientas, streaming,
reasoning_content, consumo, latencia y errores 400/429. - Despliegue con posibilidad de reversión y supervise el ID devuelto en la respuesta.
Para una integración completa, consulte la guía de DeepSeek API en español y el tutorial para crear un chatbot con DeepSeek API.
Pesos abiertos y licencia MIT
DeepSeek publicó los pesos de V4 Flash y V4 Pro. Las fichas oficiales indican que el repositorio y los pesos están bajo licencia MIT. Eso no convierte automáticamente el servicio alojado, la marca DeepSeek, los datos de los usuarios ni cualquier otro material en recursos sin condiciones.
Ejecutar estos modelos por cuenta propia requiere infraestructura considerable, conversión o formatos compatibles, seguridad, observabilidad y experiencia operativa. La disponibilidad de pesos no significa que V4 Pro completo pueda ejecutarse de manera práctica en una GPU de consumo.
Limitaciones que deben explicarse al usuario
- Puede generar hechos falsos, referencias inexistentes o código inseguro.
- El contexto de 1M no garantiza recuperar correctamente todos los detalles.
- Thinking puede aumentar latencia y tokens de salida.
- JSON válido no equivale a datos correctos ni seguros.
- Tool Calls no ejecuta acciones por sí solo ni sustituye permisos y validaciones.
- Las funciones Preview o Beta, las tarifas y los límites pueden cambiar.
- No envíe contraseñas, claves API ni datos personales innecesarios.
Preguntas frecuentes sobre DeepSeek V4
¿DeepSeek V4 es un solo modelo?
No. La familia actual incluye deepseek-v4-flash, deepseek-v4-pro y el modelo experimental deepseek-v4-flash-vision-exp.
¿Flash admite razonamiento?
Sí. Flash y Pro admiten thinking y non-thinking. Thinking está activado por defecto en la API y se controla con thinking.type.
¿Presence penalty y frequency penalty funcionan sin thinking?
No. La referencia de Chat Completions marca ambos parámetros como obsoletos y sin efecto en cualquier modo. temperature y top_p sí están documentados para non-thinking, pero se ignoran en thinking.
¿Qué modelo cuesta menos?
V4 Flash tiene precios inferiores por token y mayor concurrencia publicada. Pro debe elegirse cuando pruebas representativas demuestren una mejora que justifique el coste adicional.
¿V4 acepta imágenes o PDF directamente?
Las imágenes están admitidas únicamente con deepseek-v4-flash-vision-exp. Flash y Pro son modelos de texto. En la interfaz Anthropic, el tipo document no está admitido.
¿FIM funciona con V4 Flash?
Sí, en modo non-thinking. FIM también está disponible con Pro en non-thinking; Vision Exp no lo admite.
¿Deepseek-reasoner sigue siendo R1?
No debe presentarse como un ID actual de R1. DeepSeek documentó temporalmente deepseek-reasoner como ruta al modo thinking de V4 Flash y anunció su retirada para el 24 de julio de 2026. La documentación operativa actual ya no lo enumera; su respuesta efectiva no se probó con una clave válida.
¿Se pueden descargar los pesos de V4?
Sí. DeepSeek publicó los pesos de Flash y Pro bajo licencia MIT. El tamaño de los modelos exige revisar cuidadosamente hardware, formatos, inferencia, seguridad y coste operativo.
Fuentes oficiales consultadas
Especificaciones vigentes revisadas el 24 de agosto de 2026. El benchmark del 10 de agosto conserva sus fuentes, condiciones, resultados y costes originales.
- Actualizaciones de DeepSeek API.
- Modelos y precios.
- Vision.
- Thinking Mode.
- Responses API.
- Interfaz Anthropic.
- Integración con Codex.
Registro de actualización
23 de agosto de 2026: se añadió Vision Exp; se corrigió la compatibilidad de Pro con Responses y Codex; se actualizaron FIM, razonamiento y precios. El benchmark del 10 de agosto se conserva como registro histórico sin atribuirlo al Pro actual.
