Última verificación documental y técnica: 5 de agosto de 2026. DeepSeek presentó la familia V4 el 24 de abril de 2026 y actualizó exclusivamente la API de Flash el 31 de julio. El identificador deepseek-v4-flash sirve ahora DeepSeek-V4-Flash-0731; deepseek-v4-pro y los modelos de la web y la app no cambiaron en esa actualización. Ambos modelos mantienen un contexto publicado de un millón de tokens, una salida máxima de 384K mediante Chat Completions y modos thinking y non-thinking.
Flash prioriza coste y concurrencia, pero la actualización 0731 también mejoró de forma importante sus capacidades de agente. Pro activa más parámetros, aunque eso no garantiza una ventaja en cada tarea. Esta guía separa las características confirmadas de la API, los resultados publicados por DeepSeek y las observaciones de nuestra prueba en español; ninguna de esas fuentes sustituye una evaluación con la carga real de cada proyecto.
Aviso de independencia: DeepSeek Español es un sitio independiente operado por Ahmed Aly. No pertenece a DeepSeek, no representa a la empresa y no está afiliado ni respaldado por ella. Las especificaciones y tarifas de esta página se han contrastado con las fuentes oficiales enlazadas.
Contenido de la guía
- Resumen de DeepSeek V4
- Actualización Flash-0731 y Responses API
- Diferencias entre Flash y Pro
- Contexto de 1M y salida de 384K
- Thinking Mode y parámetros de la API
- JSON, herramientas, Prefix y FIM
- Precios y concurrencia
- Migración de los alias anteriores
- Preguntas frecuentes
DeepSeek V4 en pocas palabras
| Característica | DeepSeek V4 Flash | DeepSeek V4 Pro |
|---|---|---|
| ID de API | deepseek-v4-flash | deepseek-v4-pro |
| Versión servida el 05/08/2026 | DeepSeek-V4-Flash-0731 | DeepSeek-V4-Pro |
| Responses API | Sí | No, según la documentación verificada el 05/08/2026 |
| Parámetros totales | 284B | 1,6T |
| Parámetros activados | 13B | 49B |
| Arquitectura | Mixture-of-Experts | Mixture-of-Experts |
| Contexto publicado | 1M tokens | 1M tokens |
| Salida máxima de Chat Completions | 384K tokens | 384K tokens |
| Thinking / non-thinking | Sí; thinking por defecto | Sí; thinking por defecto |
| JSON Output | Sí | Sí |
| Tool Calls | Sí | Sí |
| FIM Completion Beta | Según Models & Pricing, sí en non-thinking; la referencia de POST /completions no enumera Flash | Sí, en non-thinking |
| Concurrencia publicada por cuenta | 2.500 | 500 |
| Pesos abiertos | Publicados bajo licencia MIT | Publicados bajo licencia MIT |

Los parámetros totales y los activados no significan lo mismo. En una arquitectura Mixture-of-Experts, el modelo contiene muchos parámetros, pero utiliza una parte de ellos para procesar cada token. El total no permite predecir por sí solo la calidad, la latencia o el coste de una tarea concreta.
Qué cambió con DeepSeek-V4-Flash-0731
El 31 de julio de 2026, DeepSeek anunció la versión oficial de la API de Flash en beta pública. El nombre utilizado en las solicitudes no cambia: se sigue enviando deepseek-v4-flash. La versión servida pasó a ser DeepSeek-V4-Flash-0731. DeepSeek indica que conserva la misma arquitectura y tamaño de Flash Preview y que el cambio procede del postentrenamiento.
El anuncio afecta solo a la API de Flash. DeepSeek declaró que V4 Pro y los modelos de la web y la aplicación permanecieron sin cambios. La empresa publicó mejoras amplias en pruebas de agentes, pero esos resultados pertenecen al proveedor: no demuestran una superioridad universal ni sustituyen una comparación independiente con tareas, herramientas y criterios propios.
Responses API: soporte actual y límites
DeepSeek incorporó el formato Responses API con la misma base https://api.deepseek.com. A fecha de esta revisión, solo admite deepseek-v4-flash; deepseek-v4-pro todavía no está admitido en ese endpoint. La compatibilidad es parcial y sin estado: campos como previous_response_id, conversation, store, background y las entradas de imagen o archivo no ofrecen la misma funcionalidad que en la plataforma de OpenAI. Consulte la matriz oficial antes de migrar una integración.
Prueba independiente en español realizada el 5 de agosto
DeepSeek Español ejecutó 16 solicitudes reales mediante Chat Completions: cuatro tareas en español, dos modelos y dos ejecuciones independientes por combinación. Las 16 devolvieron HTTP 200 con finish_reason=stop. Hubo cumplimiento completo en 12 casos y parcial en cuatro; ambos modelos fallaron de la misma forma en la restricción de devolver exactamente dos frases. El tiempo medio de extremo a extremo observado fue de 1,714 s para Flash y 2,061 s para Pro.
Estos tiempos incluyen conexión, carga del servicio y ubicación de la sesión. No constituyen un benchmark general, no probaron thinking, Responses API, búsqueda web, archivos ni seguridad, y una ejecución posterior puede producir respuestas distintas. La metodología, los prompts exactos y los límites se publicaron también en la página principal de DeepSeek Español.

¿Qué es DeepSeek V4?
DeepSeek presentó V4 Preview como una familia de modelos de lenguaje MoE con dos tamaños. El anuncio oficial describe V4 Pro con 1,6 billones de parámetros totales y 49.000 millones activados, y V4 Flash con 284.000 millones totales y 13.000 millones activados. En ambos casos, la ventana de contexto publicada es de un millón de tokens.
La familia se lanzó como V4 Preview. Desde el 31 de julio, Flash dispone de una versión oficial de API en beta pública, mientras DeepSeek anunció que el lanzamiento oficial de Pro llegaría posteriormente. Los dos IDs siguen documentados para Chat Completions, pero el estado, las funciones y los límites no son idénticos y deben comprobarse antes de cada despliegue.
DeepSeek V4 Flash vs V4 Pro: diferencias prácticas
Cuándo empezar con V4 Flash
Flash ofrece las tarifas más bajas y el límite de concurrencia estándar más alto. Es la primera opción razonable para chats de gran volumen, clasificación, extracción, resúmenes, borradores, soporte interno y automatizaciones donde el coste y el tiempo de respuesta son prioritarios. Puede funcionar tanto con razonamiento como sin él: elegir Flash no obliga a desactivar thinking.
Cuándo evaluar V4 Pro
Pro activa 49B parámetros y sigue siendo una opción que merece evaluación en razonamiento, programación y flujos agentic. Sin embargo, DeepSeek publicó el 31 de julio resultados de agentes en los que Flash-0731 superó a V4-Pro-Preview. Son resultados del proveedor y no justifican elegir Flash o Pro sin una prueba propia, pero sí impiden asumir que Pro gana automáticamente por tamaño o precio.
Ninguno de los dos modelos garantiza exactitud. Empiece la evaluación con Flash-0731 y compare Pro con el mismo conjunto de casos cuando la complejidad o el riesgo lo justifiquen. Mida precisión, cumplimiento de formato, uso de herramientas, latencia, tokens y coste por resultado aceptado.
| Necesidad | Primera opción para probar | Por qué |
|---|---|---|
| Chat general de gran volumen | Flash non-thinking | Menor coste y respuesta directa |
| Extracción o clasificación en JSON | Flash non-thinking | JSON Output y menor precio |
| Razonamiento difícil | Flash y Pro, misma evaluación | El tamaño no predice por sí solo el resultado |
| Agente con varias herramientas | Flash-0731 primero; comparar Pro | Flash mejoró específicamente en tareas de agente |
| Resumen de documentos largos | Flash primero | Ambos admiten 1M; Flash reduce el coste |
| Programación compleja | Flash-0731 y Pro | Compare sobre repositorios y criterios propios |
Contexto de un millón de tokens y salida máxima de 384K
La tabla oficial publica una longitud de contexto de 1M y una salida máxima de 384K para Flash y Pro. El límite total de una solicitud sigue condicionado por la longitud de contexto: reservar una salida grande reduce el espacio práctico disponible para la entrada.
- No envíe el contexto completo si solo necesita unas secciones.
- Elimine duplicados, navegación y texto irrelevante antes de la llamada.
- Conserve títulos, fechas e identificadores que permitan verificar la respuesta.
- Mida la recuperación de información en distintas posiciones; una ventana grande no garantiza atención uniforme.
- No confunda contexto con búsqueda web ni con una base de conocimiento actualizada.
DeepSeek aplica Context Caching en disco con criterio best effort. Si un prefijo repetido produce un cache hit, esos tokens de entrada se facturan a una tarifa inferior; repetir texto no garantiza por sí mismo un hit. El diseño de privacidad y la retención de datos son cuestiones distintas del funcionamiento del caché.
Thinking Mode y parámetros: la distinción correcta
Los dos modelos usan thinking por defecto. En el formato OpenAI, el modo se controla con thinking.type; los valores documentados son enabled y disabled. Cuando thinking está activado, reasoning_effort admite high y max. DeepSeek indica que low y medium se mapean a high, mientras que xhigh se mapea a max.
Corrección importante:
presence_penaltyyfrequency_penaltyestán obsoletos y no tienen efecto en ningún modo. En cambio,temperatureytop_psiguen documentados para non-thinking, pero no tienen efecto cuando thinking está activado.

presence_penalty y frequency_penalty en la API; no es una restricción exclusiva de Thinking. Captura realizada el 22 de julio de 2026.| Parámetro | Non-thinking | Thinking |
|---|---|---|
thinking.type | disabled | enabled; valor predeterminado |
reasoning_effort | No aplica | high o max |
temperature | Admitido | Sin efecto |
top_p | Admitido; se recomienda ajustar este o temperature, no ambos | Sin efecto |
presence_penalty | Obsoleto; sin efecto | Obsoleto; sin efecto |
frequency_penalty | Obsoleto; sin efecto | Obsoleto; sin efecto |
Ejemplo non-thinking con V4 Flash
Este ejemplo usa temperature porque thinking está desactivado. La clave se mantiene en una variable de entorno y la llamada debe ejecutarse desde un servidor, nunca desde JavaScript público en el navegador.
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{
"role": "system",
"content": "Responde de forma clara en español."
},
{
"role": "user",
"content": "Resume este texto en tres puntos."
}
],
"thinking": {"type": "disabled"},
"temperature": 0.2,
"stream": false
}'
Ejemplo thinking con V4 Pro
Elimine presence_penalty y frequency_penalty en todos los modos porque están obsoletos y no tienen efecto. Cuando thinking esté activado, omita además temperature y top_p. En el SDK de OpenAI, DeepSeek documenta el objeto thinking dentro de extra_body.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "user",
"content": "Analiza los riesgos de este plan y propone controles."
}
],
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}}
)
print(response.choices[0].message.content)
La API devuelve el razonamiento en reasoning_content y la respuesta final en content. Si una ronda thinking incluye una llamada a herramienta, la documentación exige reenviar el reasoning_content completo en las solicitudes posteriores de esa interacción; omitirlo puede producir un error HTTP 400. No exponga automáticamente el razonamiento interno al usuario.
JSON Output, Tool Calls, Prefix Completion y FIM
JSON Output
Flash y Pro admiten response_format: {"type":"json_object"}. El prompt debe pedir explícitamente JSON y definir la estructura esperada. Aun así, la aplicación debe analizar la respuesta, validar tipos y campos, controlar finish_reason y rechazar valores que incumplan las reglas de negocio.
Tool Calls
Los dos modelos pueden proponer llamadas a funciones en thinking y non-thinking. El modelo solo genera el nombre y los argumentos de una herramienta: el servidor debe validar los datos, aplicar permisos, ejecutar la acción y devolver el resultado. No permita que una llamada propuesta ejecute compras, borrados o cambios sensibles sin autorización.
Chat Prefix Completion y FIM Completion
Chat Prefix Completion y FIM Completion están marcadas como funciones Beta. FIM utiliza la base https://api.deepseek.com/beta y el endpoint /completions, no el endpoint de Chat Completions. El endpoint FIM Beta admite como máximo 4K tokens de salida; el límite de 384K corresponde a Chat Completions y no debe aplicarse a solicitudes FIM.
Discrepancia documental comprobada de nuevo el 29 de julio de 2026: la tabla oficial Models & Pricing marca FIM non-thinking para deepseek-v4-flash y deepseek-v4-pro. Sin embargo, la referencia oficial de POST /completions solo enumera deepseek-v4-pro como valor admitido. Por esa razón, esta guía considera confirmado Pro y no afirma soporte concluyente de Flash hasta que DeepSeek unifique la documentación. Para una implementación de producción, use Pro y vuelva a comprobar el endpoint.
Consulte la guía de FIM Completion para ver la estructura prompt + suffix, las limitaciones Beta y un ejemplo separado de Chat Completions.
¿V4 acepta imágenes o documentos?
La API V4 documentada utiliza entrada textual. En la tabla de compatibilidad del formato Anthropic, los bloques image y document aparecen como no compatibles. No atribuya a V4 las capacidades de DeepSeek-OCR, DeepSeek-VL o de otros modelos como si pertenecieran al mismo endpoint.
Si una aplicación debe procesar un PDF o una imagen, necesita una canalización compatible para extraer o reconocer el texto y enviar solo el contenido necesario. Una URL o un nombre de archivo dentro de un mensaje no demuestra que el modelo haya recibido ni comprendido el documento.
Precios y concurrencia publicados para DeepSeek V4
Los importes están expresados en dólares estadounidenses por un millón de tokens. Son las tarifas base verificadas documentalmente el 5 de agosto de 2026 y pueden cambiar. Compruebe la tabla oficial antes de presupuestar un producto.
| Modelo | Entrada: cache hit | Entrada: cache miss | Salida | Concurrencia por cuenta |
|---|---|---|---|---|
| V4 Flash | US$0,0028 | US$0,14 | US$0,28 | 2.500 |
| V4 Pro | US$0,003625 | US$0,435 | US$0,87 | 500 |
Aviso sobre precios punta: DeepSeek anuncia que aplicará próximamente una política de horas punta con tarifas equivalentes al doble de las tarifas base para todos los conceptos, de 09:00 a 12:00 y de 14:00 a 18:00, hora de Pekín (UTC+8). La fecha de entrada en vigor todavía depende de un anuncio oficial; por eso esta página no aplica aún el multiplicador a los cálculos.

Una solicitud cuenta como conexión concurrente desde su envío hasta que termina la respuesta. Crear varias claves no multiplica el límite de la cuenta. Cuando se supera, la documentación indica que la API responde con HTTP 429. El coste real depende de los tokens de entrada y salida y de la proporción de cache hits, no solo del número de mensajes.
Para estimaciones con distintos volúmenes, consulte la guía de precios de DeepSeek API.
Casos de uso y criterios de evaluación
- Atención y autoservicio: empiece con Flash, limite las acciones de las herramientas y escale los casos inciertos.
- Extracción estructurada: utilice JSON Output, un esquema de validación y pruebas con documentos reales.
- Programación: compare Flash y Pro sobre repositorios y tareas propias; no extrapole un benchmark aislado.
- Agentes: registre cada llamada, valide los argumentos y aplique permisos mínimos.
- Contexto largo: mida recuperación, citas internas, coste y latencia a varias longitudes.
- Contenido en español: especifique país, público, registro y terminología; revise localización y hechos.
V4 puede recibir y generar texto en español, pero la documentación revisada no publica una certificación específica para español de España ni garantiza adaptación automática a cada variedad latinoamericana. Incluya ejemplos aprobados y revise fechas, monedas, citas, textos legales y decisiones de alto impacto.
Migración desde deepseek-chat y deepseek-reasoner
Estado documental a 29 de julio de 2026: DeepSeek anunció la retirada de deepseek-chat y deepseek-reasoner para el 24 de julio de 2026 a las 15:59 UTC. Las páginas operativas actuales solo enumeran deepseek-v4-flash y deepseek-v4-pro. No diseñe código nuevo que dependa de los aliases. Como no se realizó una llamada autenticada, no afirmamos qué respuesta o código de error devuelven hoy.
- Localice los alias antiguos en código, variables de entorno, paneles y pruebas.
- Sustitúyalos por
deepseek-v4-flashodeepseek-v4-pro. - Controle el modo con
thinking.type. - Elimine
presence_penaltyyfrequency_penalty; están obsoletos en todos los modos. - En thinking, elimine también
temperatureytop_pporque no tienen efecto. - Pruebe JSON, herramientas, streaming,
reasoning_content, consumo, latencia y errores 400/429. - Despliegue con posibilidad de reversión y supervise el ID devuelto en la respuesta.
Para una integración completa, consulte la guía de DeepSeek API en español y el tutorial para crear un chatbot con DeepSeek API.
Pesos abiertos y licencia MIT
DeepSeek publicó los pesos de V4 Flash y V4 Pro. Las fichas oficiales indican que el repositorio y los pesos están bajo licencia MIT. Eso no convierte automáticamente el servicio alojado, la marca DeepSeek, los datos de los usuarios ni cualquier otro material en recursos sin condiciones.
Ejecutar estos modelos por cuenta propia requiere infraestructura considerable, conversión o formatos compatibles, seguridad, observabilidad y experiencia operativa. La disponibilidad de pesos no significa que V4 Pro completo pueda ejecutarse de manera práctica en una GPU de consumo.
Limitaciones que deben explicarse al usuario
- Puede generar hechos falsos, referencias inexistentes o código inseguro.
- El contexto de 1M no garantiza recuperar correctamente todos los detalles.
- Thinking puede aumentar latencia y tokens de salida.
- JSON válido no equivale a datos correctos ni seguros.
- Tool Calls no ejecuta acciones por sí solo ni sustituye permisos y validaciones.
- Las funciones Preview o Beta, las tarifas y los límites pueden cambiar.
- No envíe contraseñas, claves API ni datos personales innecesarios.
Preguntas frecuentes sobre DeepSeek V4
¿DeepSeek V4 es un solo modelo?
No. V4 Preview incluye Flash y Pro. Sus IDs actuales en Chat Completions son deepseek-v4-flash y deepseek-v4-pro.
¿Flash admite razonamiento?
Sí. Flash y Pro admiten thinking y non-thinking. Thinking está activado por defecto en la API y se controla con thinking.type.
¿Presence penalty y frequency penalty funcionan sin thinking?
No. La referencia de Chat Completions marca ambos parámetros como obsoletos y sin efecto en cualquier modo. temperature y top_p sí están documentados para non-thinking, pero se ignoran en thinking.
¿Qué modelo cuesta menos?
V4 Flash tiene precios inferiores por token y mayor concurrencia publicada. Pro debe elegirse cuando pruebas representativas demuestren una mejora que justifique el coste adicional.
¿V4 acepta imágenes o PDF directamente?
No está documentado como entrada compatible en la API V4 descrita aquí. La compatibilidad Anthropic marca los bloques image y document como no compatibles. Para esos archivos, implemente una etapa compatible de extracción de texto.
¿FIM funciona con V4 Flash?
No lo afirmamos de forma concluyente. La tabla de modelos lo marca como disponible en Flash non-thinking, pero la referencia del endpoint solo enumera V4 Pro. Use Pro hasta que la documentación oficial sea coherente.
¿Deepseek-reasoner sigue siendo R1?
No debe presentarse como un ID actual de R1. DeepSeek documentó temporalmente deepseek-reasoner como ruta al modo thinking de V4 Flash y anunció su retirada para el 24 de julio de 2026. La documentación operativa actual ya no lo enumera; su respuesta efectiva no se probó con una clave válida.
¿Se pueden descargar los pesos de V4?
Sí. DeepSeek publicó los pesos de Flash y Pro bajo licencia MIT. El tamaño de los modelos exige revisar cuidadosamente hardware, formatos, inferencia, seguridad y coste operativo.
Fuentes oficiales consultadas
- Registro de cambios: actualización DeepSeek-V4-Flash-0731 del 31 de julio.
- Guía oficial de Responses API y matriz de compatibilidad.
- DeepSeek V4 Preview Release.
- DeepSeek Models & Pricing.
- Create Chat Completion: referencia de parámetros.
- DeepSeek Thinking Mode.
- Create FIM Completion (Beta).
- DeepSeek Chat Prefix Completion (Beta).
- DeepSeek JSON Output.
- DeepSeek Tool Calls.
- Rate Limit & Isolation.
- DeepSeek Context Caching.
- DeepSeek Anthropic API Compatibility.
- Ficha oficial de DeepSeek V4 Flash y licencia de los pesos.
- Ficha oficial de DeepSeek V4 Pro y licencia de los pesos.
