DeepSeek V4: Flash 0731, Pro, precios y API

Última verificación documental y técnica: 5 de agosto de 2026. DeepSeek presentó la familia V4 el 24 de abril de 2026 y actualizó exclusivamente la API de Flash el 31 de julio. El identificador deepseek-v4-flash sirve ahora DeepSeek-V4-Flash-0731; deepseek-v4-pro y los modelos de la web y la app no cambiaron en esa actualización. Ambos modelos mantienen un contexto publicado de un millón de tokens, una salida máxima de 384K mediante Chat Completions y modos thinking y non-thinking.

Flash prioriza coste y concurrencia, pero la actualización 0731 también mejoró de forma importante sus capacidades de agente. Pro activa más parámetros, aunque eso no garantiza una ventaja en cada tarea. Esta guía separa las características confirmadas de la API, los resultados publicados por DeepSeek y las observaciones de nuestra prueba en español; ninguna de esas fuentes sustituye una evaluación con la carga real de cada proyecto.

Aviso de independencia: DeepSeek Español es un sitio independiente operado por Ahmed Aly. No pertenece a DeepSeek, no representa a la empresa y no está afiliado ni respaldado por ella. Las especificaciones y tarifas de esta página se han contrastado con las fuentes oficiales enlazadas.

Contenido de la guía

DeepSeek V4 en pocas palabras

CaracterísticaDeepSeek V4 FlashDeepSeek V4 Pro
ID de APIdeepseek-v4-flashdeepseek-v4-pro
Versión servida el 05/08/2026DeepSeek-V4-Flash-0731DeepSeek-V4-Pro
Responses APINo, según la documentación verificada el 05/08/2026
Parámetros totales284B1,6T
Parámetros activados13B49B
ArquitecturaMixture-of-ExpertsMixture-of-Experts
Contexto publicado1M tokens1M tokens
Salida máxima de Chat Completions384K tokens384K tokens
Thinking / non-thinkingSí; thinking por defectoSí; thinking por defecto
JSON Output
Tool Calls
FIM Completion BetaSegún Models & Pricing, sí en non-thinking; la referencia de POST /completions no enumera FlashSí, en non-thinking
Concurrencia publicada por cuenta2.500500
Pesos abiertosPublicados bajo licencia MITPublicados bajo licencia MIT
Especificaciones contrastadas con el anuncio, la tabla de modelos, la referencia de la API y las fichas oficiales de los pesos. Los límites y precios pueden cambiar.
Tabla oficial de DeepSeek V4 Flash y Pro con contexto de un millón y salida máxima de 384K tokens

Los parámetros totales y los activados no significan lo mismo. En una arquitectura Mixture-of-Experts, el modelo contiene muchos parámetros, pero utiliza una parte de ellos para procesar cada token. El total no permite predecir por sí solo la calidad, la latencia o el coste de una tarea concreta.

Qué cambió con DeepSeek-V4-Flash-0731

El 31 de julio de 2026, DeepSeek anunció la versión oficial de la API de Flash en beta pública. El nombre utilizado en las solicitudes no cambia: se sigue enviando deepseek-v4-flash. La versión servida pasó a ser DeepSeek-V4-Flash-0731. DeepSeek indica que conserva la misma arquitectura y tamaño de Flash Preview y que el cambio procede del postentrenamiento.

El anuncio afecta solo a la API de Flash. DeepSeek declaró que V4 Pro y los modelos de la web y la aplicación permanecieron sin cambios. La empresa publicó mejoras amplias en pruebas de agentes, pero esos resultados pertenecen al proveedor: no demuestran una superioridad universal ni sustituyen una comparación independiente con tareas, herramientas y criterios propios.

Responses API: soporte actual y límites

DeepSeek incorporó el formato Responses API con la misma base https://api.deepseek.com. A fecha de esta revisión, solo admite deepseek-v4-flash; deepseek-v4-pro todavía no está admitido en ese endpoint. La compatibilidad es parcial y sin estado: campos como previous_response_id, conversation, store, background y las entradas de imagen o archivo no ofrecen la misma funcionalidad que en la plataforma de OpenAI. Consulte la matriz oficial antes de migrar una integración.

Prueba independiente en español realizada el 5 de agosto

DeepSeek Español ejecutó 16 solicitudes reales mediante Chat Completions: cuatro tareas en español, dos modelos y dos ejecuciones independientes por combinación. Las 16 devolvieron HTTP 200 con finish_reason=stop. Hubo cumplimiento completo en 12 casos y parcial en cuatro; ambos modelos fallaron de la misma forma en la restricción de devolver exactamente dos frases. El tiempo medio de extremo a extremo observado fue de 1,714 s para Flash y 2,061 s para Pro.

Estos tiempos incluyen conexión, carga del servicio y ubicación de la sesión. No constituyen un benchmark general, no probaron thinking, Responses API, búsqueda web, archivos ni seguridad, y una ejecución posterior puede producir respuestas distintas. La metodología, los prompts exactos y los límites se publicaron también en la página principal de DeepSeek Español.

Resultados de 16 solicitudes reales en español con DeepSeek V4 Flash y V4 Pro
Resultados observados el 5 de agosto de 2026. Prueba acotada y reproducible; no representa todas las tareas ni condiciones de uso.

¿Qué es DeepSeek V4?

DeepSeek presentó V4 Preview como una familia de modelos de lenguaje MoE con dos tamaños. El anuncio oficial describe V4 Pro con 1,6 billones de parámetros totales y 49.000 millones activados, y V4 Flash con 284.000 millones totales y 13.000 millones activados. En ambos casos, la ventana de contexto publicada es de un millón de tokens.

La familia se lanzó como V4 Preview. Desde el 31 de julio, Flash dispone de una versión oficial de API en beta pública, mientras DeepSeek anunció que el lanzamiento oficial de Pro llegaría posteriormente. Los dos IDs siguen documentados para Chat Completions, pero el estado, las funciones y los límites no son idénticos y deben comprobarse antes de cada despliegue.

DeepSeek V4 Flash vs V4 Pro: diferencias prácticas

Cuándo empezar con V4 Flash

Flash ofrece las tarifas más bajas y el límite de concurrencia estándar más alto. Es la primera opción razonable para chats de gran volumen, clasificación, extracción, resúmenes, borradores, soporte interno y automatizaciones donde el coste y el tiempo de respuesta son prioritarios. Puede funcionar tanto con razonamiento como sin él: elegir Flash no obliga a desactivar thinking.

Cuándo evaluar V4 Pro

Pro activa 49B parámetros y sigue siendo una opción que merece evaluación en razonamiento, programación y flujos agentic. Sin embargo, DeepSeek publicó el 31 de julio resultados de agentes en los que Flash-0731 superó a V4-Pro-Preview. Son resultados del proveedor y no justifican elegir Flash o Pro sin una prueba propia, pero sí impiden asumir que Pro gana automáticamente por tamaño o precio.

Ninguno de los dos modelos garantiza exactitud. Empiece la evaluación con Flash-0731 y compare Pro con el mismo conjunto de casos cuando la complejidad o el riesgo lo justifiquen. Mida precisión, cumplimiento de formato, uso de herramientas, latencia, tokens y coste por resultado aceptado.

NecesidadPrimera opción para probarPor qué
Chat general de gran volumenFlash non-thinkingMenor coste y respuesta directa
Extracción o clasificación en JSONFlash non-thinkingJSON Output y menor precio
Razonamiento difícilFlash y Pro, misma evaluaciónEl tamaño no predice por sí solo el resultado
Agente con varias herramientasFlash-0731 primero; comparar ProFlash mejoró específicamente en tareas de agente
Resumen de documentos largosFlash primeroAmbos admiten 1M; Flash reduce el coste
Programación complejaFlash-0731 y ProCompare sobre repositorios y criterios propios
Orientación para diseñar pruebas, no promesa de rendimiento.

Contexto de un millón de tokens y salida máxima de 384K

La tabla oficial publica una longitud de contexto de 1M y una salida máxima de 384K para Flash y Pro. El límite total de una solicitud sigue condicionado por la longitud de contexto: reservar una salida grande reduce el espacio práctico disponible para la entrada.

  • No envíe el contexto completo si solo necesita unas secciones.
  • Elimine duplicados, navegación y texto irrelevante antes de la llamada.
  • Conserve títulos, fechas e identificadores que permitan verificar la respuesta.
  • Mida la recuperación de información en distintas posiciones; una ventana grande no garantiza atención uniforme.
  • No confunda contexto con búsqueda web ni con una base de conocimiento actualizada.

DeepSeek aplica Context Caching en disco con criterio best effort. Si un prefijo repetido produce un cache hit, esos tokens de entrada se facturan a una tarifa inferior; repetir texto no garantiza por sí mismo un hit. El diseño de privacidad y la retención de datos son cuestiones distintas del funcionamiento del caché.

Thinking Mode y parámetros: la distinción correcta

Los dos modelos usan thinking por defecto. En el formato OpenAI, el modo se controla con thinking.type; los valores documentados son enabled y disabled. Cuando thinking está activado, reasoning_effort admite high y max. DeepSeek indica que low y medium se mapean a high, mientras que xhigh se mapea a max.

Corrección importante: presence_penalty y frequency_penalty están obsoletos y no tienen efecto en ningún modo. En cambio, temperature y top_p siguen documentados para non-thinking, pero no tienen efecto cuando thinking está activado.

Referencia oficial de DeepSeek que declara obsoletos presence_penalty y frequency_penalty
La referencia general de Chat Completions declara obsoletos y sin efecto presence_penalty y frequency_penalty en la API; no es una restricción exclusiva de Thinking. Captura realizada el 22 de julio de 2026.
ParámetroNon-thinkingThinking
thinking.typedisabledenabled; valor predeterminado
reasoning_effortNo aplicahigh o max
temperatureAdmitidoSin efecto
top_pAdmitido; se recomienda ajustar este o temperature, no ambosSin efecto
presence_penaltyObsoleto; sin efectoObsoleto; sin efecto
frequency_penaltyObsoleto; sin efectoObsoleto; sin efecto

Ejemplo non-thinking con V4 Flash

Este ejemplo usa temperature porque thinking está desactivado. La clave se mantiene en una variable de entorno y la llamada debe ejecutarse desde un servidor, nunca desde JavaScript público en el navegador.

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {
        "role": "system",
        "content": "Responde de forma clara en español."
      },
      {
        "role": "user",
        "content": "Resume este texto en tres puntos."
      }
    ],
    "thinking": {"type": "disabled"},
    "temperature": 0.2,
    "stream": false
  }'

Ejemplo thinking con V4 Pro

Elimine presence_penalty y frequency_penalty en todos los modos porque están obsoletos y no tienen efecto. Cuando thinking esté activado, omita además temperature y top_p. En el SDK de OpenAI, DeepSeek documenta el objeto thinking dentro de extra_body.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {
            "role": "user",
            "content": "Analiza los riesgos de este plan y propone controles."
        }
    ],
    reasoning_effort="high",
    extra_body={"thinking": {"type": "enabled"}}
)

print(response.choices[0].message.content)

La API devuelve el razonamiento en reasoning_content y la respuesta final en content. Si una ronda thinking incluye una llamada a herramienta, la documentación exige reenviar el reasoning_content completo en las solicitudes posteriores de esa interacción; omitirlo puede producir un error HTTP 400. No exponga automáticamente el razonamiento interno al usuario.

JSON Output, Tool Calls, Prefix Completion y FIM

JSON Output

Flash y Pro admiten response_format: {"type":"json_object"}. El prompt debe pedir explícitamente JSON y definir la estructura esperada. Aun así, la aplicación debe analizar la respuesta, validar tipos y campos, controlar finish_reason y rechazar valores que incumplan las reglas de negocio.

Tool Calls

Los dos modelos pueden proponer llamadas a funciones en thinking y non-thinking. El modelo solo genera el nombre y los argumentos de una herramienta: el servidor debe validar los datos, aplicar permisos, ejecutar la acción y devolver el resultado. No permita que una llamada propuesta ejecute compras, borrados o cambios sensibles sin autorización.

Chat Prefix Completion y FIM Completion

Chat Prefix Completion y FIM Completion están marcadas como funciones Beta. FIM utiliza la base https://api.deepseek.com/beta y el endpoint /completions, no el endpoint de Chat Completions. El endpoint FIM Beta admite como máximo 4K tokens de salida; el límite de 384K corresponde a Chat Completions y no debe aplicarse a solicitudes FIM.

Discrepancia documental comprobada de nuevo el 29 de julio de 2026: la tabla oficial Models & Pricing marca FIM non-thinking para deepseek-v4-flash y deepseek-v4-pro. Sin embargo, la referencia oficial de POST /completions solo enumera deepseek-v4-pro como valor admitido. Por esa razón, esta guía considera confirmado Pro y no afirma soporte concluyente de Flash hasta que DeepSeek unifique la documentación. Para una implementación de producción, use Pro y vuelva a comprobar el endpoint.

Consulte la guía de FIM Completion para ver la estructura prompt + suffix, las limitaciones Beta y un ejemplo separado de Chat Completions.

¿V4 acepta imágenes o documentos?

La API V4 documentada utiliza entrada textual. En la tabla de compatibilidad del formato Anthropic, los bloques image y document aparecen como no compatibles. No atribuya a V4 las capacidades de DeepSeek-OCR, DeepSeek-VL o de otros modelos como si pertenecieran al mismo endpoint.

Si una aplicación debe procesar un PDF o una imagen, necesita una canalización compatible para extraer o reconocer el texto y enviar solo el contenido necesario. Una URL o un nombre de archivo dentro de un mensaje no demuestra que el modelo haya recibido ni comprendido el documento.

Precios y concurrencia publicados para DeepSeek V4

Los importes están expresados en dólares estadounidenses por un millón de tokens. Son las tarifas base verificadas documentalmente el 5 de agosto de 2026 y pueden cambiar. Compruebe la tabla oficial antes de presupuestar un producto.

ModeloEntrada: cache hitEntrada: cache missSalidaConcurrencia por cuenta
V4 FlashUS$0,0028US$0,14US$0,282.500
V4 ProUS$0,003625US$0,435US$0,87500
Precios por 1M tokens. La concurrencia se calcula a nivel de cuenta, no por clave API.

Aviso sobre precios punta: DeepSeek anuncia que aplicará próximamente una política de horas punta con tarifas equivalentes al doble de las tarifas base para todos los conceptos, de 09:00 a 12:00 y de 14:00 a 18:00, hora de Pekín (UTC+8). La fecha de entrada en vigor todavía depende de un anuncio oficial; por eso esta página no aplica aún el multiplicador a los cálculos.

Tabla oficial de precios y concurrencia de DeepSeek V4 Flash y Pro
Tarifas por 1M tokens, límites de concurrencia y aviso de retirada de los aliases anteriores según la tabla oficial. Captura realizada el 22 de julio de 2026; compruebe la fuente antes de presupuestar.

Una solicitud cuenta como conexión concurrente desde su envío hasta que termina la respuesta. Crear varias claves no multiplica el límite de la cuenta. Cuando se supera, la documentación indica que la API responde con HTTP 429. El coste real depende de los tokens de entrada y salida y de la proporción de cache hits, no solo del número de mensajes.

Para estimaciones con distintos volúmenes, consulte la guía de precios de DeepSeek API.

Casos de uso y criterios de evaluación

  • Atención y autoservicio: empiece con Flash, limite las acciones de las herramientas y escale los casos inciertos.
  • Extracción estructurada: utilice JSON Output, un esquema de validación y pruebas con documentos reales.
  • Programación: compare Flash y Pro sobre repositorios y tareas propias; no extrapole un benchmark aislado.
  • Agentes: registre cada llamada, valide los argumentos y aplique permisos mínimos.
  • Contexto largo: mida recuperación, citas internas, coste y latencia a varias longitudes.
  • Contenido en español: especifique país, público, registro y terminología; revise localización y hechos.

V4 puede recibir y generar texto en español, pero la documentación revisada no publica una certificación específica para español de España ni garantiza adaptación automática a cada variedad latinoamericana. Incluya ejemplos aprobados y revise fechas, monedas, citas, textos legales y decisiones de alto impacto.

Migración desde deepseek-chat y deepseek-reasoner

Estado documental a 29 de julio de 2026: DeepSeek anunció la retirada de deepseek-chat y deepseek-reasoner para el 24 de julio de 2026 a las 15:59 UTC. Las páginas operativas actuales solo enumeran deepseek-v4-flash y deepseek-v4-pro. No diseñe código nuevo que dependa de los aliases. Como no se realizó una llamada autenticada, no afirmamos qué respuesta o código de error devuelven hoy.

  1. Localice los alias antiguos en código, variables de entorno, paneles y pruebas.
  2. Sustitúyalos por deepseek-v4-flash o deepseek-v4-pro.
  3. Controle el modo con thinking.type.
  4. Elimine presence_penalty y frequency_penalty; están obsoletos en todos los modos.
  5. En thinking, elimine también temperature y top_p porque no tienen efecto.
  6. Pruebe JSON, herramientas, streaming, reasoning_content, consumo, latencia y errores 400/429.
  7. Despliegue con posibilidad de reversión y supervise el ID devuelto en la respuesta.

Para una integración completa, consulte la guía de DeepSeek API en español y el tutorial para crear un chatbot con DeepSeek API.

Pesos abiertos y licencia MIT

DeepSeek publicó los pesos de V4 Flash y V4 Pro. Las fichas oficiales indican que el repositorio y los pesos están bajo licencia MIT. Eso no convierte automáticamente el servicio alojado, la marca DeepSeek, los datos de los usuarios ni cualquier otro material en recursos sin condiciones.

Ejecutar estos modelos por cuenta propia requiere infraestructura considerable, conversión o formatos compatibles, seguridad, observabilidad y experiencia operativa. La disponibilidad de pesos no significa que V4 Pro completo pueda ejecutarse de manera práctica en una GPU de consumo.

Limitaciones que deben explicarse al usuario

  • Puede generar hechos falsos, referencias inexistentes o código inseguro.
  • El contexto de 1M no garantiza recuperar correctamente todos los detalles.
  • Thinking puede aumentar latencia y tokens de salida.
  • JSON válido no equivale a datos correctos ni seguros.
  • Tool Calls no ejecuta acciones por sí solo ni sustituye permisos y validaciones.
  • Las funciones Preview o Beta, las tarifas y los límites pueden cambiar.
  • No envíe contraseñas, claves API ni datos personales innecesarios.

Preguntas frecuentes sobre DeepSeek V4

¿DeepSeek V4 es un solo modelo?

No. V4 Preview incluye Flash y Pro. Sus IDs actuales en Chat Completions son deepseek-v4-flash y deepseek-v4-pro.

¿Flash admite razonamiento?

Sí. Flash y Pro admiten thinking y non-thinking. Thinking está activado por defecto en la API y se controla con thinking.type.

¿Presence penalty y frequency penalty funcionan sin thinking?

No. La referencia de Chat Completions marca ambos parámetros como obsoletos y sin efecto en cualquier modo. temperature y top_p sí están documentados para non-thinking, pero se ignoran en thinking.

¿Qué modelo cuesta menos?

V4 Flash tiene precios inferiores por token y mayor concurrencia publicada. Pro debe elegirse cuando pruebas representativas demuestren una mejora que justifique el coste adicional.

¿V4 acepta imágenes o PDF directamente?

No está documentado como entrada compatible en la API V4 descrita aquí. La compatibilidad Anthropic marca los bloques image y document como no compatibles. Para esos archivos, implemente una etapa compatible de extracción de texto.

¿FIM funciona con V4 Flash?

No lo afirmamos de forma concluyente. La tabla de modelos lo marca como disponible en Flash non-thinking, pero la referencia del endpoint solo enumera V4 Pro. Use Pro hasta que la documentación oficial sea coherente.

¿Deepseek-reasoner sigue siendo R1?

No debe presentarse como un ID actual de R1. DeepSeek documentó temporalmente deepseek-reasoner como ruta al modo thinking de V4 Flash y anunció su retirada para el 24 de julio de 2026. La documentación operativa actual ya no lo enumera; su respuesta efectiva no se probó con una clave válida.

¿Se pueden descargar los pesos de V4?

Sí. DeepSeek publicó los pesos de Flash y Pro bajo licencia MIT. El tamaño de los modelos exige revisar cuidadosamente hardware, formatos, inferencia, seguridad y coste operativo.

Fuentes oficiales consultadas

Guías relacionadas