Última verificación documental y técnica: 10 de agosto de 2026. DeepSeek presentó la familia V4 el 24 de abril de 2026 y actualizó exclusivamente la API de Flash el 31 de julio. El identificador deepseek-v4-flash sirve ahora DeepSeek-V4-Flash-0731; deepseek-v4-pro y los modelos de la web y la app no cambiaron en esa actualización. Ambos modelos mantienen un contexto publicado de un millón de tokens, una salida máxima de 384K mediante Chat Completions y modos thinking y non-thinking.
Flash prioriza coste y concurrencia, pero la actualización 0731 también mejoró de forma importante sus capacidades de agente. Pro activa más parámetros, aunque eso no garantiza una ventaja en cada tarea. Esta guía separa las características confirmadas de la API, los resultados publicados por DeepSeek y un benchmark propio de 120 solicitudes en español; ninguna de esas fuentes sustituye una evaluación con la carga real de cada proyecto.
Aviso de independencia: DeepSeek Español es un sitio independiente operado por Ahmed Aly. No pertenece a DeepSeek, no representa a la empresa y no está afiliado ni respaldado por ella. Las especificaciones y tarifas de esta página se han contrastado con las fuentes oficiales enlazadas.
Contenido de la guía
- Resumen de DeepSeek V4
- Actualización Flash-0731 y Responses API
- Benchmark en español: 120 solicitudes
- Diferencias entre Flash y Pro
- Contexto de 1M y salida de 384K
- Thinking Mode y parámetros de la API
- JSON, herramientas, Prefix y FIM
- Precios y concurrencia
- Migración de los alias anteriores
- Preguntas frecuentes
DeepSeek V4 en pocas palabras
| Característica | DeepSeek V4 Flash | DeepSeek V4 Pro |
|---|---|---|
| ID de API | deepseek-v4-flash | deepseek-v4-pro |
| Versión verificada el 10/08/2026 | DeepSeek-V4-Flash-0731 | DeepSeek-V4-Pro |
| Responses API | Sí | No, según la documentación verificada el 10/08/2026 |
| Parámetros totales | 284B | 1,6T |
| Parámetros activados | 13B | 49B |
| Arquitectura | Mixture-of-Experts | Mixture-of-Experts |
| Contexto publicado | 1M tokens | 1M tokens |
| Salida máxima de Chat Completions | 384K tokens | 384K tokens |
| Thinking / non-thinking | Sí; thinking por defecto | Sí; thinking por defecto |
| JSON Output | Sí | Sí |
| Tool Calls | Sí | Sí |
| FIM Completion Beta | Según Models & Pricing, sí en non-thinking; la referencia de POST /completions no enumera Flash | Sí, en non-thinking |
| Concurrencia publicada por cuenta | 2.500 | 500 |
| Pesos abiertos | Publicados bajo licencia MIT | Publicados bajo licencia MIT |

Los parámetros totales y los activados no significan lo mismo. En una arquitectura Mixture-of-Experts, el modelo contiene muchos parámetros, pero utiliza una parte de ellos para procesar cada token. El total no permite predecir por sí solo la calidad, la latencia o el coste de una tarea concreta.
Qué cambió con DeepSeek-V4-Flash-0731
El 31 de julio de 2026, DeepSeek anunció la versión oficial de la API de Flash en beta pública. El nombre utilizado en las solicitudes no cambia: se sigue enviando deepseek-v4-flash. La versión servida pasó a ser DeepSeek-V4-Flash-0731. DeepSeek indica que conserva la misma arquitectura y tamaño de Flash Preview y que el cambio procede del postentrenamiento.
El anuncio afecta solo a la API de Flash. DeepSeek declaró que V4 Pro y los modelos de la web y la aplicación permanecieron sin cambios. La empresa publicó mejoras amplias en pruebas de agentes, pero esos resultados pertenecen al proveedor: no demuestran una superioridad universal ni sustituyen una comparación independiente con tareas, herramientas y criterios propios.
Responses API: soporte actual y límites
DeepSeek incorporó el formato Responses API con la misma base https://api.deepseek.com. A fecha de esta revisión, solo admite deepseek-v4-flash; deepseek-v4-pro todavía no está admitido en ese endpoint. La compatibilidad es parcial y sin estado: campos como previous_response_id, conversation, store, background y las entradas de imagen o archivo no ofrecen la misma funcionalidad que en la plataforma de OpenAI. Consulte la matriz oficial antes de migrar una integración.
Flash-0731 está adaptado para Codex; revisa la configuración aislada y los límites observados en nuestra prueba de DeepSeek con Codex.
Benchmark independiente de DeepSeek V4 en español
El 10 de agosto de 2026, DeepSeek Español ejecutó 120 solicitudes reales mediante Chat Completions: cuatro fichas lingüísticas prescritas —España, México, Colombia y Argentina—, cinco tareas cerradas, dos modelos y tres repeticiones. Las 120 respuestas devolvieron HTTP 200. Se añadió un preflight separado de dos solicitudes para confirmar los IDs deepseek-v4-flash y deepseek-v4-pro.
El cumplimiento estricto fue del 65,00 % para Flash y del 66,67 % para Pro. La puntuación media de criterios fue 92,94 % y 93,56 %, respectivamente. La diferencia es pequeña: en las 20 celdas comparables de país y tarea hubo 14 empates, tres ventajas para Flash y tres para Pro. Esta muestra no respalda declarar un ganador universal.
| Métrica observada | V4 Flash | V4 Pro |
|---|---|---|
| Solicitudes principales | 60 | 60 |
| HTTP 200 | 60/60 | 60/60 |
| Cumplimiento estricto | 65,00 % | 66,67 % |
| Puntuación media de criterios | 92,94 % | 93,56 % |
| Latencia total p50 | 998 ms | 1.233 ms |
| Latencia total p95 | 1.252 ms | 1.765 ms |
| Tiempo al primer contenido p50 | 711 ms | 913 ms |
| Tokens totales | 11.027 | 10.992 |
| Coste calculado de 60 solicitudes | US$0,00177254 | US$0,005477085 |

Qué tareas superó cada modelo
| Tarea cerrada | Flash: cumplimiento estricto | Pro: cumplimiento estricto | Qué se comprobó |
|---|---|---|---|
| Adaptación regional | 25,00 % | 66,67 % | Dos oraciones, marcadores exigidos y ausencia de formas prohibidas |
| Recuperación exacta | 100 % | 66,67 % | Coincidencia exacta de ciudad, código y hora |
| Extracción JSON | 100 % | 100 % | JSON válido, claves y valores exactos, sin Markdown |
| Resumen de 24 palabras | 0 % | 0 % | Longitud exacta, una oración y cuatro hechos obligatorios |
| Política con contexto cerrado | 100 % | 100 % | Decisión, formato, longitud y frases obligatorias |
Los dos modelos conservaron todos los hechos obligatorios en los resúmenes, pero ninguno respetó el requisito de 24 palabras en las 12 ejecuciones de esa tarea. Pro cumplió mejor la adaptación regional prescrita; Flash conservó exactamente las mayúsculas y minúsculas de ciudad, código y hora en las 12 recuperaciones, mientras Pro convirtió cuatro ciudades a mayúsculas. No se penalizó la naturalidad de estilo: solo reglas binarias publicadas.

Metodología reproducible
- Diseño: 4 fichas lingüísticas × 5 tareas × 2 modelos × 3 repeticiones = 120 solicitudes.
- Configuración:
thinkingdesactivado, temperatura 0, streaming coninclude_usagey límites de salida de 50 a 150 tokens según la tarea. - Ejecución: secuencial, con el orden Flash/Pro alternado. No hubo reintentos en la muestra principal; un error habría contado como fallo.
- Evaluación: criterios binarios deterministas definidos antes de ejecutar; no se utilizó otro modelo como juez. Se comprobó formato, coincidencia exacta, JSON, conteo de palabras y presencia o ausencia de cadenas.
- Datos: todos los nombres, pedidos, políticas y registros de los prompts son ficticios. No se enviaron datos personales ni secretos.
- Caché: un identificador experimental único abrió cada mensaje de sistema. Se observaron 0 tokens de cache hit y 18.786 de cache miss; la prueba específica de Context Caching estudia el comportamiento con prefijos repetidos.
El coste de la muestra principal fue US$0,007249625, calculado con los campos de uso devueltos por la API y las tarifas oficiales verificadas el 10 de agosto. Los dos preflights añadieron un coste calculado de US$0,000042115. Son cálculos técnicos, no una verificación de factura.
Datos descargables y trazabilidad
La descarga incluye las 120 filas en CSV, resultados y criterios en JSON, análisis agregado, manifiesto, archivo LEEME y el evaluador utilizado. No contiene la clave API, cabeceras de autenticación ni identificadores de respuesta.
SHA-256 del ZIP: 8B84D90DBBB5BD014EE437AF2788AEDB9E87DD132430089E929FACC628D8C708. Tamaño: 49.143 bytes.
Límites de la prueba
- No es una prueba geográfica: todas las solicitudes salieron de una sola sesión, no desde cuatro países.
- Las fichas regionales son reglas experimentales explícitas; no definen una única forma correcta de hablar en cada país ni miden naturalidad cultural completa.
- Las cinco tareas son sintéticas y cerradas. Tres repeticiones por combinación describen esta muestra, pero no ofrecen significación estadística fuerte ni cubren todos los usos.
- No se probaron thinking, búsqueda web, visión, herramientas, seguridad integral, contexto de un millón de tokens, chat web ni aplicaciones.
- La latencia depende de red, carga, ubicación y momento. Una ejecución futura o una versión distinta puede producir otros resultados.
- La puntuación automatizable no evalúa elegancia, utilidad subjetiva, sesgos implícitos ni exactitud fuera del contexto proporcionado.
El test anterior de 16 solicitudes sigue documentado en la página principal de DeepSeek Español como registro histórico; este benchmark amplía la muestra y es la referencia específica para elegir entre Flash y Pro.
¿Qué es DeepSeek V4?
DeepSeek presentó V4 Preview como una familia de modelos de lenguaje MoE con dos tamaños. El anuncio oficial describe V4 Pro con 1,6 billones de parámetros totales y 49.000 millones activados, y V4 Flash con 284.000 millones totales y 13.000 millones activados. En ambos casos, la ventana de contexto publicada es de un millón de tokens.
La familia se lanzó como V4 Preview. Desde el 31 de julio, Flash dispone de una versión oficial de API en beta pública, mientras DeepSeek anunció que el lanzamiento oficial de Pro llegaría posteriormente. Los dos IDs siguen documentados para Chat Completions, pero el estado, las funciones y los límites no son idénticos y deben comprobarse antes de cada despliegue.
DeepSeek V4 Flash vs V4 Pro: diferencias prácticas
Cuándo empezar con V4 Flash
Flash ofrece las tarifas más bajas y el límite de concurrencia estándar más alto. Es la primera opción razonable para chats de gran volumen, clasificación, extracción, resúmenes, borradores, soporte interno y automatizaciones donde el coste y el tiempo de respuesta son prioritarios. Puede funcionar tanto con razonamiento como sin él: elegir Flash no obliga a desactivar thinking.
Cuándo evaluar V4 Pro
Pro activa 49B parámetros y sigue siendo una opción que merece evaluación en razonamiento, programación y flujos agentic. Sin embargo, DeepSeek publicó el 31 de julio resultados de agentes en los que Flash-0731 superó a V4-Pro-Preview. Son resultados del proveedor y no justifican elegir Flash o Pro sin una prueba propia, pero sí impiden asumir que Pro gana automáticamente por tamaño o precio.
Ninguno de los dos modelos garantiza exactitud. Empiece la evaluación con Flash-0731 y compare Pro con el mismo conjunto de casos cuando la complejidad o el riesgo lo justifiquen. Mida precisión, cumplimiento de formato, uso de herramientas, latencia, tokens y coste por resultado aceptado.
| Necesidad | Primera opción para probar | Por qué |
|---|---|---|
| Chat general de gran volumen | Flash non-thinking | Menor coste y respuesta directa |
| Extracción o clasificación en JSON | Flash non-thinking | JSON Output y menor precio |
| Razonamiento difícil | Flash y Pro, misma evaluación | El tamaño no predice por sí solo el resultado |
| Agente con varias herramientas | Flash-0731 primero; comparar Pro | Flash mejoró específicamente en tareas de agente |
| Resumen de documentos largos | Flash primero | Ambos admiten 1M; Flash reduce el coste |
| Programación compleja | Flash-0731 y Pro | Compare sobre repositorios y criterios propios |
Contexto de un millón de tokens y salida máxima de 384K
La tabla oficial publica una longitud de contexto de 1M y una salida máxima de 384K para Flash y Pro. El límite total de una solicitud sigue condicionado por la longitud de contexto: reservar una salida grande reduce el espacio práctico disponible para la entrada.
- No envíe el contexto completo si solo necesita unas secciones.
- Elimine duplicados, navegación y texto irrelevante antes de la llamada.
- Conserve títulos, fechas e identificadores que permitan verificar la respuesta.
- Mida la recuperación de información en distintas posiciones; una ventana grande no garantiza atención uniforme.
- No confunda contexto con búsqueda web ni con una base de conocimiento actualizada.
DeepSeek aplica Context Caching en disco con criterio best effort. Si un prefijo repetido produce un cache hit, esos tokens de entrada se facturan a una tarifa inferior; repetir texto no garantiza por sí mismo un hit. El diseño de privacidad y la retención de datos son cuestiones distintas del funcionamiento del caché.
Thinking Mode y parámetros: la distinción correcta
Los dos modelos usan thinking por defecto. En el formato OpenAI, el modo se controla con thinking.type; los valores documentados son enabled y disabled. Cuando thinking está activado, reasoning_effort admite high y max. DeepSeek indica que low y medium se mapean a high, mientras que xhigh se mapea a max.
Corrección importante:
presence_penaltyyfrequency_penaltyestán obsoletos y no tienen efecto en ningún modo. En cambio,temperatureytop_psiguen documentados para non-thinking, pero no tienen efecto cuando thinking está activado.

presence_penalty y frequency_penalty en la API; no es una restricción exclusiva de Thinking. Captura realizada el 22 de julio de 2026.| Parámetro | Non-thinking | Thinking |
|---|---|---|
thinking.type | disabled | enabled; valor predeterminado |
reasoning_effort | No aplica | high o max |
temperature | Admitido | Sin efecto |
top_p | Admitido; se recomienda ajustar este o temperature, no ambos | Sin efecto |
presence_penalty | Obsoleto; sin efecto | Obsoleto; sin efecto |
frequency_penalty | Obsoleto; sin efecto | Obsoleto; sin efecto |
Ejemplo non-thinking con V4 Flash
Este ejemplo usa temperature porque thinking está desactivado. La clave se mantiene en una variable de entorno y la llamada debe ejecutarse desde un servidor, nunca desde JavaScript público en el navegador.
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{
"role": "system",
"content": "Responde de forma clara en español."
},
{
"role": "user",
"content": "Resume este texto en tres puntos."
}
],
"thinking": {"type": "disabled"},
"temperature": 0.2,
"stream": false
}'
Ejemplo thinking con V4 Pro
Elimine presence_penalty y frequency_penalty en todos los modos porque están obsoletos y no tienen efecto. Cuando thinking esté activado, omita además temperature y top_p. En el SDK de OpenAI, DeepSeek documenta el objeto thinking dentro de extra_body.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "user",
"content": "Analiza los riesgos de este plan y propone controles."
}
],
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}}
)
print(response.choices[0].message.content)
La API devuelve el razonamiento en reasoning_content y la respuesta final en content. Si una ronda thinking incluye una llamada a herramienta, la documentación exige reenviar el reasoning_content completo en las solicitudes posteriores de esa interacción; omitirlo puede producir un error HTTP 400. No exponga automáticamente el razonamiento interno al usuario.
JSON Output, Tool Calls, Prefix Completion y FIM
JSON Output
Flash y Pro admiten response_format: {"type":"json_object"}. El prompt debe pedir explícitamente JSON y definir la estructura esperada. Aun así, la aplicación debe analizar la respuesta, validar tipos y campos, controlar finish_reason y rechazar valores que incumplan las reglas de negocio.
Tool Calls
Los dos modelos pueden proponer llamadas a funciones en thinking y non-thinking. El modelo solo genera el nombre y los argumentos de una herramienta: el servidor debe validar los datos, aplicar permisos, ejecutar la acción y devolver el resultado. No permita que una llamada propuesta ejecute compras, borrados o cambios sensibles sin autorización.
Chat Prefix Completion y FIM Completion
Chat Prefix Completion y FIM Completion están marcadas como funciones Beta. FIM utiliza la base https://api.deepseek.com/beta y el endpoint /completions, no el endpoint de Chat Completions. El endpoint FIM Beta admite como máximo 4K tokens de salida; el límite de 384K corresponde a Chat Completions y no debe aplicarse a solicitudes FIM.
Discrepancia documental comprobada de nuevo el 10 de agosto de 2026: la tabla oficial Models & Pricing marca FIM non-thinking para deepseek-v4-flash y deepseek-v4-pro. Sin embargo, la referencia oficial de POST /completions solo enumera deepseek-v4-pro como valor admitido. Por esa razón, esta guía considera confirmado Pro y no afirma soporte concluyente de Flash hasta que DeepSeek unifique la documentación. Para una implementación de producción, use Pro y vuelva a comprobar el endpoint.
Consulte la guía de FIM Completion para ver la estructura prompt + suffix, las limitaciones Beta y un ejemplo separado de Chat Completions.
¿V4 acepta imágenes o documentos?
La API V4 documentada utiliza entrada textual. En la tabla de compatibilidad del formato Anthropic, los bloques image y document aparecen como no compatibles. No atribuya a V4 las capacidades de DeepSeek-OCR, DeepSeek-VL o de otros modelos como si pertenecieran al mismo endpoint.
Si una aplicación debe procesar un PDF o una imagen, necesita una canalización compatible para extraer o reconocer el texto y enviar solo el contenido necesario. Una URL o un nombre de archivo dentro de un mensaje no demuestra que el modelo haya recibido ni comprendido el documento.
Precios y concurrencia publicados para DeepSeek V4
Los importes están expresados en dólares estadounidenses por un millón de tokens. Son las tarifas base verificadas documentalmente el 10 de agosto de 2026 y pueden cambiar. Compruebe la tabla oficial antes de presupuestar un producto.
| Modelo | Entrada: cache hit | Entrada: cache miss | Salida | Concurrencia por cuenta |
|---|---|---|---|---|
| V4 Flash | US$0,0028 | US$0,14 | US$0,28 | 2.500 |
| V4 Pro | US$0,003625 | US$0,435 | US$0,87 | 500 |
Aviso sobre cambios futuros: la documentación oficial verificada el 10 de agosto indica que DeepSeek prevé aumentar próximamente el precio general de sus servicios API y espera una subida significativa. Todavía no publica el plan definitivo ni una fecha de entrada en vigor; por eso esta página mantiene únicamente las tarifas vigentes de la tabla oficial.

Una solicitud cuenta como conexión concurrente desde su envío hasta que termina la respuesta. Crear varias claves no multiplica el límite de la cuenta. Cuando se supera, la documentación indica que la API responde con HTTP 429. El coste real depende de los tokens de entrada y salida y de la proporción de cache hits, no solo del número de mensajes.
Para estimaciones con distintos volúmenes, consulte la guía de precios de DeepSeek API.
Casos de uso y criterios de evaluación
- Atención y autoservicio: empiece con Flash, limite las acciones de las herramientas y escale los casos inciertos.
- Extracción estructurada: utilice JSON Output, un esquema de validación y pruebas con documentos reales.
- Programación: compare Flash y Pro sobre repositorios y tareas propias; no extrapole un benchmark aislado.
- Agentes: registre cada llamada, valide los argumentos y aplique permisos mínimos.
- Contexto largo: mida recuperación, citas internas, coste y latencia a varias longitudes.
- Contenido en español: especifique país, público, registro y terminología; revise localización y hechos.
V4 puede recibir y generar texto en español, pero la documentación revisada no publica una certificación específica para español de España ni garantiza adaptación automática a cada variedad latinoamericana. Incluya ejemplos aprobados y revise fechas, monedas, citas, textos legales y decisiones de alto impacto.
Migración desde deepseek-chat y deepseek-reasoner
Estado documental a 10 de agosto de 2026: DeepSeek anunció la retirada de deepseek-chat y deepseek-reasoner para el 24 de julio de 2026 a las 15:59 UTC. Las páginas operativas actuales solo enumeran deepseek-v4-flash y deepseek-v4-pro. No diseñe código nuevo que dependa de los aliases. Este benchmark no llamó a los aliases retirados, por lo que no afirmamos qué respuesta o código de error devuelven hoy.
- Localice los alias antiguos en código, variables de entorno, paneles y pruebas.
- Sustitúyalos por
deepseek-v4-flashodeepseek-v4-pro. - Controle el modo con
thinking.type. - Elimine
presence_penaltyyfrequency_penalty; están obsoletos en todos los modos. - En thinking, elimine también
temperatureytop_pporque no tienen efecto. - Pruebe JSON, herramientas, streaming,
reasoning_content, consumo, latencia y errores 400/429. - Despliegue con posibilidad de reversión y supervise el ID devuelto en la respuesta.
Para una integración completa, consulte la guía de DeepSeek API en español y el tutorial para crear un chatbot con DeepSeek API.
Pesos abiertos y licencia MIT
DeepSeek publicó los pesos de V4 Flash y V4 Pro. Las fichas oficiales indican que el repositorio y los pesos están bajo licencia MIT. Eso no convierte automáticamente el servicio alojado, la marca DeepSeek, los datos de los usuarios ni cualquier otro material en recursos sin condiciones.
Ejecutar estos modelos por cuenta propia requiere infraestructura considerable, conversión o formatos compatibles, seguridad, observabilidad y experiencia operativa. La disponibilidad de pesos no significa que V4 Pro completo pueda ejecutarse de manera práctica en una GPU de consumo.
Limitaciones que deben explicarse al usuario
- Puede generar hechos falsos, referencias inexistentes o código inseguro.
- El contexto de 1M no garantiza recuperar correctamente todos los detalles.
- Thinking puede aumentar latencia y tokens de salida.
- JSON válido no equivale a datos correctos ni seguros.
- Tool Calls no ejecuta acciones por sí solo ni sustituye permisos y validaciones.
- Las funciones Preview o Beta, las tarifas y los límites pueden cambiar.
- No envíe contraseñas, claves API ni datos personales innecesarios.
Preguntas frecuentes sobre DeepSeek V4
¿DeepSeek V4 es un solo modelo?
No. V4 Preview incluye Flash y Pro. Sus IDs actuales en Chat Completions son deepseek-v4-flash y deepseek-v4-pro.
¿Flash admite razonamiento?
Sí. Flash y Pro admiten thinking y non-thinking. Thinking está activado por defecto en la API y se controla con thinking.type.
¿Presence penalty y frequency penalty funcionan sin thinking?
No. La referencia de Chat Completions marca ambos parámetros como obsoletos y sin efecto en cualquier modo. temperature y top_p sí están documentados para non-thinking, pero se ignoran en thinking.
¿Qué modelo cuesta menos?
V4 Flash tiene precios inferiores por token y mayor concurrencia publicada. Pro debe elegirse cuando pruebas representativas demuestren una mejora que justifique el coste adicional.
¿V4 acepta imágenes o PDF directamente?
No está documentado como entrada compatible en la API V4 descrita aquí. La compatibilidad Anthropic marca los bloques image y document como no compatibles. Para esos archivos, implemente una etapa compatible de extracción de texto.
¿FIM funciona con V4 Flash?
No lo afirmamos de forma concluyente. La tabla de modelos lo marca como disponible en Flash non-thinking, pero la referencia del endpoint solo enumera V4 Pro. Use Pro hasta que la documentación oficial sea coherente.
¿Deepseek-reasoner sigue siendo R1?
No debe presentarse como un ID actual de R1. DeepSeek documentó temporalmente deepseek-reasoner como ruta al modo thinking de V4 Flash y anunció su retirada para el 24 de julio de 2026. La documentación operativa actual ya no lo enumera; su respuesta efectiva no se probó con una clave válida.
¿Se pueden descargar los pesos de V4?
Sí. DeepSeek publicó los pesos de Flash y Pro bajo licencia MIT. El tamaño de los modelos exige revisar cuidadosamente hardware, formatos, inferencia, seguridad y coste operativo.
Fuentes oficiales consultadas
- Registro de cambios: actualización DeepSeek-V4-Flash-0731 del 31 de julio.
- Guía oficial de Responses API y matriz de compatibilidad.
- DeepSeek V4 Preview Release.
- DeepSeek Models & Pricing.
- Create Chat Completion: referencia de parámetros.
- DeepSeek Thinking Mode.
- Create FIM Completion (Beta).
- DeepSeek Chat Prefix Completion (Beta).
- DeepSeek JSON Output.
- DeepSeek Tool Calls.
- Rate Limit & Isolation.
- DeepSeek Context Caching.
- DeepSeek Anthropic API Compatibility.
- Ficha oficial de DeepSeek V4 Flash y licencia de los pesos.
- Ficha oficial de DeepSeek V4 Pro y licencia de los pesos.
