DeepSeek V3 es la familia de modelos de lenguaje que DeepSeek presentó el 26 de diciembre de 2024. Su importancia no reside en ser el modelo alojado vigente, sino en haber establecido la arquitectura de 671.000 millones de parámetros —37.000 millones activados por token— sobre la que se apoyaron varias generaciones posteriores. Esta página documenta el lanzamiento original y la revisión DeepSeek‑V3‑0324 como referencias históricas y técnicas.
Estado comprobado documentalmente el 29 de julio de 2026: la API oficial pertenece a la generación DeepSeek V4 Preview. deepseek-chat no es un identificador fijo de V3. DeepSeek anunció su retirada para el 24 de julio y la documentación operativa actual ya no lo enumera. No se probó su respuesta efectiva con una clave válida.
Ficha rápida de DeepSeek V3
| Dato | DeepSeek V3 |
|---|---|
| Presentación oficial | 26 de diciembre de 2024 |
| Actualización principal | DeepSeek‑V3‑0324, anunciada el 25 de marzo de 2025 |
| Arquitectura | Mixture-of-Experts (MoE), DeepSeekMoE y Multi-head Latent Attention (MLA) |
| Parámetros del modelo principal | 671B totales y 37B activados por token |
| Módulo adicional MTP | 14B en los archivos publicados; el conjunto completo ocupa 685B |
| Contexto documentado | 128K tokens |
| Datos de preentrenamiento | 14,8 billones de tokens |
| Modalidad | Modelo de texto; no es un modelo de visión |
| Licencia | V3 original: licencia de modelo de DeepSeek; código MIT. V3‑0324: pesos y repositorio bajo MIT |
| Estado de la API oficial | Versión histórica, sustituida por generaciones posteriores |
Qué fue DeepSeek V3 y por qué resultó relevante
V3 fue un modelo generalista de texto para conversación, programación, matemáticas, redacción y análisis. DeepSeek lo entrenó sobre 14,8 billones de tokens y después aplicó ajuste supervisado y aprendizaje por refuerzo. El informe técnico señala 2,788 millones de horas de GPU H800 para el entrenamiento completo; esa cifra describe el cómputo de las etapas declaradas en el informe, no todo el gasto corporativo, la investigación previa, los datos, el personal o la infraestructura.
Su diseño MoE no activa los 671B parámetros en cada paso. Un enrutador selecciona expertos y mantiene aproximadamente 37B activos por token. Esto reduce el cálculo frente a un modelo denso del mismo tamaño total, aunque no convierte V3 en un modelo pequeño: almacenar los pesos, distribuirlos entre aceleradores y servirlo con buen rendimiento sigue exigiendo infraestructura de centro de datos.
MLA, DeepSeekMoE y predicción multitoken
- Multi-head Latent Attention (MLA): comprime la información de claves y valores utilizada durante la inferencia para reducir el coste de la caché KV.
- DeepSeekMoE: divide la capacidad en expertos enrutados y compartidos, activando solo una parte del modelo para cada token.
- Equilibrio sin pérdida auxiliar: V3 introdujo una estrategia para equilibrar la carga de los expertos sin depender del tipo de pérdida auxiliar que puede perjudicar la calidad.
- Multi-Token Prediction (MTP): añadió un objetivo de entrenamiento que predice tokens futuros adicionales y puede facilitar decodificación especulativa. Los archivos publicados incluyen 14B parámetros MTP además de los 671B del modelo principal.
- Entrenamiento FP8: DeepSeek documentó un marco de precisión mixta FP8 para mejorar eficiencia y estabilidad a gran escala.
V3 original frente a DeepSeek‑V3‑0324
La expresión “DeepSeek V3” puede referirse al checkpoint de diciembre de 2024 o a la actualización fechada 24 de marzo y anunciada el 25 de marzo de 2025. No son nombres intercambiables si se pretende reproducir una evaluación, fijar una dependencia o documentar una aplicación.
| Aspecto | V3 de diciembre de 2024 | V3‑0324 |
|---|---|---|
| Objetivo | Lanzamiento base de la generación V3 | Revisión del modelo conversacional |
| Cambios destacados por DeepSeek | Nueva arquitectura y eficiencia de entrenamiento | Mejor razonamiento, desarrollo front-end y uso de herramientas |
| Arquitectura | 671B/37B MoE, MLA y MTP | La misma familia arquitectónica |
| Contexto | 128K | 128K en los pesos publicados |
| Licencia de pesos | DeepSeek Model License, con uso comercial permitido | MIT |
| Disponibilidad alojada | Histórica | Histórica |
V3‑0324 fue una actualización sustancial, pero no fue un modelo de razonamiento separado como DeepSeek R1. El anuncio oficial recomendaba V3 para tareas que no requerían razonamiento complejo y comunicó mejoras de razonamiento dentro de un modelo generalista. Para una auditoría reproducible, registra el identificador exacto del checkpoint, la plantilla de chat, los parámetros de muestreo y el motor de inferencia.
Contexto de 128K: qué significa realmente
Los repositorios oficiales de V3 y V3‑0324 documentan una ventana de contexto de 128K tokens. Ese límite combina entrada y, según el servidor utilizado, espacio reservado para la salida. No equivale a 128.000 palabras y tampoco garantiza que toda la información introducida reciba la misma atención o produzca la misma precisión.
Para documentos largos conviene dividir por estructura semántica, conservar títulos y metadatos, medir tokens con el tokenizador del checkpoint y comprobar recuperación de hechos situados al inicio, centro y final. Una aplicación local puede imponer un límite menor por memoria, configuración o versión del motor. Del mismo modo, el límite histórico de V3 no debe trasladarse a la API oficial vigente, cuya generación V4 tiene especificaciones diferentes.
Capacidades y límites
- Texto y código: puede redactar, resumir, traducir, explicar código y proponer cambios, pero las respuestas deben probarse y revisarse.
- Matemáticas: el informe muestra mejoras en benchmarks, no una garantía de exactitud para cada problema.
- Conocimiento: los pesos no consultan Internet por sí solos. Una herramienta de búsqueda debe ser implementada y ejecutada por la aplicación.
- Herramientas: que el modelo produzca una llamada estructurada no significa que ejecute código o APIs; el orquestador valida argumentos, aplica permisos y devuelve el resultado.
- Multimodalidad: V3 es un modelo de lenguaje de texto. No debe presentarse como DeepSeek‑VL ni como un sistema que entiende imágenes de forma nativa.
- Fiabilidad: puede inventar fuentes, paquetes, hechos o resultados. Las decisiones médicas, jurídicas, financieras y de seguridad requieren especialistas y fuentes primarias.
Pesos abiertos, licencia y despliegue local
Los pesos de V3 se publicaron para descarga, pero “pesos abiertos” no significa que se entregaran los datos completos de entrenamiento ni todo el proceso de construcción. En el repositorio original, el código está bajo MIT y los modelos Base/Chat están sujetos a la DeepSeek Model License, que permite uso comercial. DeepSeek anunció posteriormente V3‑0324 con licencia MIT para el repositorio y los pesos. Debes leer la licencia adjunta al checkpoint concreto en vez de asumir una única licencia para toda la familia.
El modelo oficial principal se distribuyó en FP8 y requiere un despliegue multinodo o una cuantización comunitaria para entornos más pequeños. El repositorio enumeró motores como SGLang, LMDeploy, TensorRT‑LLM, vLLM y LightLLM, además de soporte para determinados aceleradores AMD y Huawei. Esas instrucciones corresponden al estado del software documentado para V3; las versiones recientes de cada motor pueden cambiar flags, formatos y compatibilidad.
Controles mínimos antes de servir V3
- Fija por hash o revisión el repositorio de pesos, el tokenizador y el código de inferencia.
- Verifica la plantilla de chat; una plantilla incorrecta puede deteriorar instrucciones, roles y llamadas a herramientas.
- Define límites de contexto, salida, concurrencia y tiempo de espera compatibles con tu memoria disponible.
- Aísla la ejecución de herramientas, valida JSON y nunca expongas claves o comandos privilegiados al modelo.
- Evalúa español, código y tareas propias; no extrapoles una tabla de benchmarks a tu carga real.
- Documenta la licencia de los pesos originales y de cualquier cuantización o modificación de terceros.
¿Se puede seleccionar V3 en la API oficial?
No como modelo vigente documentado. Los nombres públicos de la API cambian de versión con el tiempo y no son un archivo histórico. A 29 de julio de 2026, la documentación operativa enumera deepseek-v4-flash y deepseek-v4-pro. Los aliases deepseek-chat y deepseek-reasoner tuvieron una retirada anunciada para el 24 de julio y ya no aparecen en esa lista; no se verificó su respuesta efectiva mediante una llamada autenticada.
Si una aplicación necesita exactamente V3 por reproducibilidad, debe servir un checkpoint concreto en infraestructura propia o contratar un proveedor que identifique de forma contractual ese checkpoint. Si solo necesita la API oficial de DeepSeek, debe migrar a los IDs explícitos de V4, revisar el precio de la API y volver a ejecutar pruebas de calidad, longitud, latencia y herramientas.
Ruta de evolución desde V3
| Versión | Aporte principal | Uso correcto de esta referencia |
|---|---|---|
| V3 / V3‑0324 | Base MoE 671B/37B, MLA, MTP y mejora generalista | Arquitectura original y reproducción histórica |
| V3.1 | Un modelo híbrido con modos pensar/no pensar y mejoras de agentes | Estudiar la transición al razonamiento híbrido |
| V3.2‑Exp | Validación experimental de DeepSeek Sparse Attention | Investigar eficiencia de contexto largo |
| V3.2 | Razonamiento y herramientas integrados con DSA | Reproducir la generación anterior a V4 |
| V4 Preview | V4 Flash y Pro, contexto oficial de 1M | Nuevas integraciones de la API oficial |
Migración de una integración antigua
Una migración segura no consiste únicamente en cambiar una cadena. Crea un conjunto de solicitudes reales, guarda salidas aceptadas y compara el nuevo modelo con criterios medibles: cumplimiento, precisión, JSON válido, uso de herramientas, consumo de tokens, tiempo hasta el primer token y coste. Separa los flujos que necesitan respuesta rápida de los que necesitan razonamiento profundo.
- Sustituye aliases por
deepseek-v4-flashodeepseek-v4-prosegún el caso. - Selecciona explícitamente thinking o non-thinking; no deduzcas el modo a partir de un nombre V3.
- Revisa límites de salida, tratamiento de
reasoning_content, herramientas y respuestas JSON. - Calcula el presupuesto con precios vigentes, no con la tarifa histórica de diciembre de 2024.
- Despliega gradualmente, observa errores y conserva una reversión controlada.
Preguntas frecuentes sobre DeepSeek V3
¿DeepSeek V3 sigue siendo el modelo de deepseek-chat?
No. Ese alias cambió de versión varias veces. DeepSeek documentó temporalmente su ruta hacia V4 Flash non-thinking y anunció su retirada para el 24 de julio de 2026. A 29 de julio ya no aparece en la lista operativa; su respuesta actual no se probó con una clave válida.
¿V3 tiene 671B o 685B parámetros?
El modelo principal tiene 671B y activa 37B por token. El tamaño total publicado en Hugging Face llega a 685B porque incorpora un módulo MTP de 14B. Indicar qué cifra se está midiendo evita una aparente contradicción.
¿V3 funciona en un ordenador personal?
El checkpoint completo no está diseñado para un PC común. Existen cuantizaciones comunitarias, pero reducen precisión, requieren mucha memoria y no equivalen al artefacto oficial. Para producción hay que evaluar licencias, hardware, seguridad y calidad.
¿DeepSeek V3 acepta imágenes?
No de forma nativa. Es un modelo de texto. Las imágenes requieren un modelo visual o una etapa externa de OCR/visión que entregue texto al modelo.
¿Qué versión conviene para un proyecto nuevo?
Para la API oficial, usa los IDs V4 documentados y valida el comportamiento. V3 sigue siendo útil para investigación, despliegue de pesos históricos o comparación reproducible, no como nombre genérico de la API.
