DeepSeek V3: arquitectura, versiones, licencia y estado del modelo

DeepSeek V3 es la familia de modelos de lenguaje que DeepSeek presentó el 26 de diciembre de 2024. Su importancia no reside en ser el modelo alojado vigente, sino en haber establecido la arquitectura de 671.000 millones de parámetros —37.000 millones activados por token— sobre la que se apoyaron varias generaciones posteriores. Esta página documenta el lanzamiento original y la revisión DeepSeek‑V3‑0324 como referencias históricas y técnicas.

Estado comprobado documentalmente el 29 de julio de 2026: la API oficial pertenece a la generación DeepSeek V4 Preview. deepseek-chat no es un identificador fijo de V3. DeepSeek anunció su retirada para el 24 de julio y la documentación operativa actual ya no lo enumera. No se probó su respuesta efectiva con una clave válida.

Ficha rápida de DeepSeek V3

DatoDeepSeek V3
Presentación oficial26 de diciembre de 2024
Actualización principalDeepSeek‑V3‑0324, anunciada el 25 de marzo de 2025
ArquitecturaMixture-of-Experts (MoE), DeepSeekMoE y Multi-head Latent Attention (MLA)
Parámetros del modelo principal671B totales y 37B activados por token
Módulo adicional MTP14B en los archivos publicados; el conjunto completo ocupa 685B
Contexto documentado128K tokens
Datos de preentrenamiento14,8 billones de tokens
ModalidadModelo de texto; no es un modelo de visión
LicenciaV3 original: licencia de modelo de DeepSeek; código MIT. V3‑0324: pesos y repositorio bajo MIT
Estado de la API oficialVersión histórica, sustituida por generaciones posteriores

Qué fue DeepSeek V3 y por qué resultó relevante

V3 fue un modelo generalista de texto para conversación, programación, matemáticas, redacción y análisis. DeepSeek lo entrenó sobre 14,8 billones de tokens y después aplicó ajuste supervisado y aprendizaje por refuerzo. El informe técnico señala 2,788 millones de horas de GPU H800 para el entrenamiento completo; esa cifra describe el cómputo de las etapas declaradas en el informe, no todo el gasto corporativo, la investigación previa, los datos, el personal o la infraestructura.

Su diseño MoE no activa los 671B parámetros en cada paso. Un enrutador selecciona expertos y mantiene aproximadamente 37B activos por token. Esto reduce el cálculo frente a un modelo denso del mismo tamaño total, aunque no convierte V3 en un modelo pequeño: almacenar los pesos, distribuirlos entre aceleradores y servirlo con buen rendimiento sigue exigiendo infraestructura de centro de datos.

MLA, DeepSeekMoE y predicción multitoken

  • Multi-head Latent Attention (MLA): comprime la información de claves y valores utilizada durante la inferencia para reducir el coste de la caché KV.
  • DeepSeekMoE: divide la capacidad en expertos enrutados y compartidos, activando solo una parte del modelo para cada token.
  • Equilibrio sin pérdida auxiliar: V3 introdujo una estrategia para equilibrar la carga de los expertos sin depender del tipo de pérdida auxiliar que puede perjudicar la calidad.
  • Multi-Token Prediction (MTP): añadió un objetivo de entrenamiento que predice tokens futuros adicionales y puede facilitar decodificación especulativa. Los archivos publicados incluyen 14B parámetros MTP además de los 671B del modelo principal.
  • Entrenamiento FP8: DeepSeek documentó un marco de precisión mixta FP8 para mejorar eficiencia y estabilidad a gran escala.

V3 original frente a DeepSeek‑V3‑0324

La expresión “DeepSeek V3” puede referirse al checkpoint de diciembre de 2024 o a la actualización fechada 24 de marzo y anunciada el 25 de marzo de 2025. No son nombres intercambiables si se pretende reproducir una evaluación, fijar una dependencia o documentar una aplicación.

AspectoV3 de diciembre de 2024V3‑0324
ObjetivoLanzamiento base de la generación V3Revisión del modelo conversacional
Cambios destacados por DeepSeekNueva arquitectura y eficiencia de entrenamientoMejor razonamiento, desarrollo front-end y uso de herramientas
Arquitectura671B/37B MoE, MLA y MTPLa misma familia arquitectónica
Contexto128K128K en los pesos publicados
Licencia de pesosDeepSeek Model License, con uso comercial permitidoMIT
Disponibilidad alojadaHistóricaHistórica

V3‑0324 fue una actualización sustancial, pero no fue un modelo de razonamiento separado como DeepSeek R1. El anuncio oficial recomendaba V3 para tareas que no requerían razonamiento complejo y comunicó mejoras de razonamiento dentro de un modelo generalista. Para una auditoría reproducible, registra el identificador exacto del checkpoint, la plantilla de chat, los parámetros de muestreo y el motor de inferencia.

Contexto de 128K: qué significa realmente

Los repositorios oficiales de V3 y V3‑0324 documentan una ventana de contexto de 128K tokens. Ese límite combina entrada y, según el servidor utilizado, espacio reservado para la salida. No equivale a 128.000 palabras y tampoco garantiza que toda la información introducida reciba la misma atención o produzca la misma precisión.

Para documentos largos conviene dividir por estructura semántica, conservar títulos y metadatos, medir tokens con el tokenizador del checkpoint y comprobar recuperación de hechos situados al inicio, centro y final. Una aplicación local puede imponer un límite menor por memoria, configuración o versión del motor. Del mismo modo, el límite histórico de V3 no debe trasladarse a la API oficial vigente, cuya generación V4 tiene especificaciones diferentes.

Capacidades y límites

  • Texto y código: puede redactar, resumir, traducir, explicar código y proponer cambios, pero las respuestas deben probarse y revisarse.
  • Matemáticas: el informe muestra mejoras en benchmarks, no una garantía de exactitud para cada problema.
  • Conocimiento: los pesos no consultan Internet por sí solos. Una herramienta de búsqueda debe ser implementada y ejecutada por la aplicación.
  • Herramientas: que el modelo produzca una llamada estructurada no significa que ejecute código o APIs; el orquestador valida argumentos, aplica permisos y devuelve el resultado.
  • Multimodalidad: V3 es un modelo de lenguaje de texto. No debe presentarse como DeepSeek‑VL ni como un sistema que entiende imágenes de forma nativa.
  • Fiabilidad: puede inventar fuentes, paquetes, hechos o resultados. Las decisiones médicas, jurídicas, financieras y de seguridad requieren especialistas y fuentes primarias.

Pesos abiertos, licencia y despliegue local

Los pesos de V3 se publicaron para descarga, pero “pesos abiertos” no significa que se entregaran los datos completos de entrenamiento ni todo el proceso de construcción. En el repositorio original, el código está bajo MIT y los modelos Base/Chat están sujetos a la DeepSeek Model License, que permite uso comercial. DeepSeek anunció posteriormente V3‑0324 con licencia MIT para el repositorio y los pesos. Debes leer la licencia adjunta al checkpoint concreto en vez de asumir una única licencia para toda la familia.

El modelo oficial principal se distribuyó en FP8 y requiere un despliegue multinodo o una cuantización comunitaria para entornos más pequeños. El repositorio enumeró motores como SGLang, LMDeploy, TensorRT‑LLM, vLLM y LightLLM, además de soporte para determinados aceleradores AMD y Huawei. Esas instrucciones corresponden al estado del software documentado para V3; las versiones recientes de cada motor pueden cambiar flags, formatos y compatibilidad.

Controles mínimos antes de servir V3

  1. Fija por hash o revisión el repositorio de pesos, el tokenizador y el código de inferencia.
  2. Verifica la plantilla de chat; una plantilla incorrecta puede deteriorar instrucciones, roles y llamadas a herramientas.
  3. Define límites de contexto, salida, concurrencia y tiempo de espera compatibles con tu memoria disponible.
  4. Aísla la ejecución de herramientas, valida JSON y nunca expongas claves o comandos privilegiados al modelo.
  5. Evalúa español, código y tareas propias; no extrapoles una tabla de benchmarks a tu carga real.
  6. Documenta la licencia de los pesos originales y de cualquier cuantización o modificación de terceros.

¿Se puede seleccionar V3 en la API oficial?

No como modelo vigente documentado. Los nombres públicos de la API cambian de versión con el tiempo y no son un archivo histórico. A 29 de julio de 2026, la documentación operativa enumera deepseek-v4-flash y deepseek-v4-pro. Los aliases deepseek-chat y deepseek-reasoner tuvieron una retirada anunciada para el 24 de julio y ya no aparecen en esa lista; no se verificó su respuesta efectiva mediante una llamada autenticada.

Si una aplicación necesita exactamente V3 por reproducibilidad, debe servir un checkpoint concreto en infraestructura propia o contratar un proveedor que identifique de forma contractual ese checkpoint. Si solo necesita la API oficial de DeepSeek, debe migrar a los IDs explícitos de V4, revisar el precio de la API y volver a ejecutar pruebas de calidad, longitud, latencia y herramientas.

Ruta de evolución desde V3

VersiónAporte principalUso correcto de esta referencia
V3 / V3‑0324Base MoE 671B/37B, MLA, MTP y mejora generalistaArquitectura original y reproducción histórica
V3.1Un modelo híbrido con modos pensar/no pensar y mejoras de agentesEstudiar la transición al razonamiento híbrido
V3.2‑ExpValidación experimental de DeepSeek Sparse AttentionInvestigar eficiencia de contexto largo
V3.2Razonamiento y herramientas integrados con DSAReproducir la generación anterior a V4
V4 PreviewV4 Flash y Pro, contexto oficial de 1MNuevas integraciones de la API oficial

Migración de una integración antigua

Una migración segura no consiste únicamente en cambiar una cadena. Crea un conjunto de solicitudes reales, guarda salidas aceptadas y compara el nuevo modelo con criterios medibles: cumplimiento, precisión, JSON válido, uso de herramientas, consumo de tokens, tiempo hasta el primer token y coste. Separa los flujos que necesitan respuesta rápida de los que necesitan razonamiento profundo.

  1. Sustituye aliases por deepseek-v4-flash o deepseek-v4-pro según el caso.
  2. Selecciona explícitamente thinking o non-thinking; no deduzcas el modo a partir de un nombre V3.
  3. Revisa límites de salida, tratamiento de reasoning_content, herramientas y respuestas JSON.
  4. Calcula el presupuesto con precios vigentes, no con la tarifa histórica de diciembre de 2024.
  5. Despliega gradualmente, observa errores y conserva una reversión controlada.

Preguntas frecuentes sobre DeepSeek V3

¿DeepSeek V3 sigue siendo el modelo de deepseek-chat?

No. Ese alias cambió de versión varias veces. DeepSeek documentó temporalmente su ruta hacia V4 Flash non-thinking y anunció su retirada para el 24 de julio de 2026. A 29 de julio ya no aparece en la lista operativa; su respuesta actual no se probó con una clave válida.

¿V3 tiene 671B o 685B parámetros?

El modelo principal tiene 671B y activa 37B por token. El tamaño total publicado en Hugging Face llega a 685B porque incorpora un módulo MTP de 14B. Indicar qué cifra se está midiendo evita una aparente contradicción.

¿V3 funciona en un ordenador personal?

El checkpoint completo no está diseñado para un PC común. Existen cuantizaciones comunitarias, pero reducen precisión, requieren mucha memoria y no equivalen al artefacto oficial. Para producción hay que evaluar licencias, hardware, seguridad y calidad.

¿DeepSeek V3 acepta imágenes?

No de forma nativa. Es un modelo de texto. Las imágenes requieren un modelo visual o una etapa externa de OCR/visión que entregue texto al modelo.

¿Qué versión conviene para un proyecto nuevo?

Para la API oficial, usa los IDs V4 documentados y valida el comportamiento. V3 sigue siendo útil para investigación, despliegue de pesos históricos o comparación reproducible, no como nombre genérico de la API.

Fuentes oficiales