DeepSeek V3.1, presentado el 21 de agosto de 2025, convirtió la familia V3 en un modelo híbrido capaz de trabajar con razonamiento y sin razonamiento mediante distintas plantillas de chat. También reforzó el uso de herramientas y los flujos de agentes. DeepSeek publicó después V3.1‑Terminus, el 22 de septiembre de 2025, para mejorar la consistencia lingüística y el rendimiento de agentes.
Estado documental a 29 de julio de 2026: esta es una referencia histórica del checkpoint abierto, no una descripción del modelo alojado vigente. La generación oficial de la API es DeepSeek V4 Preview. DeepSeek anunció la retirada de deepseek-chat y deepseek-reasoner para el 24 de julio; la documentación operativa actual ya no los enumera. No se probó su respuesta efectiva con una clave válida.
Resumen técnico de DeepSeek V3.1
| Dato | Especificación oficial |
|---|---|
| Lanzamiento de V3.1 | 21 de agosto de 2025 |
| Actualización Terminus | 22 de septiembre de 2025 |
| Arquitectura | La misma estructura MoE que V3, con MLA y 671B parámetros principales |
| Parámetros activados | 37B por token |
| Contexto del checkpoint | 128K tokens |
| Modos | Thinking y non-thinking en un único modelo |
| Preentrenamiento continuado | Aproximadamente 840B tokens para la extensión de contexto |
| Modalidad | Texto; herramientas ejecutadas por la aplicación |
| Licencia | Repositorio y pesos V3.1 bajo MIT; comprobar siempre el checkpoint exacto |
| Estado de API | Generación histórica, sustituida |
Qué cambió frente a DeepSeek V3
DeepSeek V3 ya combinaba una arquitectura MoE de gran escala con una ventana de 128K. V3.1 mantuvo esa estructura física, pero cambió el comportamiento del modelo y su forma de integrarlo. El objetivo fue reunir respuestas directas y razonamiento prolongado en un solo checkpoint, además de mejorar tareas que alternan planificación, herramientas y varios pasos.
- Inferencia híbrida: una plantilla inicia thinking y otra fuerza non-thinking; no son dos pesos separados.
- Razonamiento más eficiente: DeepSeek comunicó una calidad comparable a R1‑0528 en sus evaluaciones, con respuestas de razonamiento más rápidas.
- Herramientas y agentes: el postentrenamiento mejoró llamadas a funciones, agentes de código y búsquedas de varios pasos.
- Nuevo tokenizador y plantilla: una integración local debía actualizar ambos; reutilizar sin revisión la plantilla de V3 podía producir resultados incorrectos.
- Extensión de contexto reforzada: V3.1‑Base continuó el entrenamiento desde la base V3 con más documentos largos.
Cómo funcionan thinking y non-thinking
En los pesos abiertos de V3.1, el modo depende de la plantilla aplicada al diálogo. El modo non-thinking introduce el cierre </think> antes de la respuesta; el modo thinking utiliza <think> para iniciar el razonamiento. Esto es importante porque una aplicación que envía texto plano sin la plantilla oficial puede no seleccionar el comportamiento previsto.
| Modo | Cuándo encajaba | Coste operativo esperado |
|---|---|---|
| Non-thinking | Clasificación, extracción, reescritura, preguntas sencillas y respuestas con baja latencia | Menos tokens de salida y menor espera en casos normales |
| Thinking | Problemas complejos, planificación, matemáticas, código y búsqueda iterativa | Más razonamiento, latencia y consumo variables |
El razonamiento no garantiza una respuesta correcta. Puede seguir una ruta larga y aun así equivocarse, inventar un dato o usar una herramienta con argumentos deficientes. La aplicación debe validar los resultados, limitar los pasos y aplicar permisos. Tampoco debe mostrar razonamientos internos como si fueran pruebas verificadas.
Los 840B tokens de extensión de contexto
El anuncio oficial resumió que V3.1‑Base recibió 840B tokens de preentrenamiento continuado sobre la base V3. La ficha técnica ofrece más detalle: la etapa de extensión a 32K se amplió a 630B tokens y la de 128K a 209B, aproximadamente 839B en total. No significa que el contexto sea de 840B tokens; es la cantidad de datos usada en esas fases de entrenamiento.
El checkpoint publicado mantiene una ventana de 128K. Para evaluar contexto largo hay que medir recuperación, seguimiento de instrucciones y precisión en documentos propios. Introducir el máximo permitido puede empeorar latencia y coste sin mejorar la respuesta. La segmentación, un índice de recuperación y citas trazables suelen ser más útiles que enviar indiscriminadamente todo un repositorio.
Herramientas y agentes en V3.1
La ficha oficial describe llamadas a herramientas en modo non-thinking y una plantilla específica de agente de búsqueda en modo thinking. El modelo genera una solicitud estructurada, pero no navega, ejecuta código ni consulta una base de datos por sí mismo. El software anfitrión decide si la operación está permitida, valida el esquema, ejecuta la función y devuelve una observación.
- Presenta solo las herramientas necesarias para la tarea y describe parámetros de forma inequívoca.
- Valida nombre, tipos, longitudes y valores permitidos antes de ejecutar.
- Exige autorización independiente para escritura, pagos, borrado o acceso a datos sensibles.
- Limita número de pasos, tiempo, coste y tamaño de resultados para evitar bucles.
- Registra la versión exacta del modelo y conserva trazas técnicas sin almacenar secretos.
DeepSeek V3.1-Terminus: qué corrigió
DeepSeek publicó V3.1‑Terminus un mes después del primer V3.1. Según el anuncio oficial, la actualización redujo mezclas inesperadas entre chino e inglés y caracteres aleatorios, y reforzó el rendimiento de agentes de código y búsqueda. DeepSeek la presentó como una salida más estable que la primera revisión V3.1.
Terminus no debe describirse como V3.2. Fue el último ajuste de V3.1 y sirvió de base para DeepSeek V3.2‑Exp. Si reproduces un resultado de septiembre de 2025, distingue deepseek-ai/DeepSeek-V3.1 de deepseek-ai/DeepSeek-V3.1-Terminus. Incluso pequeñas diferencias de tokenizador, plantilla o postentrenamiento pueden cambiar salidas y llamadas a herramientas.
Contexto, pesos y licencia
La ficha de V3.1 indica 671B parámetros principales, 37B activos y 128K de contexto. Hugging Face muestra un tamaño total de 685B al incluir componentes adicionales de la familia. Los pesos usan formatos FP8/BF16 y la propia documentación advierte sobre precisión FP32 para determinados parámetros de corrección y compatibilidad UE8M0 de escalas FP8.
El repositorio y los pesos de V3.1 están bajo MIT, al igual que la ficha oficial de Terminus. Esa licencia permisiva no elimina obligaciones relacionadas con datos, privacidad, marcas, seguridad o normativa sectorial. Tampoco convierte el servicio alojado de DeepSeek en software que controles: descargar pesos y consumir una API son modelos operativos y jurídicos distintos.
Requisitos prácticos de despliegue local
- Infraestructura multinodo o una cuantización evaluada; 671B no es un modelo para una GPU de consumo común.
- Motor compatible con la arquitectura V3 y el formato de escalas utilizado por V3.1.
- Tokenizador y plantilla fijados a la misma revisión que los pesos.
- Pruebas separadas de thinking, non-thinking, conversación múltiple y herramientas.
- Controles de acceso, registros, cifrado, aislamiento y política de retención definidos por el operador.
Estado histórico de la API
En agosto de 2025, DeepSeek asignó deepseek-chat al modo non-thinking de V3.1 y deepseek-reasoner al modo thinking, ambos con contexto de 128K. Esa información solo describe aquel despliegue. Los aliases móviles de una API no son IDs versionados y han apuntado a diferentes generaciones.
A 29 de julio de 2026, la documentación operativa de la API identifica deepseek-v4-flash y deepseek-v4-pro. Los aliases heredados tuvieron una retirada anunciada y ya no aparecen en esa lista. Por tanto, ningún tutorial nuevo debe afirmar que llamar a deepseek-chat reproduce V3.1 o Terminus.
V3.1 frente a las versiones que la sucedieron
| Modelo | Diferencia principal | Estado correcto |
|---|---|---|
| V3.1 | Primera inferencia híbrida de la familia y agentes reforzados | Checkpoint histórico abierto |
| V3.1‑Terminus | Consistencia de idioma y agentes más estables | Actualización histórica de V3.1 |
| V3.2‑Exp | Introduce DeepSeek Sparse Attention como experimento | Predecesor experimental de V3.2 |
| V3.2 | Razonamiento con herramientas y postentrenamiento de agentes a escala | Generación anterior a V4 |
| V4 Preview | Flash/Pro, contexto de 1M y nuevos IDs de API | Generación alojada oficial en la fecha de verificación |
Cómo migrar desde una implementación V3.1
- Determina si utilizas pesos locales V3.1/Terminus o un alias de la API; son rutas diferentes.
- Si consumes la API oficial, selecciona un ID explícito V4 y configura el modo de razonamiento de forma documentada.
- Actualiza el procesamiento de contenido de razonamiento y el ciclo de herramientas; no reutilices ciegamente la plantilla local de V3.1.
- Ejecuta un conjunto de regresión en español con JSON, código, contexto largo y errores de herramienta.
- Compara tokens, latencia y costes documentados antes de cambiar todo el tráfico.
- Conserva V3.1 solo si necesitas reproducibilidad y puedes operar sus pesos con seguridad.
Cuándo conservar V3.1 y cuándo no
Conservar V3.1 o Terminus puede tener sentido cuando una investigación necesita reproducir resultados de 2025, una organización ya ha evaluado esos pesos en infraestructura aislada o una aplicación requiere control local y acepta operar un modelo de esta escala. En esos casos, congela todos los artefactos, crea imágenes de despliegue reproducibles y documenta que el comportamiento no corresponde a la API oficial.
No es la elección natural si el único motivo es que un código antiguo contiene deepseek-chat. Ese nombre nunca fijó V3.1 y ya no aparece en la documentación operativa actual. Tampoco conviene mantenerlo solo para evitar pruebas: cambiar un modelo sin una evaluación es arriesgado, pero conservar indefinidamente software y kernels antiguos también acumula vulnerabilidades y deuda operativa.
Para decidir, compara exactitud, tasa de JSON válido, éxito de herramientas, latencia, memoria, coste energético y esfuerzo de mantenimiento. Incluye pruebas de seguridad con instrucciones maliciosas en resultados de búsqueda y parámetros de herramientas. La opción con mejor benchmark público puede no ser la que ofrece menor riesgo total para tu sistema.
Preguntas frecuentes
¿V3.1 y V3.1-Terminus son el mismo checkpoint?
No. Terminus es una actualización posterior con pesos propios. Mantiene la línea V3.1, pero DeepSeek destacó mejoras de consistencia lingüística y agentes.
¿V3.1 tiene dos modelos, uno de razonamiento y otro de chat?
No en los pesos abiertos. Es un modelo híbrido que cambia de modo mediante la plantilla. Los nombres de API utilizados en 2025 eran rutas del servicio, no dos arquitecturas independientes.
¿Su contexto es 128K o 840B?
128K es la ventana de contexto. Unos 840B tokens son los datos usados en el preentrenamiento continuado de extensión de contexto; miden cosas distintas.
¿Puede buscar en Internet por sí solo?
No. Puede decidir usar una herramienta de búsqueda que proporcione la aplicación, pero el modelo por sí mismo solo genera texto o una solicitud estructurada.
¿Debo iniciar un proyecto nuevo con V3.1?
Solo si necesitas ese checkpoint abierto por investigación, control local o compatibilidad evaluada. Para una integración nueva con la API oficial, usa los modelos V4 explícitos.
