DeepSeek V3.2‑Exp fue un modelo experimental publicado el 29 de septiembre de 2025 para validar DeepSeek Sparse Attention (DSA), un mecanismo de atención dispersa orientado a reducir el cálculo en secuencias largas. Partió de DeepSeek V3.1‑Terminus y mantuvo una calidad próxima en las evaluaciones publicadas, con el objetivo principal de investigar eficiencia, no de inaugurar una familia estable para integraciones permanentes.
Estado comprobado documentalmente el 29 de julio de 2026: V3.2‑Exp fue sustituido por DeepSeek V3.2 el 1 de diciembre de 2025 y la API oficial pasó a V4 Preview el 24 de abril de 2026. No es un ID seleccionable de la API oficial documentada para proyectos nuevos. No se ejecutó el checkpoint localmente en esta revisión.
Ficha técnica de V3.2-Exp
| Dato | Especificación |
|---|---|
| Fecha de publicación | 29 de septiembre de 2025 |
| Tipo de versión | Experimental e intermedia |
| Punto de partida | DeepSeek V3.1‑Terminus |
| Innovación central | DeepSeek Sparse Attention (DSA) |
| Arquitectura general | MoE de la familia V3, con un indexador disperso añadido al mecanismo de atención |
| Tamaño del modelo según la ficha oficial | 685B parámetros |
| Posiciones en la configuración del checkpoint | max_position_embeddings: 163840 |
| Referencia histórica de API | Servicio de contexto largo de la etapa V3; no disponible como modelo vigente |
| Licencia | Repositorio y pesos bajo MIT |
| Sucesor | DeepSeek V3.2 |
Por qué DeepSeek publicó una versión “Exp”
La etiqueta “Exp” indicaba una versión para explorar una modificación arquitectónica antes de incorporarla a una versión estable. DeepSeek alineó deliberadamente el entrenamiento de V3.2‑Exp con V3.1‑Terminus. De ese modo, las diferencias de calidad y eficiencia podían atribuirse con más claridad a DSA en lugar de a un postentrenamiento completamente distinto.
El anuncio informó de resultados similares entre ambos modelos en dominios generales, razonamiento, código y agentes. “Similar” no significa idéntico en cada benchmark: algunos resultados subieron y otros bajaron. El propósito era mostrar que la atención dispersa reducía trabajo en contexto largo con un impacto limitado sobre la calidad agregada.
Qué es DeepSeek Sparse Attention
En una atención densa, cada token nuevo puede comparar su consulta con una gran parte de los tokens anteriores. El coste crece rápidamente al aumentar la secuencia. DSA introduce un indexador ligero que puntúa las posiciones previas y selecciona un subconjunto relevante para la atención principal. La configuración oficial de V3.2‑Exp incluye 64 cabezas de indexación y una selección superior de 2.048 posiciones.
- Indexación: estima qué tokens históricos son más útiles para la consulta que se está procesando.
- Selección fina: la atención principal trabaja sobre posiciones seleccionadas en lugar de recorrer siempre toda la secuencia.
- Eficiencia de contexto largo: reduce cálculo de entrenamiento e inferencia a medida que aumenta el historial.
- Compromiso de calidad: una selección imperfecta puede omitir información útil, por lo que DeepSeek comparó DSA con el modelo denso de referencia.
DSA no es una base de datos vectorial, un sistema RAG ni una compresión de documentos externa. Opera dentro de la atención del modelo. Una aplicación puede combinarlo con recuperación, pero cada tecnología resuelve un problema distinto: RAG elige documentos antes de la inferencia; DSA reduce la atención calculada dentro de la secuencia ya enviada.
Contexto: 128K frente a 163.840 posiciones
La API de V3.1, etapa inmediatamente anterior, documentó 128K para deepseek-chat y deepseek-reasoner. En cambio, el config.json del checkpoint abierto V3.2‑Exp declara 163.840 posiciones; el anuncio de V3.2‑Exp no publica en texto un nuevo límite de API. No deben combinarse esos datos en una única promesa comercial.
El valor del archivo expresa posiciones configuradas para el modelo local; la capacidad ofrecida por un servidor depende de su motor, memoria, límites de entrada y salida y política de servicio. Para describir una API histórica, utiliza la documentación correspondiente a aquella fecha. Para un despliegue local, registra la revisión del checkpoint y prueba el límite que realmente admite tu configuración.
La calidad tampoco se deduce del máximo. Evalúa recuperación de hechos, instrucciones separadas por miles de tokens, código con dependencias lejanas y consistencia de citas. Un contexto mayor puede aumentar tiempo y memoria aunque DSA reduzca parte del cálculo.
V3.2-Exp frente a V3.1-Terminus
| Aspecto | V3.1‑Terminus | V3.2‑Exp |
|---|---|---|
| Objetivo | Estabilidad lingüística y agentes | Validar atención dispersa |
| Atención | MLA de la línea V3.1 | MLA con DeepSeek Sparse Attention |
| Entrenamiento comparativo | Modelo de referencia | Configuración alineada para aislar el efecto de DSA |
| Calidad declarada | Base comparativa | En conjunto, a la par de Terminus |
| Carácter | Actualización de V3.1 | Experimento intermedio |
| Sucesión | Base de V3.2‑Exp | Sustituido por V3.2 |
Las cifras oficiales no deben usarse como una clasificación universal. Los resultados dependen del conjunto, la plantilla, herramientas, límite de salida y criterios de puntuación. Para elegir un modelo local, repite pruebas con español, datos propios y el motor que utilizarás en producción.
El error de RoPE corregido el 17 de noviembre
DeepSeek añadió una nota importante al repositorio el 17 de noviembre de 2025. Versiones anteriores del código de demostración tenían una discrepancia en Rotary Position Embedding dentro del módulo indexador: el indexador requería un diseño no intercalado, mientras que MLA esperaba uno intercalado. La implementación podía degradar el rendimiento y fue corregida.
Quien reproduzca resultados no debe usar una copia antigua del demo sin identificar su commit. El checkpoint, el código de conversión, los kernels y el motor de inferencia forman parte de la versión reproducible. Comparar motores con implementaciones distintas de RoPE puede atribuir falsamente la diferencia al modelo.
Pesos, kernels y despliegue local
DeepSeek publicó los pesos y kernels clave. El repositorio señala TileLang para kernels legibles de investigación, DeepGEMM para kernels CUDA del indexador y FlashMLA para atención dispersa. También documentó SGLang y soporte inicial de vLLM. Estas piezas permiten estudiar DSA, pero no constituyen un servicio listo para producción.
- Descarga los pesos oficiales y fija una revisión; verifica integridad antes de convertirlos.
- Usa el código corregido posterior a la nota de RoPE o aplica la corrección verificada.
- Comprueba que el motor implementa DSA, la plantilla y el formato FP8 del checkpoint.
- Mide precisión y velocidad a varias longitudes; una prueba corta no demuestra la ventaja de DSA.
- Limita herramientas, secretos, acceso de red y escritura en el entorno de ejecución.
- Revisa la licencia MIT del artefacto exacto y las licencias de cuantizaciones o kernels añadidos.
Aunque la ficha oficial de Hugging Face muestra 685B parámetros, un despliegue completo exige múltiples aceleradores y una red rápida. Una cuantización comunitaria puede reducir memoria, pero cambia precisión, soporte y procedencia; no debe etiquetarse como checkpoint oficial sin aclaración.
Licencia MIT y significado de “abierto”
El repositorio y los pesos de V3.2‑Exp se publicaron bajo MIT. Esto permite usar, copiar, modificar y distribuir con las condiciones de la licencia. Sin embargo, los pesos abiertos no incluyen necesariamente el corpus completo, todas las decisiones de entrenamiento ni el servicio de moderación de DeepSeek. El operador local asume alojamiento, seguridad, cumplimiento, registros y evaluación.
Qué ocurrió con la API de V3.2-Exp
En su lanzamiento, V3.2‑Exp se activó en web, aplicación y API, y DeepSeek anunció una reducción de precios superior al 50 %. Ese precio era histórico y no debe utilizarse para calcular una factura de 2026. V3.1‑Terminus permaneció temporalmente disponible para comparación hasta el 15 de octubre de 2025 a las 15:59 UTC.
Después, V3.2 sustituyó al experimento y V4 sustituyó la generación alojada V3. En la API oficial documentada, usa IDs explícitos V4. Los aliases deepseek-chat y deepseek-reasoner nunca recuperaron V3.2‑Exp de forma versionada; DeepSeek anunció su retirada para el 24 de julio de 2026 y la lista operativa actual ya no los incluye.
De V3.2-Exp a V3.2 y V4
| Versión | Función en la evolución | Uso adecuado |
|---|---|---|
| V3.2‑Exp | Validación de DSA con entrenamiento alineado a Terminus | Investigación arquitectónica y reproducción |
| V3.2 | Consolida DSA, razonamiento y agentes | Referencia de la generación estable anterior a V4 |
| V4 Flash/Pro | Nueva arquitectura, contexto oficial de 1M e IDs explícitos | Integración nueva con la API oficial |
Si mantienes V3.2‑Exp localmente, migra solo después de una comparación controlada; una investigación puede necesitar el experimento exacto. Si dependes del servicio oficial, no intentes fijar una generación antigua mediante aliases. Selecciona V4, prueba el modo de razonamiento, vuelve a validar herramientas y consulta los precios vigentes de DeepSeek.
Cómo evaluar si DSA aporta una ventaja
Una comparación útil mantiene constantes el hardware, precisión, lote, motor, plantilla y longitud de salida. Mide por separado prefill y decodificación, porque DSA afecta especialmente el procesamiento del contexto. Incluye secuencias cortas, medias y largas; si solo pruebas 2K tokens, la diferencia arquitectónica puede quedar oculta por otros costes.
- Rendimiento: tokens por segundo, latencia hasta el primer token y solicitudes concurrentes.
- Recursos: memoria de pesos, caché, utilización de aceleradores y comunicación entre nodos.
- Calidad: recuperación de evidencia, seguimiento de instrucciones y exactitud de código o razonamiento.
- Estabilidad: errores del motor, salidas mal formadas y comportamiento a la longitud máxima configurada.
Publica junto al resultado las revisiones de pesos y código, incluida la corrección de RoPE. Sin esos datos, una cifra de velocidad no permite saber si se midió DSA correctamente ni si la comparación mantuvo la misma calidad.
Preguntas frecuentes
¿V3.2-Exp es una versión más nueva que V3.2?
No. “Exp” fue el experimento del 29 de septiembre de 2025. V3.2 se publicó después, el 1 de diciembre, como sucesor oficial.
¿DSA aumenta por sí sola la ventana de contexto?
Su objetivo principal es reducir el cálculo de atención en secuencias largas. El límite efectivo sigue dependiendo de configuración, entrenamiento, memoria y servidor.
¿El contexto es 128K o 163.840?
La configuración del checkpoint abierto declara 163.840 posiciones. La API de V3.1 inmediatamente anterior documentó 128K, mientras que el anuncio textual de V3.2‑Exp no publicó un nuevo límite de API. Cita siempre la versión, el entorno y la fuente del número.
¿Puedo llamar a V3.2-Exp con deepseek-chat?
No. El alias nunca fijó una versión de V3.2‑Exp y ya no aparece en la lista operativa actual. Para reproducir el experimento debe utilizarse el checkpoint exacto y documentarse el entorno local.
¿Es apropiado para producción?
Fue publicado como experimento y tuvo una corrección relevante del demo. Puede ser útil para investigación, pero un sistema de producción debe preferir una versión mantenida o asumir explícitamente la operación del checkpoint fijado.
Fuentes oficiales
- Anuncio oficial de DeepSeek V3.2‑Exp.
- Repositorio oficial, corrección de RoPE y kernels.
- Ficha y pesos oficiales de V3.2‑Exp.
- Configuración oficial del checkpoint.
- Anuncio del sucesor DeepSeek V3.2.
- Anuncio oficial de V3.1 con la referencia de contexto de 128K.
- Anuncio oficial de V4 y retirada de los aliases heredados.
