DeepSeek V3.2-Exp: atención dispersa, contexto largo y estado experimental

DeepSeek V3.2‑Exp fue un modelo experimental publicado el 29 de septiembre de 2025 para validar DeepSeek Sparse Attention (DSA), un mecanismo de atención dispersa orientado a reducir el cálculo en secuencias largas. Partió de DeepSeek V3.1‑Terminus y mantuvo una calidad próxima en las evaluaciones publicadas, con el objetivo principal de investigar eficiencia, no de inaugurar una familia estable para integraciones permanentes.

Estado comprobado documentalmente el 29 de julio de 2026: V3.2‑Exp fue sustituido por DeepSeek V3.2 el 1 de diciembre de 2025 y la API oficial pasó a V4 Preview el 24 de abril de 2026. No es un ID seleccionable de la API oficial documentada para proyectos nuevos. No se ejecutó el checkpoint localmente en esta revisión.

Ficha técnica de V3.2-Exp

DatoEspecificación
Fecha de publicación29 de septiembre de 2025
Tipo de versiónExperimental e intermedia
Punto de partidaDeepSeek V3.1‑Terminus
Innovación centralDeepSeek Sparse Attention (DSA)
Arquitectura generalMoE de la familia V3, con un indexador disperso añadido al mecanismo de atención
Tamaño del modelo según la ficha oficial685B parámetros
Posiciones en la configuración del checkpointmax_position_embeddings: 163840
Referencia histórica de APIServicio de contexto largo de la etapa V3; no disponible como modelo vigente
LicenciaRepositorio y pesos bajo MIT
SucesorDeepSeek V3.2

Por qué DeepSeek publicó una versión “Exp”

La etiqueta “Exp” indicaba una versión para explorar una modificación arquitectónica antes de incorporarla a una versión estable. DeepSeek alineó deliberadamente el entrenamiento de V3.2‑Exp con V3.1‑Terminus. De ese modo, las diferencias de calidad y eficiencia podían atribuirse con más claridad a DSA en lugar de a un postentrenamiento completamente distinto.

El anuncio informó de resultados similares entre ambos modelos en dominios generales, razonamiento, código y agentes. “Similar” no significa idéntico en cada benchmark: algunos resultados subieron y otros bajaron. El propósito era mostrar que la atención dispersa reducía trabajo en contexto largo con un impacto limitado sobre la calidad agregada.

Qué es DeepSeek Sparse Attention

En una atención densa, cada token nuevo puede comparar su consulta con una gran parte de los tokens anteriores. El coste crece rápidamente al aumentar la secuencia. DSA introduce un indexador ligero que puntúa las posiciones previas y selecciona un subconjunto relevante para la atención principal. La configuración oficial de V3.2‑Exp incluye 64 cabezas de indexación y una selección superior de 2.048 posiciones.

  • Indexación: estima qué tokens históricos son más útiles para la consulta que se está procesando.
  • Selección fina: la atención principal trabaja sobre posiciones seleccionadas en lugar de recorrer siempre toda la secuencia.
  • Eficiencia de contexto largo: reduce cálculo de entrenamiento e inferencia a medida que aumenta el historial.
  • Compromiso de calidad: una selección imperfecta puede omitir información útil, por lo que DeepSeek comparó DSA con el modelo denso de referencia.

DSA no es una base de datos vectorial, un sistema RAG ni una compresión de documentos externa. Opera dentro de la atención del modelo. Una aplicación puede combinarlo con recuperación, pero cada tecnología resuelve un problema distinto: RAG elige documentos antes de la inferencia; DSA reduce la atención calculada dentro de la secuencia ya enviada.

Contexto: 128K frente a 163.840 posiciones

La API de V3.1, etapa inmediatamente anterior, documentó 128K para deepseek-chat y deepseek-reasoner. En cambio, el config.json del checkpoint abierto V3.2‑Exp declara 163.840 posiciones; el anuncio de V3.2‑Exp no publica en texto un nuevo límite de API. No deben combinarse esos datos en una única promesa comercial.

El valor del archivo expresa posiciones configuradas para el modelo local; la capacidad ofrecida por un servidor depende de su motor, memoria, límites de entrada y salida y política de servicio. Para describir una API histórica, utiliza la documentación correspondiente a aquella fecha. Para un despliegue local, registra la revisión del checkpoint y prueba el límite que realmente admite tu configuración.

La calidad tampoco se deduce del máximo. Evalúa recuperación de hechos, instrucciones separadas por miles de tokens, código con dependencias lejanas y consistencia de citas. Un contexto mayor puede aumentar tiempo y memoria aunque DSA reduzca parte del cálculo.

V3.2-Exp frente a V3.1-Terminus

AspectoV3.1‑TerminusV3.2‑Exp
ObjetivoEstabilidad lingüística y agentesValidar atención dispersa
AtenciónMLA de la línea V3.1MLA con DeepSeek Sparse Attention
Entrenamiento comparativoModelo de referenciaConfiguración alineada para aislar el efecto de DSA
Calidad declaradaBase comparativaEn conjunto, a la par de Terminus
CarácterActualización de V3.1Experimento intermedio
SucesiónBase de V3.2‑ExpSustituido por V3.2

Las cifras oficiales no deben usarse como una clasificación universal. Los resultados dependen del conjunto, la plantilla, herramientas, límite de salida y criterios de puntuación. Para elegir un modelo local, repite pruebas con español, datos propios y el motor que utilizarás en producción.

El error de RoPE corregido el 17 de noviembre

DeepSeek añadió una nota importante al repositorio el 17 de noviembre de 2025. Versiones anteriores del código de demostración tenían una discrepancia en Rotary Position Embedding dentro del módulo indexador: el indexador requería un diseño no intercalado, mientras que MLA esperaba uno intercalado. La implementación podía degradar el rendimiento y fue corregida.

Quien reproduzca resultados no debe usar una copia antigua del demo sin identificar su commit. El checkpoint, el código de conversión, los kernels y el motor de inferencia forman parte de la versión reproducible. Comparar motores con implementaciones distintas de RoPE puede atribuir falsamente la diferencia al modelo.

Pesos, kernels y despliegue local

DeepSeek publicó los pesos y kernels clave. El repositorio señala TileLang para kernels legibles de investigación, DeepGEMM para kernels CUDA del indexador y FlashMLA para atención dispersa. También documentó SGLang y soporte inicial de vLLM. Estas piezas permiten estudiar DSA, pero no constituyen un servicio listo para producción.

  1. Descarga los pesos oficiales y fija una revisión; verifica integridad antes de convertirlos.
  2. Usa el código corregido posterior a la nota de RoPE o aplica la corrección verificada.
  3. Comprueba que el motor implementa DSA, la plantilla y el formato FP8 del checkpoint.
  4. Mide precisión y velocidad a varias longitudes; una prueba corta no demuestra la ventaja de DSA.
  5. Limita herramientas, secretos, acceso de red y escritura en el entorno de ejecución.
  6. Revisa la licencia MIT del artefacto exacto y las licencias de cuantizaciones o kernels añadidos.

Aunque la ficha oficial de Hugging Face muestra 685B parámetros, un despliegue completo exige múltiples aceleradores y una red rápida. Una cuantización comunitaria puede reducir memoria, pero cambia precisión, soporte y procedencia; no debe etiquetarse como checkpoint oficial sin aclaración.

Licencia MIT y significado de “abierto”

El repositorio y los pesos de V3.2‑Exp se publicaron bajo MIT. Esto permite usar, copiar, modificar y distribuir con las condiciones de la licencia. Sin embargo, los pesos abiertos no incluyen necesariamente el corpus completo, todas las decisiones de entrenamiento ni el servicio de moderación de DeepSeek. El operador local asume alojamiento, seguridad, cumplimiento, registros y evaluación.

Qué ocurrió con la API de V3.2-Exp

En su lanzamiento, V3.2‑Exp se activó en web, aplicación y API, y DeepSeek anunció una reducción de precios superior al 50 %. Ese precio era histórico y no debe utilizarse para calcular una factura de 2026. V3.1‑Terminus permaneció temporalmente disponible para comparación hasta el 15 de octubre de 2025 a las 15:59 UTC.

Después, V3.2 sustituyó al experimento y V4 sustituyó la generación alojada V3. En la API oficial documentada, usa IDs explícitos V4. Los aliases deepseek-chat y deepseek-reasoner nunca recuperaron V3.2‑Exp de forma versionada; DeepSeek anunció su retirada para el 24 de julio de 2026 y la lista operativa actual ya no los incluye.

De V3.2-Exp a V3.2 y V4

VersiónFunción en la evoluciónUso adecuado
V3.2‑ExpValidación de DSA con entrenamiento alineado a TerminusInvestigación arquitectónica y reproducción
V3.2Consolida DSA, razonamiento y agentesReferencia de la generación estable anterior a V4
V4 Flash/ProNueva arquitectura, contexto oficial de 1M e IDs explícitosIntegración nueva con la API oficial

Si mantienes V3.2‑Exp localmente, migra solo después de una comparación controlada; una investigación puede necesitar el experimento exacto. Si dependes del servicio oficial, no intentes fijar una generación antigua mediante aliases. Selecciona V4, prueba el modo de razonamiento, vuelve a validar herramientas y consulta los precios vigentes de DeepSeek.

Cómo evaluar si DSA aporta una ventaja

Una comparación útil mantiene constantes el hardware, precisión, lote, motor, plantilla y longitud de salida. Mide por separado prefill y decodificación, porque DSA afecta especialmente el procesamiento del contexto. Incluye secuencias cortas, medias y largas; si solo pruebas 2K tokens, la diferencia arquitectónica puede quedar oculta por otros costes.

  • Rendimiento: tokens por segundo, latencia hasta el primer token y solicitudes concurrentes.
  • Recursos: memoria de pesos, caché, utilización de aceleradores y comunicación entre nodos.
  • Calidad: recuperación de evidencia, seguimiento de instrucciones y exactitud de código o razonamiento.
  • Estabilidad: errores del motor, salidas mal formadas y comportamiento a la longitud máxima configurada.

Publica junto al resultado las revisiones de pesos y código, incluida la corrección de RoPE. Sin esos datos, una cifra de velocidad no permite saber si se midió DSA correctamente ni si la comparación mantuvo la misma calidad.

Preguntas frecuentes

¿V3.2-Exp es una versión más nueva que V3.2?

No. “Exp” fue el experimento del 29 de septiembre de 2025. V3.2 se publicó después, el 1 de diciembre, como sucesor oficial.

¿DSA aumenta por sí sola la ventana de contexto?

Su objetivo principal es reducir el cálculo de atención en secuencias largas. El límite efectivo sigue dependiendo de configuración, entrenamiento, memoria y servidor.

¿El contexto es 128K o 163.840?

La configuración del checkpoint abierto declara 163.840 posiciones. La API de V3.1 inmediatamente anterior documentó 128K, mientras que el anuncio textual de V3.2‑Exp no publicó un nuevo límite de API. Cita siempre la versión, el entorno y la fuente del número.

¿Puedo llamar a V3.2-Exp con deepseek-chat?

No. El alias nunca fijó una versión de V3.2‑Exp y ya no aparece en la lista operativa actual. Para reproducir el experimento debe utilizarse el checkpoint exacto y documentarse el entorno local.

¿Es apropiado para producción?

Fue publicado como experimento y tuvo una corrección relevante del demo. Puede ser útil para investigación, pero un sistema de producción debe preferir una versión mantenida o asumir explícitamente la operación del checkpoint fijado.

Fuentes oficiales