DeepSeek R1: versiones, R1-0528, modelos Distill y situación de la API

DeepSeek R1 es una familia de modelos de razonamiento publicada por DeepSeek en 2025. Su importancia no se limita a un nombre comercial: el proyecto mostró cómo el aprendizaje por refuerzo podía fomentar conductas de razonamiento extensas, publicó pesos de gran escala y ofreció seis modelos destilados más pequeños. Sin embargo, DeepSeek R1 no debe confundirse con los identificadores que ofrece la API oficial en 2026. Esta página explica la familia histórica y sus pesos, no presenta R1 como el modelo servido actualmente por la plataforma.

Verificación editorial: 29 de julio de 2026. Revisión documental; no se ejecutó R1 localmente ni se probó la API con una clave válida.

Estado que debes conocer: los pesos DeepSeek-R1, DeepSeek-R1-0528 y sus variantes destiladas siguen siendo referencias descargables. No son identificadores vigentes de la API oficial. DeepSeek anunció la retirada del alias deepseek-reasoner para el 24 de julio de 2026 a las 15:59 UTC; la documentación operativa actual ya no lo enumera. No se probó su respuesta efectiva con una clave válida.

Resumen rápido de la familia DeepSeek R1

NombreQué representaDatos esencialesSituación
DeepSeek-R1-ZeroExperimento de razonamiento entrenado con RL sin SFT previo671B parámetros totales, 37B activados, contexto de 128KPesos de investigación
DeepSeek-R1Primera versión completa con datos de arranque en frío, SFT y RL671B totales, 37B activados, 128KPesos publicados; lanzamiento del 20 de enero de 2025
DeepSeek-R1-0528Actualización de R1 con razonamiento, código y uso de herramientas mejoradosArquitectura de gran escala; generación de hasta 64K en la evaluación oficialPesos publicados el 28 de mayo de 2025
R1 DistillModelos densos ajustados con ejemplos generados por R11.5B, 7B, 8B, 14B, 32B y 70BPesos separados basados en Qwen o Llama
deepseek-reasonerAlias antiguo de la APIRuta temporal histórica hacia V4 Flash con pensamientoRetirada anunciada para el 24/07/2026, 15:59 UTC; no aparece en la lista operativa actual

Qué es DeepSeek R1 y por qué fue relevante

DeepSeek presentó R1 el 20 de enero de 2025 como su primera generación de modelos centrados en razonamiento. El trabajo incluyó dos rutas. DeepSeek-R1-Zero aplicó aprendizaje por refuerzo a un modelo base sin una fase inicial de ajuste supervisado. Durante ese proceso aparecieron conductas como la autoverificación, la reflexión y cadenas de razonamiento largas. El experimento también mostró problemas claros: repeticiones, legibilidad deficiente y mezcla de idiomas.

DeepSeek-R1 añadió datos de arranque en frío antes del aprendizaje por refuerzo y utilizó una canalización con etapas de RL y SFT. El objetivo era conservar la capacidad de resolver problemas complejos, pero producir respuestas más legibles y alineadas. La arquitectura parte de DeepSeek-V3-Base y utiliza mezcla de expertos: el repositorio oficial declara 671.000 millones de parámetros totales, 37.000 millones activados por token y una longitud de contexto de 128K.

Es importante interpretar correctamente esas cifras. “37B activados” no significa que el archivo pese como un modelo denso de 37B. Los pesos completos siguen representando una implementación de 671B, por lo que el almacenamiento, la memoria, la cuantización y la infraestructura de inferencia deben calcularse para el artefacto concreto. Esta página no promete que R1 completo funcione en un ordenador personal ni recomienda una configuración de hardware universal.

R1-Zero frente a R1

  • R1-Zero sirve sobre todo para estudiar qué patrones emergen del aprendizaje por refuerzo sin SFT inicial. Su tendencia a repetir, mezclar idiomas o presentar razonamientos difíciles de leer limita su conveniencia para un asistente de producción.
  • R1 incorpora datos iniciales y etapas de ajuste adicionales. Es el punto de referencia adecuado cuando se habla del lanzamiento general de enero de 2025.
  • Ambos comparten la escala 671B/37B y el contexto declarado de 128K, pero no son intercambiables: tienen objetivos de entrenamiento y comportamiento distintos.

Qué cambió en DeepSeek-R1-0528

El 28 de mayo de 2025, DeepSeek publicó DeepSeek-R1-0528 como una actualización menor de la familia. La ficha oficial atribuye la mejora a más recursos de cómputo y optimizaciones algorítmicas durante el postentrenamiento. DeepSeek informó de mayor profundidad de razonamiento, mejores resultados en matemáticas y programación, menor tasa de alucinación y una experiencia mejorada para programación asistida.

R1-0528 añadió o mejoró compatibilidad con salida JSON y llamadas a funciones. También cambió recomendaciones de uso: admite un mensaje de sistema y ya no exige forzar el inicio de la respuesta con <think>. En las pruebas publicadas por DeepSeek, la longitud máxima de generación se fijó en 64K tokens, con temperatura 0,6, top_p 0,95 y varias muestras por pregunta. Esas condiciones importan antes de comparar cifras.

Por ejemplo, la ficha informó de un aumento de AIME 2025 de 70,0 a 87,5 y de LiveCodeBench de 63,5 a 73,3. No deben presentarse como garantías para cualquier consulta: son resultados del proveedor bajo protocolos concretos. La misma tabla muestra que no todas las métricas mejoraron; SimpleQA pasó de 30,1 a 27,8. Un análisis responsable conserva tanto las mejoras como las excepciones.

Modelos DeepSeek R1 Distill

Los modelos Distill no son versiones comprimidas bit a bit del MoE de 671B. DeepSeek utilizó muestras generadas por R1 para ajustar modelos densos de otras familias. Esto reduce la barrera de despliegue, pero también cambia arquitectura, tokenizer, licencia de origen y comportamiento.

Checkpoint de DeepSeekModelo base declaradoNota de licencia
R1-Distill-Qwen-1.5BQwen2.5-Math-1.5BDerivado de una base Apache 2.0
R1-Distill-Qwen-7BQwen2.5-Math-7BDerivado de una base Apache 2.0
R1-Distill-Llama-8BLlama 3.1 8BTambién se aplican los términos de Llama 3.1
R1-Distill-Qwen-14BQwen2.5-14BDerivado de una base Apache 2.0
R1-Distill-Qwen-32BQwen2.5-32BDerivado de una base Apache 2.0
R1-Distill-Llama-70BLlama 3.3 70B InstructTambién se aplican los términos de Llama 3.3

La colección posterior incluye además DeepSeek-R1-0528-Qwen3-8B, entrenado a partir de Qwen3 8B Base con cadenas de razonamiento de R1-0528. No conviene agruparlo sin más con los seis Distill originales: se publicó con la actualización de mayo y tiene otra base. Antes de redistribuir, modificar o comercializar cualquier derivado, revisa la licencia exacta de su ficha y la del modelo base.

¿Se puede usar DeepSeek R1 mediante la API?

En enero de 2025, la documentación indicaba model=deepseek-reasoner para acceder a R1. Esa instrucción pertenece al contexto de aquel lanzamiento. En abril de 2026, DeepSeek documentó temporalmente el alias como ruta a deepseek-v4-flash con pensamiento y anunció su retirada para el 24 de julio. A 29 de julio, las páginas operativas solo enumeran los dos IDs V4 explícitos; no se verificó mediante una llamada autenticada qué respuesta devuelve hoy el alias.

Para una integración nueva, utiliza un identificador documentado en la guía de la API de DeepSeek, como deepseek-v4-flash o deepseek-v4-pro, y activa o desactiva el modo de pensamiento según la tarea. Consulta la guía de DeepSeek V4 para separar capacidades de servicio, contexto y modelos. No uses el nombre de un repositorio de Hugging Face como si fuera automáticamente un ID de la API oficial.

Pesos, licencia y despliegue propio

El repositorio de R1 y sus pesos se publicaron bajo licencia MIT y DeepSeek permite uso comercial, modificaciones y trabajos derivados, incluida la destilación. En los modelos derivados de Qwen y Llama también debes respetar las condiciones de la base correspondiente. “Pesos disponibles” no equivale a un servicio administrado: quien despliega el modelo asume inferencia, actualizaciones, registro, control de acceso, moderación y protección de datos.

  • Comprueba el identificador y la revisión exacta del checkpoint; R1, R1-0528 y los Distill no son el mismo artefacto.
  • Calcula memoria y almacenamiento a partir del formato, precisión y motor elegidos, no solo de los parámetros activados.
  • Prueba el formato del chat y las recomendaciones específicas de la versión. Las indicaciones de R1 original no son idénticas a las de R1-0528.
  • Aísla secretos, código privado y datos personales. Revisa nuestra guía de seguridad antes de conectar un modelo a sistemas reales.
  • Mide exactitud, latencia y coste con un conjunto representativo en español; una tabla de benchmark no sustituye una prueba de aceptación.

Para qué tareas sigue siendo útil estudiar R1

R1 conserva valor como familia de investigación y como conjunto de pesos reproducibles. Puede ser pertinente para estudiar destilación, comparar estrategias de razonamiento, experimentar con inferencia propia o construir una evaluación histórica. Los Distill pueden facilitar ensayos donde el modelo completo resulta impracticable. Para productos conectados a la plataforma de DeepSeek, en cambio, la decisión debe partir de los modelos y funciones que la API documente en ese momento.

En matemáticas, código, lógica o planificación, una respuesta extensa no demuestra que el razonamiento sea correcto. Pide una respuesta final separada, ejecuta pruebas cuando haya código, recalcula operaciones y solicita fuentes para datos verificables. No expongas cadenas internas de razonamiento como requisito de auditoría; evalúa entradas, salidas, herramientas usadas y evidencias comprobables.

Cómo evitar confusiones al elegir

NecesidadRuta coherente
Investigar el lanzamiento de razonamiento de 2025DeepSeek-R1 o R1-Zero y su informe técnico
Examinar las mejoras de mayo de 2025DeepSeek-R1-0528
Ensayar pesos densos de menor tamañoUn R1-Distill, tras revisar base y licencia
Crear una integración nueva con la API oficialV4 Flash o V4 Pro; no el alias heredado
Elegir una solución para empresa o equipoComparar API, aplicación y despliegue en Soluciones con DeepSeek

Preguntas frecuentes sobre DeepSeek R1

¿DeepSeek R1 es un modelo disponible actualmente en la API?

No como identificador propio en la documentación operativa actual. deepseek-reasoner fue un alias heredado con retirada anunciada y ya no aparece en la lista de modelos vigentes. Los pesos de R1 pueden seguir utilizándose mediante infraestructura propia o proveedores que los ofrezcan, bajo sus condiciones.

¿R1-0528 es lo mismo que R1?

No exactamente. Es una actualización de la misma familia, publicada el 28 de mayo de 2025, con mejoras declaradas en razonamiento, programación, alucinaciones, JSON y llamadas a funciones. También modifica recomendaciones de prompting.

¿Qué diferencia hay entre R1 y R1 Distill?

R1 es el modelo MoE de 671B/37B basado en V3-Base. Los Distill son modelos densos Qwen o Llama ajustados con muestras de R1. Tienen otras escalas, bases y obligaciones de licencia.

¿DeepSeek R1 entiende español?

Puede responder en español, pero los resultados dependen de la versión, el formato y la tarea. R1-Zero documentó mezcla de idiomas como una limitación. Evalúa terminología, instrucciones y exactitud con ejemplos españoles propios antes de desplegarlo.

¿La licencia MIT se aplica a todos los Distill sin condiciones adicionales?

No debes asumirlo. El proyecto R1 usa MIT, pero los Distill basados en Llama conservan condiciones de las licencias Llama, y los basados en Qwen proceden de modelos Apache 2.0. Revisa siempre la ficha del checkpoint seleccionado.

Fuentes oficiales consultadas