# Benchmark de DeepSeek V4 en español — 10 de agosto de 2026

Diseño: 4 variantes regionales × 5 tareas cerradas × 2 modelos × 3 repeticiones = 120 solicitudes.

Modelos: deepseek-v4-flash y deepseek-v4-pro. Thinking desactivado; temperatura 0; ejecución secuencial con orden alternado.

La puntuación usa únicamente criterios binarios deterministas (formato, cadenas requeridas/prohibidas, coincidencia exacta, JSON válido y conteo de palabras). No se utilizó otro modelo como juez.

Los prompts y sus datos son ficticios. El JSON y el CSV incluyen cada prompt, salida, criterio, tokens, latencia, caché y coste estimado con la tarifa oficial verificada. No incluyen la clave API ni identificadores de respuesta.

Límites: no es una prueba geográfica; las solicitudes salieron de una sola sesión. No mide thinking, visión, búsqueda web, seguridad integral, conocimiento abierto ni todos los usos posibles. Tres repeticiones por combinación no permiten generalizar a futuras versiones.
