Moonshot AI presentó Kimi K3 el 16 de julio. Ese mismo día abrió el acceso en web y móvil, Kimi Work, Kimi Code y la API. El 27 de julio publicó los pesos completos y el informe técnico. Las cifras llaman la atención: 2,8 billones de parámetros, un contexto de un millón de tokens y visión nativa.

Tres días después llegó una señal más interesante. El 19 de julio, Moonshot dijo que la demanda de las 48 horas anteriores había llevado su capacidad de GPU casi al límite. Pausó las nuevas suscripciones y mantuvo la prioridad para los clientes existentes. Que un modelo recién lanzado atraiga público es normal. Tener que limitar las nuevas altas demuestra que la capacidad para servir el modelo ya forma parte del producto.

DeepSeek impulsaba al mismo tiempo la familia V4 y Alibaba Cloud trasladaba Qwen3.8-Max de preview a versión oficial. La frase “DeepSeek es barato” ya no describe el mercado chino. Rendimiento, precio, licencia y distribución se están moviendo a la vez.

Por eso no me interesa decidir quién ganó un benchmark. La cuestión práctica es otra: si hoy dejamos fuera los modelos chinos de una selección seria, ¿estamos ignorando una parte relevante del mercado?

Las cifras de Kimi K3 impresionan, pero siguen siendo cifras del fabricante

K3 no activa sus 2,8 billones de parámetros en cada consulta. Su arquitectura MoE dirige cada token a 16 de 896 expertos. Busca ofrecer la capacidad de un modelo enorme sin asumir todo el coste de cálculo en cada paso.

Moonshot sostiene que K3 compite de cerca con modelos punteros en programación, navegación, automatización y trabajo de conocimiento. La empresa también cita Frontend Code Arena, una clasificación basada en preferencias humanas donde K3 quedó arriba tras su lanzamiento. Son señales útiles, pero todavía necesitan confirmación independiente.

Conviene detenerse aquí antes de repetir la clasificación. El gráfico de esta página pertenece a Moonshot. Según el modelo, se usaron Kimi Code, Claude Code o Codex; el esfuerzo de razonamiento y las condiciones de fallback tampoco fueron idénticos. El propio anuncio reconoce que K3, en términos generales, aún queda por detrás de Claude Fable 5 y GPT-5.6 Sol.

Esa concesión hace el documento más creíble. Permite ver dónde compite K3 sin convertir una tabla controlada por el proveedor en un veredicto de mercado. El titular “China ya tiene el mejor modelo” va más lejos de lo que permiten los datos.

El argumento fuerte de K3 es su amplitud. Reúne documentos largos, imágenes, herramientas de programación y un millón de tokens de contexto. Sus límites importan igual: la salida puede volverse inestable si no se conserva bien el historial de razonamiento o si se cambia de modelo a mitad de sesión. Moonshot también advierte que puede actuar con exceso de iniciativa y recomienda límites más claros en el system prompt o en AGENTS.md.

Gráficos de Kimi que comparan modelos de IA en programación, trabajo de conocimiento, automatización, navegación y tareas visuales
Son resultados publicados por Moonshot AI en la documentación técnica de Kimi K3. Los harness y las condiciones cambian entre modelos, así que no forman una clasificación independiente y universal. — Fuente: Moonshot AI, Kimi K3 technical report

Que los pesos sean abiertos no significa que el uso sea gratis ni esté libre de condiciones

Moonshot publicó los pesos completos el 27 de julio. Los investigadores pueden examinarlos y los proveedores de inferencia pueden crear servicios sobre ellos. Eso no convierte K3 en software libre sin restricciones.

El modelo usa una licencia propia, Kimi K3 License. Permite investigación, desarrollo y muchos usos comerciales, pero los grandes proveedores de Model-as-a-Service deben negociar condiciones separadas. También existen obligaciones de atribución. “Los pesos son públicos” y “cualquier empresa puede hacer lo que quiera” no son equivalentes.

La infraestructura sigue teniendo coste. Servir un modelo de 2,8 billones de parámetros exige GPU, una pila de inferencia y personal capaz de mantenerla. Moonshot recomienda supernodes de al menos 64 aceleradores. Descargar los archivos no lo convierte en una opción barata de self-hosting para una empresa corriente.

La ventaja práctica de los pesos abiertos es otra: varios proveedores pueden ofrecer el mismo modelo y competir en precio, región, privacidad y disponibilidad.

DeepSeek cambia primero la conversación sobre el precio

Al revisar de nuevo la tarifa oficial el 25 de agosto, DeepSeek V4-Pro costaba 0,66 dólares fuera de hora punta o 1,32 en hora punta por millón de tokens de entrada sin caché; la salida costaba 1,98 o 3,96 dólares. Kimi K3 cobraba 3 y 15 dólares, respectivamente. La diferencia sigue siendo grande incluso frente a la tarifa punta de DeepSeek.

El precio por token no es el coste total. Si un modelo consume más tokens, responde más despacio o exige más correcciones, el ahorro inicial desaparece. Aun así, en trabajos de gran volumen textual la distancia es demasiado amplia para ignorarla.

Los datos de OpenRouter apuntan en la misma dirección. Entre el 1 de enero y el 14 de junio, la plataforma procesó más de 450 billones de tokens. La cuota de DeepSeek dentro de ese volumen pasó de aproximadamente el 9% en enero al 18% a comienzos de junio. No es cuota de mercado mundial; es tráfico de tokens en una plataforma de routing. Sí sirve para observar hacia dónde mueven carga los desarrolladores cuando varios modelos están a una llamada de API.

Si tuviera que preparar el caso de negocio, empezaría aquí y no en tres puntos de benchmark. Entrada, salida, reintentos, latencia y tiempo de corrección humana pueden cambiar por completo el orden de la factura real.

Qwen3.8 necesita tiempo, no un veredicto precipitado

Alibaba anunció Qwen3.8-Max el 3 de agosto y retiró la ruta preview el día 5. La página actual del modelo enumera un MoE de 2,4 billones de parámetros, un contexto de un millón de tokens y precios regionales de API. El consejo anterior de esperar una ficha final ya está desactualizado.

Eso no resuelve la calidad independiente. Las especificaciones y los precios bastan para iniciar una prueba de compra, no para declarar un ganador. Conviene repetir la carga real del equipo en la región y el nivel de precio previstos antes de compararlo con K3 o DeepSeek.

Lo primero que destaca es la distribución. Los clientes de Alibaba Cloud y Model Studio pueden probarlo sin rehacer su infraestructura. Eso no demuestra adopción, pero sí reduce el coste de evaluarlo. La calidad del modelo y el camino hasta el uso cotidiano son ventajas competitivas distintas.

La presión más inmediata sobre los laboratorios de EE. UU. es el precio

Las tarifas citadas permiten afirmar algo concreto: DeepSeek V4-Pro cuesta bastante menos que Kimi K3. Para compararlos con modelos estadounidenses habría que alinear precios de la misma fecha, reglas de caché y niveles de servicio. Aun sin generalizar, una diferencia de este tamaño hace más difícil justificar una prima basada solo en el benchmark.

Los datos de OpenRouter no representan la cuota mundial; describen el uso en una sola plataforma. Aun así, la familia DeepSeek pasó aproximadamente del 9 % al 18 % durante el periodo analizado. Es una señal suficiente de que algunos usuarios redistribuyen tráfico cuando precio y rendimiento encajan.

Los pesos abiertos también amplían las opciones de compra. En vez de depender de una sola API, un equipo puede comparar proveedores de inferencia por precio, región y política de datos, o alojar el modelo si el coste operativo lo justifica. La competencia deja de ser solo una tabla de benchmarks y pasa al coste total y a la continuidad del servicio.

Así haría hoy mi selección inicial

Necesidad Primer candidato Condiciones que comprobaría
Mucho texto a bajo coste DeepSeek V4-Pro Longitud de salida, latencia, reintentos y región de tratamiento de datos
Contexto largo, imagen y código en un modelo Kimi K3 Compatibilidad con Kimi Code, no cambiar de modelo durante la sesión, licencia y capacidad
Una prueba rápida dentro de Alibaba Cloud Qwen3.8-Max Región, tramo de tokens, coste de salida y reproducción independiente
Datos de clientes o regulados Elegir primero el proveedor Región de almacenamiento, retención de logs, borrado y responsabilidad contractual

Para procesar mucho texto con presupuesto ajustado, mediría primero DeepSeek. Si necesito unir contexto largo, imagen y programación, probaría K3 y convertiría las advertencias de Moonshot sobre el entorno de ejecución en criterios de aceptación. Incluiría Qwen3.8-Max en la prueba, pero no lo fijaría como estándar solo por las cifras de lanzamiento.

Mantendría al menos dos proveedores viables. Los precios y las reglas de acceso cambian rápido. Probaría con regularidad en dos o tres modelos los documentos y solicitudes que realmente recibe el equipo. Mediría el coste por tarea completada y el tiempo de corrección humana, no solo la precisión.

Hasta dónde ha llegado la IA china

Todavía es pronto para declarar una victoria china. La propia documentación de Kimi reconoce la distancia frente a los sistemas propietarios más fuertes. DeepSeek tiene un precio formidable, pero no ofrecerá la misma calidad y eficiencia en todos los trabajos. Qwen3.8 ya salió de preview, aunque aún necesita evidencia independiente en cargas reales.

Lo que sí ha cambiado es la etiqueta de “alternativa barata”. La capacidad mejora, los precios son menores, aparecen pesos públicos y los grandes proveedores cloud amplían la distribución. Una selección formada solo por productos estadounidenses ya puede dejar fuera una parte material del mercado.

No lo planteo como una rivalidad nacional, sino como una decisión operativa. Incluiría modelos chinos en la lista inicial, pero separaría benchmarks del fabricante y pruebas independientes, pesos públicos y uso comercial sin límites, precio por token y coste de terminar el trabajo. El mayor avance de la IA china no es haber colocado un único modelo en el número uno. Es haber creado varias opciones que un comprador serio ya no puede ignorar.

Fuentes y referencias

Páginas públicas usadas para contrastar hechos reportados, documentación oficial, contexto de política, información de producto y afirmaciones que pueden cambiar.