Kimi K3 · Moonshot AI · Infraestructura · 2026

Kimi K3 gratis: ¿open source? Local, API o Cloud (el costo real)

El archivo pesa 1.56 TB. Descargarlo es gratis. Encenderlo necesita el hardware más caro del planeta. AWS, Google Cloud y Azure recibieron el mismo modelo el mismo fin de semana — y cada respuesta fue un retrato de su infraestructura.

La paradoja

Un modelo gratis que necesita el hardware más caro del mundo.

El último domingo de julio, Moonshot, un laboratorio de Beijing, liberó los pesos de Kimi K3: 2.8 billones de parámetros, el modelo abierto más grande de la historia, descargable gratis en Hugging Face. Y en los tres días siguientes, AWS, Google Cloud y Microsoft Azure se movieron a publicar soporte. ¿Por qué tanto apuro por algo gratis? Porque descargarlo es gratis, pero correrlo no — y en esa diferencia está uno de los negocios más grandes de la década.

Qué es Kimi K3, en 2 minutos

El protagonista, con solo lo que vas a necesitar después.

2.8 billones de parámetros, arquitectura MoE

Mezcla de expertos: en cada token trabaja solo una fracción del modelo. Es como tener 896 especialistas en la sala, pero consultar a 16 por pregunta.

El matiz que importa

El cómputo por token es mucho menor que el de un modelo denso de 2.8 billones — pero la memoria sigue siendo la de 2.8 billones completos, porque todos los expertos tienen que estar cargados y listos entre las GPUs.

Moonshot AI  →  laboratorio de Beijing
Arquitectura →  MoE (mixture of experts)
Parámetros   →  2.8 billones totales, 16 de 896 expertos activos por token
Clase        →  frontera — a nivel de los mejores modelos cerrados en varios
                benchmarks, aunque no en todos

¿Open source o open weight? La licencia real

"Liberar los pesos" es la noticia. Pero hay que ser preciso con la palabra, porque en este canal las palabras se usan como corresponden.

Con OpenAI o Anthropic:  el binario NO existe para ti.
                         El modelo vive en su casa, tú accedes por API.

Con Moonshot:            publicó el binario completo (los pesos) en
                         Hugging Face. Con el binario en tu mano,
                         lo ejecutas donde quieras.

Lo que sí te dan

Los pesos se descargan sin pagar, bajo la Kimi K3 License (con nombre y apellido, no un genérico). El uso comercial está permitido para una empresa normal.

Lo que no te dan

La receta de entrenamiento ni los datos con los que se compiló. Y si montas un negocio de servir el modelo sobre cierto tamaño, o tu producto pasa los 100 millones de usuarios, aplican cláusulas especiales.

Con todo esto, la respuesta es precisa: no es open source a secas, es open-weight. Un modelo abierto de este nivel cambia el tablero igual — decides dónde corre, qué ve, y tus prompts no salen de tu perímetro. No es soberanía total, porque sigues dependiendo de la nube y todo lo que rodea al modelo, pero el control cambia de manos.

El costo real de correrlo: la escalera de hardware

El checkpoint descargado ocupa ~1.56 TB. Sirviéndolo — runtime, buffers, memoria de contexto — se necesita más de 1.5 TB de VRAM de GPU, no de disco. De menos a más:

1

Tu laptop

Ni cerca. Olvídate.

2

Mac Studio 512 GB (el más caro que existe)

Carga un tercio del checkpoint.

3

Nodo con 8× H100 (el estándar de oro de hace un año)

Ni cerca.

4

Nodo con 8× B200 (Blackwell nueva)

Tampoco alcanza.

5

Nodo con 8× B300 (Blackwell Ultra)

Entra justito.

No es cálculo mío

Es la guía oficial de vLLM, el motor de inferencia con que se sirve este modelo: "el modelo completo apenas entra en un solo DGX B300 y requiere un mínimo de 16 GPUs B200/GB200 para servirse en esa generación de hardware." En un solo nodo, solo entran 8 B300 y punto. Kimi K3 efectivamente es un modelo gratis que necesita el hardware más potente del planeta para encenderse — y ahí está la respuesta de por qué los tres gigantes de la nube corrieron a publicar guías la misma semana: cada empresa que quiera este modelo, en teoría gratis, va a necesitar alquilar el tipo de infraestructura que ellos venden. El modelo abierto no les compite, les vende fierro.

Los 3 gigantes: misma pregunta, tres respuestas

Cuando los tres gigantes reciben el mismo modelo el mismo fin de semana, cada respuesta es un retrato del fierro que tienen y de la estrategia que juegan.

AWS

Autohospedaje denso

Hardware

8× B300, un solo nodo

Motor

vLLM (TP8)

Orquestación

SageMaker HyperPod / EKS

Precio

$112.32/h (Capacity Blocks, oficial)

Tú controlas todo, nosotros te vendemos el nodo más denso posible. El precio está en la vitrina — pero se reserva, no se improvisa.

Google Cloud

Distribuido, o un clic

Hardware

16× GB200, 4 nodos coordinados

Motor

SGLang (TP16, multi-host)

Orquestación

GKE / Model Garden

Precio

No público (preview, sin descuentos por compromiso)

Más memoria total, más headroom para contexto de un millón de tokens. El costo es complejidad: coordinar 4 nodos es mucho más difícil que uno.

Azure

Inferencia gestionada (Fireworks)

Hardware

Abstraído — nunca ves las GPUs

Motor

No expuesto

Orquestación

Microsoft Foundry

Precio

Público, por token (vía Fireworks AI)

No operas nada y pagas por token, a cambio cedes el control del runtime. Azure sí tiene Blackwell disponible — fue decisión de producto, no falta de fierro.

                    AWS                GOOGLE                 AZURE (Foundry)
Estrategia          Autohospedaje      Distribuido o 1-click  Inferencia gestionada
                    denso              (Model Garden)         (Fireworks)
Hardware            8× B300, 1 nodo    16× GB200, 4 nodos     Abstraído
Motor               vLLM (TP8)         SGLang (TP16)          No expuesto
Orquestación        HyperPod / EKS     GKE / Model Garden     Foundry
Compra               Capacidad         Cuota + preview        Por token
                    reservada          (ventas)
Control infra       Alto               Alto o medio           Bajo
Control de pesos    Tuyo               Tuyo                   No
Precio              $112.32/h          Consultar              Público, por token
                    (Capacity Block)   (estimación alta)

AWS: $112.32 la hora son unos $2,700 por día — si lo dejas de guardia el mes completo, la boleta pasaría de los $80,000 al mes, un solo modelo. Google no publica el precio de su configuración recomendada: está en preview, sin descuentos por compromiso, y el número se conversa con ventas — con precios de mercado de GB200 en otras nubes, se estima bien por encima de AWS, pero es solo estimación. Azure eligió no exponer el fierro: tiene Blackwell disponible desde finales de 2025 (dominios NVLink de hasta 72 GPUs), así que no es que le falte hardware — fue una decisión de producto llegar rápido con un especialista de inferencia adentro de su catálogo.

Cómo probar Kimi K3 gratis, sin tocar una GPU

La gracia de un modelo abierto es que no dependes de un solo proveedor. Ya hay quien lo sirve y te deja probarlo gratis.

Probarlo gratis

Modal

Plataforma de cómputo serverless. Ya sirve Kimi K3 con una API compatible con OpenAI, y su plan incluye $30 de cómputo gratis al mes — de sobra para probar el modelo.

Usarlo en producción

API oficial de Moonshot

$3 por millón de tokens de entrada ($0.30 con acierto de caché) y $15 por millón de salida. Sin infraestructura propia.

La segunda mitad de la paradoja

Eso que puedes probar gratis en tu terminal es el mismo modelo de 2.8 billones de parámetros que necesita 8 B300 o 16 B200 para autohospedarse — porque obviamente alguien más puso el data center. El modelo abierto creó un mercado entero de intermediarios de inferencia: Fireworks se lo sirve a Microsoft, Modal te lo sirve a ti, y hasta Moonshot te lo vende por API.

Kimi como tercer agente en la sala

En el video anterior monté una war room donde dos agentes de empresas rivales, Claude (Anthropic) y Codex (OpenAI), operan mi infraestructura con identidad criptográfica.

Ya estaban

Claude · Anthropic

Codex · OpenAI

Entra el tercero

Kimi K3 · Moonshot

Mismas condiciones

Su propia llave. Su propia jaula. La misma aprobación humana.

Como la sala ocupa un protocolo abierto, cualquier agente respaldado por cualquier modelo puede entrar — con las reglas que yo definí. Tres empresas, OpenAI, Anthropic y Moonshot, con tres modelos y tres pasaportes criptográficos distintos, sentados en la misma sala, la mía. Los gigantes de la nube corrieron esta semana a hospedar el modelo chino. Yo lo tengo de guardia acá y no me costó nada. Mira cómo se armó la sala en Buzz ›

La lección de ingeniería

Un laboratorio chino publicó gratis un modelo de clase frontera, y los tres gigantes de la nube reordenaron su semana para hospedarlo. Según reportes, Microsoft hasta lo estaría evaluando para Copilot.

La tesis

"China alcanzó a Estados Unidos" es titular de prensa. La lección de ingeniería es otra.

Cuando los pesos se vuelven portables y las APIs empiezan a parecerse entre sí, el poder se mueve desde el laboratorio hacia la infraestructura que sirve el modelo: la memoria, la red, el motor de inferencia, la capacidad disponible y la gobernanza alrededor. Los pesos pueden ser gratuitos, pero operarlos nunca. Por eso las nubes corren — el modelo gratis les vende fierro — y por eso en este canal construimos sistemas y no demos: el valor ya no está en acceder al modelo, que cada vez es más abierto y barato, sino en la arquitectura a su alrededor. Las identidades, las jaulas, las credenciales, la orquestación — eso no te lo regala nadie.

Fuentes

Las fuentes oficiales del video, verificadas.

AWS (blog oficial) · 30 julio 2026

Deploying Kimi K3 on Amazon SageMaker HyperPod and Amazon EKS

La receta oficial de AWS: instancia P6-B300 con 8 GPUs B300, vLLM como motor, orquestado con HyperPod o EKS.

Google Cloud (foro oficial) · 27 julio 2026

Announcing Day 0 support for Kimi K3 on Google Cloud

El soporte más rápido de las tres nubes: Model Garden de un clic, o la receta oficial de AI Hypercomputer para GKE.

Microsoft (Azure AI Foundry Blog) · 28 julio 2026

Introducing Kimi K3 through Fireworks AI on Microsoft Foundry

El anuncio de Azure: Kimi K3 servido por Fireworks AI dentro del catálogo enterprise de Foundry, sin aprovisionar GPUs propias.

vLLM Project · 27 julio 2026

Guía oficial de despliegue de Kimi K3

"El modelo completo apenas entra en un solo DGX B300 y requiere un mínimo de 16 GPUs B200/GB200 para servirse en esa generación de hardware." La fuente técnica de la escalera de VRAM.

Moonshot AI · 2026

Kimi K3 — model card y licencia

El repo oficial en Hugging Face: los pesos completos (1.56 TB, 96 shards) y la Kimi K3 License que los acompaña.

Moonshot AI (platform.kimi.ai) · 2026

Precio oficial de la API de Kimi K3

$3.00 por millón de tokens de entrada (cache miss), $0.30 con acierto de caché, $15.00 por millón de salida.

Videos relacionados

La sala de agentes, la infraestructura multi-agente y la disciplina detrás de todo esto.

Buzz — la sala de agentes

Donde Kimi entra como tercer agente: la war room con identidad criptográfica donde Claude y Codex ya operaban mi infraestructura.

ADK + A2A en Cloud Run

Otro caso real de infraestructura multi-agente: 7 servicios independientes, cada uno con su propia URL y su propio contenedor.

Harness Engineering

La disciplina detrás de todo esto: el modelo ya casi no importa, lo que importa es el entorno y los controles que le construyes alrededor.

Preguntas frecuentes

Lo esencial sobre Kimi K3.

¿Qué es Kimi K3?

+

Es el modelo insignia de Moonshot AI, un laboratorio de Beijing. Usa una arquitectura MoE (mezcla de expertos) con 2.8 billones de parámetros totales, de los cuales solo una fracción trabaja en cada token — como tener 896 especialistas en la sala pero consultar a 16 por pregunta. En varios benchmarks alcanza niveles de los mejores modelos cerrados, aunque en otros todavía queda por debajo. Es, hoy, el modelo abierto más capaz que se puede descargar.

¿Kimi K3 es gratis de verdad?

+

Descargarlo es gratis: Moonshot publicó los pesos completos en Hugging Face, sin costo. Pero correrlo no es gratis — necesita más de 1.5 TB de VRAM, hardware que solo unos pocos nodos del planeta tienen. Esa es la paradoja del video: el modelo es gratis, la infraestructura para encenderlo es lo más caro que existe. Si no quieres pagar esa infraestructura, puedes probarlo gratis con Modal (sin GPU propia) o pagar por token vía API.

¿Kimi K3 es open source u open weight?

+

Es open-weight, no open source a secas. Moonshot publica el binario entrenado (los pesos) bajo la Kimi K3 License: se descargan sin pagar y el uso comercial está permitido, pero con condiciones para los grandes — si montas un negocio de servir el modelo sobre cierto tamaño, o tu producto pasa los 100 millones de usuarios, aplican cláusulas especiales. Lo que no te dan es la receta de entrenamiento ni los datos con los que se compiló, que es lo que definiría "open source" en sentido estricto.

¿Cuánta VRAM necesita Kimi K3 para correr?

+

El checkpoint descargado ocupa ~1.56 TB, y sirviéndolo (runtime, buffers, memoria de contexto) se necesita más de 1.5 TB de VRAM de GPU, no de disco. Según la guía oficial de vLLM, el modelo completo apenas entra en un solo nodo de 8 GPUs B300 (Blackwell Ultra) y requiere un mínimo de 16 GPUs B200/GB200 para servirse en la generación de hardware anterior. Un nodo de 8× H100 — el estándar de hace un año — ni siquiera alcanza.

¿Cuánto cuesta correr Kimi K3 en AWS, Google Cloud o Azure?

+

AWS publica su precio: $112.32 por hora en Capacity Blocks para la instancia con 8 GPUs B300 — unos $2,700 al día, más de $80,000 al mes si lo dejas corriendo 24/7. Google Cloud no publica el precio de su configuración de 16 GPUs GB200 (está en preview, se conversa con ventas); con precios de mercado, se estima bien por encima de AWS, aunque es solo estimación. Azure no te cobra por hora de GPU: pagas por token vía Fireworks AI, sin tocar hardware.

¿Cómo puedo probar Kimi K3 gratis, sin GPU?

+

Modal, una plataforma de cómputo serverless, ya sirve Kimi K3 con una API compatible con OpenAI y su plan incluye $30 de cómputo gratis al mes — de sobra para probarlo. Si quieres usarlo en producción sin infraestructura propia, la API oficial de Moonshot cobra $3 por millón de tokens de entrada (o $0.30 con acierto de caché) y $15 por millón de salida.

¿Qué es Moonshot AI?

+

Es el laboratorio chino de Beijing detrás de Kimi K3. El 26 de julio de 2026 liberó los pesos del modelo, y en los tres días siguientes AWS, Google Cloud y Microsoft Azure publicaron soporte oficial — Google con day-0, Microsoft subiéndolo a su catálogo enterprise, y AWS con su guía de despliegue. Según reportes de prensa (sin confirmación oficial), Microsoft estaría evaluando Kimi K3 para algunas cargas de Copilot.

Comunidad

La guía, las tablas comparativas y el montaje de la sala están en Agentic Engineers

El detalle completo del análisis, las tablas comparativas de las tres nubes, y cómo se armó la sala de agentes con Kimi, Claude y Codex — paso a paso. Acceso gratis a la comunidad; los cursos completos van en el tier Premium.

Únete a Agentic Engineers →

Canal YouTube

@NicolasNeiraGarcia

ADK · A2A · Claude Code · Automatización · Infraestructura

Suscribirse ›