Kimi K3 · Moonshot AI · Infraestructura · 2026
El archivo pesa 1.56 TB. Descargarlo es gratis. Encenderlo necesita el hardware más caro del planeta. AWS, Google Cloud y Azure recibieron el mismo modelo el mismo fin de semana — y cada respuesta fue un retrato de su infraestructura.
La paradoja
El último domingo de julio, Moonshot, un laboratorio de Beijing, liberó los pesos de Kimi K3: 2.8 billones de parámetros, el modelo abierto más grande de la historia, descargable gratis en Hugging Face. Y en los tres días siguientes, AWS, Google Cloud y Microsoft Azure se movieron a publicar soporte. ¿Por qué tanto apuro por algo gratis? Porque descargarlo es gratis, pero correrlo no — y en esa diferencia está uno de los negocios más grandes de la década.
El protagonista, con solo lo que vas a necesitar después.
Mezcla de expertos: en cada token trabaja solo una fracción del modelo. Es como tener 896 especialistas en la sala, pero consultar a 16 por pregunta.
El cómputo por token es mucho menor que el de un modelo denso de 2.8 billones — pero la memoria sigue siendo la de 2.8 billones completos, porque todos los expertos tienen que estar cargados y listos entre las GPUs.
Moonshot AI → laboratorio de Beijing
Arquitectura → MoE (mixture of experts)
Parámetros → 2.8 billones totales, 16 de 896 expertos activos por token
Clase → frontera — a nivel de los mejores modelos cerrados en varios
benchmarks, aunque no en todos "Liberar los pesos" es la noticia. Pero hay que ser preciso con la palabra, porque en este canal las palabras se usan como corresponden.
Con OpenAI o Anthropic: el binario NO existe para ti.
El modelo vive en su casa, tú accedes por API.
Con Moonshot: publicó el binario completo (los pesos) en
Hugging Face. Con el binario en tu mano,
lo ejecutas donde quieras. Los pesos se descargan sin pagar, bajo la Kimi K3 License (con nombre y apellido, no un genérico). El uso comercial está permitido para una empresa normal.
La receta de entrenamiento ni los datos con los que se compiló. Y si montas un negocio de servir el modelo sobre cierto tamaño, o tu producto pasa los 100 millones de usuarios, aplican cláusulas especiales.
Con todo esto, la respuesta es precisa: no es open source a secas, es open-weight. Un modelo abierto de este nivel cambia el tablero igual — decides dónde corre, qué ve, y tus prompts no salen de tu perímetro. No es soberanía total, porque sigues dependiendo de la nube y todo lo que rodea al modelo, pero el control cambia de manos.
El checkpoint descargado ocupa ~1.56 TB. Sirviéndolo — runtime, buffers, memoria de contexto — se necesita más de 1.5 TB de VRAM de GPU, no de disco. De menos a más:
Tu laptop
Ni cerca. Olvídate.
Mac Studio 512 GB (el más caro que existe)
Carga un tercio del checkpoint.
Nodo con 8× H100 (el estándar de oro de hace un año)
Ni cerca.
Nodo con 8× B200 (Blackwell nueva)
Tampoco alcanza.
Nodo con 8× B300 (Blackwell Ultra)
Entra justito.
No es cálculo mío
Es la guía oficial de vLLM, el motor de inferencia con que se sirve este modelo: "el modelo completo apenas entra en un solo DGX B300 y requiere un mínimo de 16 GPUs B200/GB200 para servirse en esa generación de hardware." En un solo nodo, solo entran 8 B300 y punto. Kimi K3 efectivamente es un modelo gratis que necesita el hardware más potente del planeta para encenderse — y ahí está la respuesta de por qué los tres gigantes de la nube corrieron a publicar guías la misma semana: cada empresa que quiera este modelo, en teoría gratis, va a necesitar alquilar el tipo de infraestructura que ellos venden. El modelo abierto no les compite, les vende fierro.
Cuando los tres gigantes reciben el mismo modelo el mismo fin de semana, cada respuesta es un retrato del fierro que tienen y de la estrategia que juegan.
Hardware
8× B300, un solo nodo
Motor
vLLM (TP8)
Orquestación
SageMaker HyperPod / EKS
Precio
$112.32/h (Capacity Blocks, oficial)
Tú controlas todo, nosotros te vendemos el nodo más denso posible. El precio está en la vitrina — pero se reserva, no se improvisa.
Hardware
16× GB200, 4 nodos coordinados
Motor
SGLang (TP16, multi-host)
Orquestación
GKE / Model Garden
Precio
No público (preview, sin descuentos por compromiso)
Más memoria total, más headroom para contexto de un millón de tokens. El costo es complejidad: coordinar 4 nodos es mucho más difícil que uno.
Hardware
Abstraído — nunca ves las GPUs
Motor
No expuesto
Orquestación
Microsoft Foundry
Precio
Público, por token (vía Fireworks AI)
No operas nada y pagas por token, a cambio cedes el control del runtime. Azure sí tiene Blackwell disponible — fue decisión de producto, no falta de fierro.
AWS GOOGLE AZURE (Foundry)
Estrategia Autohospedaje Distribuido o 1-click Inferencia gestionada
denso (Model Garden) (Fireworks)
Hardware 8× B300, 1 nodo 16× GB200, 4 nodos Abstraído
Motor vLLM (TP8) SGLang (TP16) No expuesto
Orquestación HyperPod / EKS GKE / Model Garden Foundry
Compra Capacidad Cuota + preview Por token
reservada (ventas)
Control infra Alto Alto o medio Bajo
Control de pesos Tuyo Tuyo No
Precio $112.32/h Consultar Público, por token
(Capacity Block) (estimación alta) AWS: $112.32 la hora son unos $2,700 por día — si lo dejas de guardia el mes completo, la boleta pasaría de los $80,000 al mes, un solo modelo. Google no publica el precio de su configuración recomendada: está en preview, sin descuentos por compromiso, y el número se conversa con ventas — con precios de mercado de GB200 en otras nubes, se estima bien por encima de AWS, pero es solo estimación. Azure eligió no exponer el fierro: tiene Blackwell disponible desde finales de 2025 (dominios NVLink de hasta 72 GPUs), así que no es que le falte hardware — fue una decisión de producto llegar rápido con un especialista de inferencia adentro de su catálogo.
La gracia de un modelo abierto es que no dependes de un solo proveedor. Ya hay quien lo sirve y te deja probarlo gratis.
Probarlo gratis
Plataforma de cómputo serverless. Ya sirve Kimi K3 con una API compatible con OpenAI, y su plan incluye $30 de cómputo gratis al mes — de sobra para probar el modelo.
Usarlo en producción
$3 por millón de tokens de entrada ($0.30 con acierto de caché) y $15 por millón de salida. Sin infraestructura propia.
La segunda mitad de la paradoja
Eso que puedes probar gratis en tu terminal es el mismo modelo de 2.8 billones de parámetros que necesita 8 B300 o 16 B200 para autohospedarse — porque obviamente alguien más puso el data center. El modelo abierto creó un mercado entero de intermediarios de inferencia: Fireworks se lo sirve a Microsoft, Modal te lo sirve a ti, y hasta Moonshot te lo vende por API.
En el video anterior monté una war room donde dos agentes de empresas rivales, Claude (Anthropic) y Codex (OpenAI), operan mi infraestructura con identidad criptográfica.
Ya estaban
Claude · Anthropic
Codex · OpenAI
Entra el tercero
Kimi K3 · Moonshot
Mismas condiciones
Su propia llave. Su propia jaula. La misma aprobación humana.
Como la sala ocupa un protocolo abierto, cualquier agente respaldado por cualquier modelo puede entrar — con las reglas que yo definí. Tres empresas, OpenAI, Anthropic y Moonshot, con tres modelos y tres pasaportes criptográficos distintos, sentados en la misma sala, la mía. Los gigantes de la nube corrieron esta semana a hospedar el modelo chino. Yo lo tengo de guardia acá y no me costó nada. Mira cómo se armó la sala en Buzz ›
Un laboratorio chino publicó gratis un modelo de clase frontera, y los tres gigantes de la nube reordenaron su semana para hospedarlo. Según reportes, Microsoft hasta lo estaría evaluando para Copilot.
La tesis
Cuando los pesos se vuelven portables y las APIs empiezan a parecerse entre sí, el poder se mueve desde el laboratorio hacia la infraestructura que sirve el modelo: la memoria, la red, el motor de inferencia, la capacidad disponible y la gobernanza alrededor. Los pesos pueden ser gratuitos, pero operarlos nunca. Por eso las nubes corren — el modelo gratis les vende fierro — y por eso en este canal construimos sistemas y no demos: el valor ya no está en acceder al modelo, que cada vez es más abierto y barato, sino en la arquitectura a su alrededor. Las identidades, las jaulas, las credenciales, la orquestación — eso no te lo regala nadie.
Las fuentes oficiales del video, verificadas.
AWS (blog oficial) · 30 julio 2026
La receta oficial de AWS: instancia P6-B300 con 8 GPUs B300, vLLM como motor, orquestado con HyperPod o EKS.
Google Cloud (foro oficial) · 27 julio 2026
El soporte más rápido de las tres nubes: Model Garden de un clic, o la receta oficial de AI Hypercomputer para GKE.
Microsoft (Azure AI Foundry Blog) · 28 julio 2026
El anuncio de Azure: Kimi K3 servido por Fireworks AI dentro del catálogo enterprise de Foundry, sin aprovisionar GPUs propias.
vLLM Project · 27 julio 2026
"El modelo completo apenas entra en un solo DGX B300 y requiere un mínimo de 16 GPUs B200/GB200 para servirse en esa generación de hardware." La fuente técnica de la escalera de VRAM.
Moonshot AI · 2026
El repo oficial en Hugging Face: los pesos completos (1.56 TB, 96 shards) y la Kimi K3 License que los acompaña.
Moonshot AI (platform.kimi.ai) · 2026
$3.00 por millón de tokens de entrada (cache miss), $0.30 con acierto de caché, $15.00 por millón de salida.
La sala de agentes, la infraestructura multi-agente y la disciplina detrás de todo esto.
Donde Kimi entra como tercer agente: la war room con identidad criptográfica donde Claude y Codex ya operaban mi infraestructura.
Otro caso real de infraestructura multi-agente: 7 servicios independientes, cada uno con su propia URL y su propio contenedor.
La disciplina detrás de todo esto: el modelo ya casi no importa, lo que importa es el entorno y los controles que le construyes alrededor.
Lo esencial sobre Kimi K3.
Es el modelo insignia de Moonshot AI, un laboratorio de Beijing. Usa una arquitectura MoE (mezcla de expertos) con 2.8 billones de parámetros totales, de los cuales solo una fracción trabaja en cada token — como tener 896 especialistas en la sala pero consultar a 16 por pregunta. En varios benchmarks alcanza niveles de los mejores modelos cerrados, aunque en otros todavía queda por debajo. Es, hoy, el modelo abierto más capaz que se puede descargar.
Descargarlo es gratis: Moonshot publicó los pesos completos en Hugging Face, sin costo. Pero correrlo no es gratis — necesita más de 1.5 TB de VRAM, hardware que solo unos pocos nodos del planeta tienen. Esa es la paradoja del video: el modelo es gratis, la infraestructura para encenderlo es lo más caro que existe. Si no quieres pagar esa infraestructura, puedes probarlo gratis con Modal (sin GPU propia) o pagar por token vía API.
Es open-weight, no open source a secas. Moonshot publica el binario entrenado (los pesos) bajo la Kimi K3 License: se descargan sin pagar y el uso comercial está permitido, pero con condiciones para los grandes — si montas un negocio de servir el modelo sobre cierto tamaño, o tu producto pasa los 100 millones de usuarios, aplican cláusulas especiales. Lo que no te dan es la receta de entrenamiento ni los datos con los que se compiló, que es lo que definiría "open source" en sentido estricto.
El checkpoint descargado ocupa ~1.56 TB, y sirviéndolo (runtime, buffers, memoria de contexto) se necesita más de 1.5 TB de VRAM de GPU, no de disco. Según la guía oficial de vLLM, el modelo completo apenas entra en un solo nodo de 8 GPUs B300 (Blackwell Ultra) y requiere un mínimo de 16 GPUs B200/GB200 para servirse en la generación de hardware anterior. Un nodo de 8× H100 — el estándar de hace un año — ni siquiera alcanza.
AWS publica su precio: $112.32 por hora en Capacity Blocks para la instancia con 8 GPUs B300 — unos $2,700 al día, más de $80,000 al mes si lo dejas corriendo 24/7. Google Cloud no publica el precio de su configuración de 16 GPUs GB200 (está en preview, se conversa con ventas); con precios de mercado, se estima bien por encima de AWS, aunque es solo estimación. Azure no te cobra por hora de GPU: pagas por token vía Fireworks AI, sin tocar hardware.
Modal, una plataforma de cómputo serverless, ya sirve Kimi K3 con una API compatible con OpenAI y su plan incluye $30 de cómputo gratis al mes — de sobra para probarlo. Si quieres usarlo en producción sin infraestructura propia, la API oficial de Moonshot cobra $3 por millón de tokens de entrada (o $0.30 con acierto de caché) y $15 por millón de salida.
Es el laboratorio chino de Beijing detrás de Kimi K3. El 26 de julio de 2026 liberó los pesos del modelo, y en los tres días siguientes AWS, Google Cloud y Microsoft Azure publicaron soporte oficial — Google con day-0, Microsoft subiéndolo a su catálogo enterprise, y AWS con su guía de despliegue. Según reportes de prensa (sin confirmación oficial), Microsoft estaría evaluando Kimi K3 para algunas cargas de Copilot.
Comunidad
El detalle completo del análisis, las tablas comparativas de las tres nubes, y cómo se armó la sala de agentes con Kimi, Claude y Codex — paso a paso. Acceso gratis a la comunidad; los cursos completos van en el tier Premium.
Únete a Agentic Engineers →Canal YouTube
@NicolasNeiraGarcia
ADK · A2A · Claude Code · Automatización · Infraestructura