Čínský Moonshot zveřejnil váhy modelu Kimi K3, ke stažení má 1,4 terabajtu
Moonshot AI zveřejnil 27. července váhy svého modelu Kimi K3. Balík má v úsporném formátu MXFP4 zhruba 1,4 terabajtu, model má 2,8 bilionu parametrů a licence sice dovoluje i prodej, ale nad určitým obratem vyžaduje zvláštní smlouvu.

Čínská firma Moonshot AI zveřejnila 27. července váhy svého modelu Kimi K3. Kdo má dost místa a dost karet, může si ho stáhnout z Hugging Face a spustit u sebe. Balík má v úsporném formátu MXFP4 zhruba 1,4 terabajtu.
Váhy jsou vnitřní čísla modelu, tedy to jediné, co po tréninku zbude a co určuje, jak se model chová. Zveřejnit je znamená vzdát se výhradní kontroly nad tím, kdo model provozuje. Řada velkých modelů se dá používat jen přes rozhraní jejich tvůrce.
Z 2,8 bilionu parametrů počítá jen zlomek
Karta modelu na Hugging Face uvádí 2,8 bilionu parametrů celkem, ale jen 104 miliard z nich se zapojí do zpracování jednoho tokenu. Model je totiž postavený jako směs expertů: obsahuje 896 dílčích sítí a pro každý kousek textu si jich vybere šestnáct. Zbytek zůstává ležet v paměti a nic nepočítá.
Tenhle rozdíl je pro provoz podstatný. Kapacitu si model nese celou, ale platí jen za tu část, která se zrovna používá. Kontextové okno je 1 048 576 tokenů, tedy rovný milion.
Architektura se od předchozí řady liší ve třech bodech, které Moonshot popisuje v technické zprávě: pozornost typu Kimi Delta Attention míchaná s vrstvami Gated MLA v poměru zhruba tři ku jedné, blokové zbytkové spoje mezi vrstvami a rámec Stable LatentMoE, který má udržet trénink stabilní i při velmi řídkém zapojení expertů. Z 93 vrstev jich 69 připadá na KDA a 24 na Gated MLA. Firma z toho vyvozuje asi dvaapůlkrát lepší poměr mezi výpočtem a schopnostmi oproti verzi K2.5 – což je její vlastní údaj, ne měření někoho zvenčí.
Čtyři bity na parametr, a přesto 1,4 terabajtu
Váhy jsou uložené ve formátu MXFP4, tedy čtyřbitovém čísle s plovoucí řádovou čárkou a se společným měřítkem pro celý blok hodnot. Aktivace jdou v přesnějším MXFP8. Podle karty modelu se na tuto přesnost trénovalo už od fáze doladění, takže nejde o dodatečné zhrubnutí hotového modelu.
I tak vyjde stažení na 1,4 terabajtu. Server TECHi upozorňuje, že v šestnáctibitové přesnosti by týž model zabral kolem 5,6 terabajtu. Aby model běžel rozumně rychle, musí se váhy vejít do paměti akcelerátorů – a tam začínají potíže. Osmdesátigigabajtových karet by na to bylo potřeba osmnáct, u karet se 192 GB paměti se osm kusů vejde jen tak tak a na kontext už mnoho místa nezbude. Formát MXFP4 přitom nativně zvládají až novější čipy, Nvidia Blackwell a AMD MI400.
V číslech se přetisky rozcházejí. Server Tech Startups psal o osmi kartách H100, což při 80 GB paměti na kus dává 640 GB, tedy méně než polovinu potřebného místa. Údaj z TECHi je matematicky konzistentní, ten druhý ne.
Otevřené váhy nejsou open source
Licence se jmenuje Kimi K3 License a je vlastní. Dovoluje model používat, kopírovat, upravovat, šířit, dolaďovat i prodávat jeho kopie. Pak ale přijdou dvě hranice.
- Kdo model nabízí jako službu a jeho souhrnné tržby z ní přesáhnou 20 milionů dolarů za dvanáct po sobě jdoucích měsíců, musí si s Moonshotem napřed sjednat zvláštní smlouvu.
- Kdo má produkt s více než 100 miliony aktivních uživatelů měsíčně nebo s měsíčními tržbami nad 20 milionů dolarů, musí v rozhraní viditelně uvést „Kimi K3“.
Obojí se netýká vnitřního užití ve firmě ani přístupu přes oficiální produkty Moonshotu a jeho certifikované partnery. Omezení navázaná na obrat a počet uživatelů znamenají, že o open source v obvyklém smyslu nejde. Otevřené jsou váhy, ne licence.
Čísla z testů má zatím jen výrobce
Karta modelu uvádí mimo jiné 93,5 bodu v testu odborných otázek GPQA Diamond, 88,3 v Terminal-Bench 2.1 a 67,5 v programátorském DeepSWE. Všechna tato čísla pocházejí od Moonshotu; nezávislé přeměření zatím k dispozici není a u testů, které si výrobce spouští sám, je namístě opatrnost.
Vedle vah firma vydala i nástroje kolem nich: komunikační knihovnu MoonEP, implementaci jader FlashKDA a prostředí AgentEnv pro souběžný běh agentů. U FlashKDA uvádí 1,72 až 2,22násobné zrychlení přípravné fáze na akcelerátorech Nvidia H20. Model se dá spustit v běžných nástrojích pro inferenci, jmenovitě vLLM a SGLang.
Co z toho plyne
Vlastní počítač na Kimi K3 nestačí a nestačí ani jedna karta za desítky tisíc. Praktický dopad je jinde: kdokoli s přístupem k dostatečně velkému stroji si model může spustit sám, bez rozhraní čínské firmy a bez toho, aby jí posílal svoje data. Do dvaceti milionů dolarů tržeb z takové služby za dvanáct měsíců na tom smí i vydělávat.
Den po zveřejnění hlásila stránka modelu na Hugging Face přes 99 tisíc stažení. Kolik z nich skončilo skutečným spuštěním a kolik jen v archivu, se z toho čísla poznat nedá.
Zdroje: karta modelu moonshotai/Kimi-K3 a text licence na Hugging Face, Tech Startups, TECHi a Geopolitechs.