AMD zveřejnilo instrukce CDNA5. Vlna se zkrátila na polovinu, místo MFMA je WMMA
AMD dalo na web referenční příručku k instrukční sadě CDNA5, architektuře akcelerátorů Instinct MI455X. Proti loňské CDNA4 se v ní mění základní pojmy: vlna se zkrátila ze 64 pracovních položek na 32, maticové instrukce MFMA nahradilo WMMA a přibyla jednotka na přesun dlaždic tenzorů.

AMD dalo na web referenční příručku k instrukční sadě CDNA5. Dokument je datovaný 27. července 2026, má 823 stran a stáhne se bez registrace. Žádný konkrétní čip v něm nepadne ani jednou. Server Phoronix, který ho 31. července našel, ho spojuje s akcelerátorem Instinct MI455X – a stránka toho akcelerátoru u AMD to potvrzuje, jako architekturu uvádí právě CDNA5.
Vlna se zkrátila na polovinu
Nejnápadnější změna je v tom, po kolika pracovních položkách čip počítá naráz. Vlna je skupina položek, které vykonávají tentýž program v jednom průchodu. Příručka ke CDNA4 z 5. srpna 2025 píše, že procesor sdružuje 64 položek do vlnoplochy. CDNA5 jich sdružuje nejvýš 32 a hned v úvodu varuje, že se v textu může objevit zmínka o wave64, ale zařízení umí jen wave32.
Přejmenoval se i základní stavební blok. CDNA4 mluví o výpočetní jednotce, CDNA5 o procesoru pracovních skupin (WGP), který spojuje dvě výpočetní jednotky a čtyři bloky SIMD32. Není to jen pojem z příručky: technický list MI455X uvádí 256 těchto procesorů, takt 2 400 MHz a 320 miliard tranzistorů.
Zvětšila se sdílená paměť: jedna pracovní skupina si u CDNA5 smí vyhradit až 320 kB, u CDNA4 to bylo 160 kB. Zdvojnásobení kapacity to ale není. WGP spojuje dvě výpočetní jednotky, takže na jednu z nich pořád vychází stejných 160 kB – nová je možnost dát to všechno jedné skupině.
Maticové instrukce mají jiné jméno i jiné registry
CDNA4 počítala matice instrukcemi MFMA; ta zkratka se v textu její příručky objevuje 320krát. V dokumentu ke CDNA5 nepadne ani jednou. Nahradilo ji WMMA, kterého je tam 321 výskytů, zatímco v příručce ke CDNA4 nebyl ani jeden.
Nejde jen o název. CDNA4 měla vedle 256 vektorových registrů (V0–V255) ještě 256 akumulačních (AV0–AV255), vyhrazených maticové jednotce, a instrukce MFMA si polem ACC vybírala, ze kterého pole registrů čte a kam zapisuje. CDNA5 má jediné pole s 1 024 registry (V0–V1023) a akumulační registry v něm nefigurují.
Ani WMMA, ani wave32 přitom nejsou nové pojmy. AMD je používá u herní řady RDNA – vlastní návod na GPUOpen k RDNA 3 WMMA popisuje včetně rozdílu mezi režimy wave32 a wave64. Do výpočetní řady se dostávají teď. Naopak formáty FP8, BF8, FP6, BF6 a FP4 uměla už CDNA4 a v tom se nemění nic.
Přibyly instrukce, které matici při načtení rovnou překlopí. GLOBAL_LOAD_TR16_B128 a jeho osmibitová obdoba načtou dlaždici 16×16 a prohodí u ní pořadí řádků a sloupců, aby se data nemusela do registrů rovnat zvlášť. Příručka u nich uvádí, že fungují jen v režimu wave32.
Mezi mřížkou a skupinou přibyl shluk
Rozvržení práce má nově o patro víc. Shluk je až 16 pracovních skupin naplánovaných na tentýž shader engine, každá na jiném WGP. Umějí se synchronizovat společnou bariérou a sdílet načtená data: vícesměrové načtení přečte data z paměti jednou a rozešle je do sdílené paměti několika procesorů naráz. Hierarchie tak zní mřížka → shluk → pracovní skupina → vlna → pracovní položka.
Shluk o jediné skupině se za shluk nepovažuje a instrukce pro bariéru se v něm chovají jako prázdná operace, takže starý kód se tím nerozbije.
Jednotka na přesun dlaždic
Druhá novinka se jmenuje Tensor Data Mover a je to řadič přímého přístupu do paměti pro maticová data. Přesouvá dlaždice tenzorů až o pěti rozměrech mezi pamětí a sdílenou pamětí WGP; co se má přesunout, popisuje deskriptor uložený ve skalárních registrech. Tenzorové instrukce nepoužívají vektorové registry, ignorují masku aktivních položek a běží souběžně s ostatním kódem – na jejich dokončení se čeká zvláštním čítačem. Data se dají v cílové paměti pravidelně proložit výplní, aby transpozice nenarážela na konflikty pamětových bank.
Co v příručce nenajdete
Popis instrukcí není datový list a výkonová čísla v něm nejsou. Ta dodalo AMD jinde: MI455X má 432 GB paměti HBM4, propustnost 23,3 TB/s a špičkových 40,3 PFLOPS ve formátu MXFP4. Tisková zpráva z 23. července, kterou byl akcelerátor uveden, k němu uvádí až 34krát vyšší průtok tokenů proti MI355X. Je to měření vlastních laboratoří AMD z července 2026 na modelu DeepSeek V4 Flash ve formátu FP4, ne nezávislý test.
Číslo, které se AMD nehodí, je ve dvojité přesnosti: technický list uvádí u MI455X 5 TFLOPS ve FP64, kdežto akcelerátor MI430X pro vědecké výpočty firma v téže tiskové zprávě popisuje až s 288 TFLOPS ve FP64. Kdo počítá fyziku, sáhne v téhle řadě po jiném kusu.
Pro toho, kdo pro Instinct píše, je podle nás podstatnější ta první část. Kód laděný na wave64 a na akumulační registry se na CDNA5 nepřenese beze změny a ruční jádra se budou přepisovat. Ovladač v jádře Linuxu, backend překladače i knihovny ROCm podle Phoronixu MI455X podporují už teď; na stejném ovladači ostatně stojí i nedávná regrese výkonu v Ubuntu. Hostitelskou stranu obstarávají v racích Helios procesory EPYC Venice.
Zdroje
- AMD: „CDNA5“ Instruction Set Architecture Reference Guide (PDF), 27. 7. 2026
- AMD: CDNA4 Instruction Set Architecture Reference Guide (PDF), 5. 8. 2025
- AMD: technický list Instinct MI455X
- AMD: tisková zpráva z konference Advancing AI 2026, 23. 7. 2026
- Phoronix: AMD Publishes CDNA5 ISA Documentation For Instinct MI455X, 31. 7. 2026
- Oak Ridge Leadership Computing Facility: Frontier – složení uzlu superpočítače z fotografie
Porovnání proti CDNA4 v tomhle textu vzniklo nad oběma dokumenty od AMD, ne nad převyprávěním: počty výskytů zkratek MFMA a WMMA i rozsah obou příruček jsou spočítané ze strojového převodu obou souborů PDF do textu.