Vibecoding.cz Patrick Zandl o AI vývoji
Strategic Analysis Patrick Zandl

GLM-5.3-Flash: čínské čipy dohnaly Nvidii a je to vidět na ceníku

Milionový kontext, váhy volně ke stažení a stojí patnáct centů za milion vstupních tokenů. Zní to podezřele levně. Z.ai celý týden ten model obsluhovala na domácích čínských čipech a tvrdí, že cena za token jí vyšla srovnatelně s běžnými kartami od Nvidie. A to nikdo jiný nemá!

Modely: GLM-5.3-Flash

Pekingská Z.ai, dřív známá jako Zhipu AI a vzešlá z okruhu univerzity Tsinghua, vydala 26. srpna GLM-5.3-Flash. Píšu o něm bezprostředně proto, že to není jen další levný čínský model. Zajímavá je ta infrastrukturní část, kterou většina přehledů přeskočí. Jenže z infrastruktury plyne ta megavýhodná cena. Pojďme se podívat, kde vznikla.

Nejdříve: Co Flash je

Model má 320 miliard parametrů celkem a 18 miliard aktivních. Zjednodušeně řečeno: je to velký model, který při každém slově zapojí jen malou část sebe, takže se chová jako obr a počítá jako drobek. Kontextové okno je milion tokenů, tedy zvládne naráz přečíst rozsáhlý projekt.

Novinka je vidění. Flash je první model řady GLM-5, který nativně přijímá obraz a video, ne jen text. K čemu to je, k tomu se dostanu, protože je to zajímavější, než se zdá.

Váhy jsou od prvního dne na Hugging Face pod licencí MIT, což znamená, že si model můžete stáhnout a provozovat u sebe bez omezení. Běží přes SGLang, vLLM a TokenSpeed.

Architektura kombinuje řídkou a lineární pozornost. Proti vlajkovému GLM-5.3 to srazilo výpočet pozornosti na třetinu a velikost cache na necelou čtvrtinu. Proti starší řadě GLM-4.5 má Flash podobný počet parametrů celkem, ale poloviční aktivaci a poloviční počet vrstev.


Cena, která spadla o řád

Tady je ta tabulka, díky níž si uděláme lepší obrázek:

ModelVstupVýstupCache
GLM-5.3 (vlajkový)$1,40$4,40$0,26
GLM-5.3-Flash$0,15$0,50$0,03
DeepSeek V4-Flash$0,14$0,28
Gemini 3.7 Flash$0,75$3,75
Claude Opus 5$5,00$25,00$0,50

V nabídce jedné firmy tedy cena spadla zhruba desetkrát, a to za dvanáct dní. Z.ai k tomu uvádí, že na indexu Artificial Analysis dosáhl Flash 57 bodů za 0,045 USD na úlohu. Jenom pozor, tohle číslo si sama označuje slovem discounted, tedy zlevněné. Kolik stojí úloha za plnou cenu, neuvádí.

Čínské čipy a rekurzivní historka

A teď ta část, kvůli které jsem si sedl a napsal tenhle článek.

Z.ai celý minulý týden obsluhovala Flash na velkém klastru čínských čipů pro AI, tedy bez karet od Nvidie. To samo o sobě není novinka, běh hotového modelu na domácím křemíku Čína zvládá dlouho. Zajímavá jsou ta konkrétní čísla kolem.

Firma postavila vlastní inferenční engine nad projektem SGLang, protože jednotlivé čipy mají málo paměti a malou propustnost, hlavně při milionovém kontextu. Přidala k tomu takzvanou architekturu EPD, která rozděluje zpracování obrazu, přípravu promptu a generování odpovědi mezi samostatné skupiny strojů. Běží to podle Z.ai na desítkách tisíc domácích akcelerátorů.

Výsledek popisuje firma takhle: proti vlastní výchozí verzi na stejném železe trojnásobné zrychlení, a hardwarová efektivita i cena za token srovnatelná s běžnými GPU od Nvidie. Kernely a ladění výkonu přitom pomáhal psát agent poháněný GLM-5.3. Model tedy pomáhal stavět a optimalizovat systém, který obsluhuje model. Zpětná vazba se uzavřela do kruhu a Z.ai to popisuje mimochodem, jako provozní detail.

V červnu jsme tady psali o LongCatu od Meituanu, který tvrdil, že ho na čínských čipech i natrénovali, a byl jsem k tomu skeptický, protože firma odmítla jmenovat hardware. Tohle je skromnější tvrzení, zato ověřitelnější. Týden veřejného provozu pro statisíce uživatelů se dá doložit, i když samotnou paritu s Nvidií zvenčí nikdo nepřeměří.

Šest dní pod cizím jménem

Než Flash vyšel, běžel od 20. srpna anonymně na OpenRouteru a v OpenCode pod jménem ox-alpha, zdarma a bez uvedení výrobce. Za týden se stal nejpoužívanějším modelem na platformě, s víc než čtyřmi sty tisíci uživatelů. Je to přirozené, modely zdarma jsou zde vždycky velmi hodně používané, ale i na schopnosti modelu byly velmi kladné reference.

Komunita ho mezitím forenzně přiřadila ke GLM podle shody tokenizeru a sdíleného chybového kódu. Trvalo to zhruba osmačtyřicet hodin.

Napadlo mě k tomu, že si firma nechává model zdarma proměřit tisícovkami dobrovolníků. Z.ai to ovšem v oznámení sama přiznává a píše, že šlo o sběr zpětné vazby před vydáním. Je to navíc pátý anonymní model Z.ai za šest měsíců, takže je to zavedený postup, ne trik. Pony Alpha z února se po pěti dnech ukázal jako GLM-5.

Multimodální model si opravuje vlastní práci

Vraťme se k tomu vidění, protože Z.ai kolem něj postavila nejzajímavější kus argumentace.

U frontendu, her nebo 3D simulací je konečným výstupem rozhraní, interakce nebo svět, který někdo uvidí. Samotný kód je jen cesta tam. Spousta chyb se přitom projeví teprve při vykreslení a model, který kód píše naslepo, je nemá jak najít.

Flash je trénovaný na to, aby se podíval na vlastní výsledek a opravil ho. Z.ai to v oznámení ukazuje na dvojici obrázků: první verze stránky s rozbitým rozvržením a táž stránka po vizuálním sebeověření.

Tohle přesně dnešní vývojářské modely potřebují. Nejúčinnější prompt, jaký dnes znáte, je ten, který modelu řekne, ať si výsledek po sobě zkontroluje a iteruje. Eric Zakariasson z Cursoru to změřil a jedna taková věta u něj udělala víc než dvoustránková specifikace. Vidoucí model tu smyčku uzavírá bez lidské pomoci.

V ZCode, což je vývojové prostředí Z.ai, k tomu přibylo ovládání prohlížeče a počítače, takže agent proklikává stránky a ověřuje je pohledem. Předplatitelé kódovacího tarifu mají na Flash trojnásobnou kvótu proti vlajkovému modelu.

Benchmarky (a čí jsou)

Následující čísla naměřila Z.ai. Nezávisle je zatím nikdo nepřeměřil, protože model právě vyšel.

BenchmarkFlashGLM-5.2Opus 4.8GPT-5.6 TerraGemini 3.7 Flash
Terminal Bench 2.184,381,085,087,485,8
DeepSWE v1.163,446,258,069,665,3
Toolathlon Verified78,459,976,274,9
AutomationBench48,826,241,037,252,3
GDPval-AA v217731504158215711527
OfficeQA Pro62,4
48,9
Chartography78,0
75,068,065,0

Skok proti GLM-5.2 je velký napříč celou tabulkou, u AutomationBench skoro dvojnásobek. Proti Opusu 4.8 Flash vede v pěti řádcích ze sedmi, a to za třicetinu ceny. Na vlastním testu Z.ai Code Bench se na nejvyšším úsilí dostal na 29,0 proti 29,5 u Opusu 4.8, tedy prakticky nastejno.

Jednu výhradu k tomu dodám a stačí. Tabulka míchá výsledky z různých měřicích prostředí a část benchmarků vlastní sama Z.ai. Užitečné je to jako vodítko, co si vyzkoušet, ne jako důkaz pořadí.

Za zmínku stojí, že firma sama přiznává slabinu: velikost cache má pořád větší než Kimi K3 a DeepSeek V4-Flash a píše, že tam má co zlepšovat. Přiznat vlastní nedostatek v tiskové zprávě se moc nevidí a je to dobrý signál o zbytku textu.

Váhy tentokrát vyšly. U vlajkové lodi pořád ne

GLM-5.3, tedy větší textový vlajkový model, vyšel 14. srpna a Z.ai u něj dvakrát slíbila váhy do dvou týdnů, po dokončení bezpečnostního vyhodnocení. To mířilo zhruba na 28. srpna. K 24. srpnu v oficiálním repozitáři nic nebylo a firma dodnes neuvedla ani licenci, pod kterou váhy vyjdou.

U Flashe je to jinak. Váhy jsou venku od prvního dne a licence MIT je jasně uvedená.

Nedivil bych se, kdyby za tím rozdílem stála právě ta kyberbezpečnost. GLM-5.3 je podle vlastních čísel Z.ai nejlepší model na světě v hledání zranitelností a firma s ním našla přes dva tisíce reálných děr v otevřeném softwaru. Vydat takový model volně je jiná úvaha než vydat levný pracovní model, který vidí obrázky. Je to ale můj odhad, Z.ai důvod neuvádí.

Nezaměňujte přitom obě tabulky, protože se to v přehledech plete. Flash je menší, levnější a vidí. Vlajkový GLM-5.3 je silnější v dlouhém textovém kódování a v kyberbezpečnosti, ale je desetkrát dražší a slepý.

Pro koho GLM-5.3 Flash dává smysl

Vyzkoušel bych GLM-5.3 Flash, pokud stavíte agenty a hlídáte náklady, pokud potřebujete model, který se podívá na render nebo na sken faktury, nebo pokud chcete provoz u sebe a máte na to železo.

Sáhl bych jinam, pokud potřebujete absolutní špičku v dlouhých textových úlohách, nebo pokud vaše smlouvy vylučují čínskou jurisdikci u hostovaného volání. Vlastní váhy tuhle otázku řeší, volání přes API Z.ai ne.

A ověřil bych si dvě věci. Reálnou cenu za dokončenou úlohu na vlastním provozu, protože zlevněných 4,5 centu je asi marketingové číslo, fakticky může být cena po skončení proma jiná. A chování modelu na vašich úlohách, protože zatím jsou všechna čísla z dílny výrobce.

Za mě je tohle nejzajímavější vydání týdne, a to hlavně kvůli té hardwarové části. Jestli čínské čipy opravdu obsluhují špičkový model za cenu srovnatelnou s Nvidií, je to podstatnější zpráva než pár bodů na benchmarku. Dalších dvanáct měsíců bude v tomhle ohledu pořádná jízda.


Zdroje: oficiální oznámení Z.ai z 26. srpna 2026, ceníková stránka Z.ai, data OpenRouteru a OpenCode. Všechny benchmarkové hodnoty pocházejí od výrobce a k datu vydání článku je nezávisle nikdo nepřeměřil. Ceny a dostupnost se u těchhle modelů mění po týdnech, ověřte si je před nasazením. Platnost údajů k 26. srpnu 2026.

Patrick Zandl

Lektor agentního vývoje a technologický publicista. Od roku 2025 provozuje Vibecoding.cz — česky psaný web o AI nástrojích pro vývojáře — a vede veřejné workshopy Claude Code v Praze; firemní AI workshopy vede na aivefirmach.cz.

Profil autora →