Pekingská Z.ai vydala 14. srpna 2026 GLM-5.3 a otevřela tím kapitolu, na kterou obor nebyl připravený. Model dosáhl na benchmarku CyberGym 84,5 procenta a poráží v hledání zranitelností všechno ostatní na trhu, včetně uzavřené špičky. Váhy mají vyjít za dva týdny, až firma dokončí bezpečnostní vyhodnocení.
Z.ai to sama označuje za emergentní schopnost, tedy za něco, co nečekala. Do tréninku přidala data o hledání zranitelností a schopnost se pak rozvíjela rychleji, než firma předpokládala. Model podle ní přestal hledat izolované chyby a začal plánovat celé řetězce zneužití.
Všechno zlepšení pochází z post-tréninku
Oznámení to říká hned první větou a bez okolků: GLM-5.3 stojí na stejném základním modelu jako GLM-5.2 a každý zisk pochází z post-tréninku, tedy z fáze, která následuje po základním předtrénování.
Z.ai za poslední měsíc přidávala tréninková prostředí, rozšiřovala rozmanitost úloh a sypala do toho výpočetní výkon. Běží to na jejím vlastním otevřeném rámci slime, kde optimalizace na systémové úrovni zvedly průchodnost tréninku posilovaným učením víc než 2,3krát.
Zapadá to do vzorce, který se letos opakuje a tenhle týden vygradoval. DeepSeek u modelu V4-Pro udělal totéž, SpaceXAI trénovala Grok 4.6 na výstupech Groku 4.5, Meta destilovala Muse Glimmer z většího sourozence. Zdroj zlepšení se přesunul z velikosti základu do toho, co se s modelem děje potom, a GLM-5.3 je z těch případů nejčistší, protože základ zůstal doslova nedotčený.
Z.ai k tomu stranou dodává postřeh o vlastní práci. S rostoucí schopností agentů se těžiště obtížnosti přesouvá z modelu na prostředí. Firma proto staví pipeline, které tréninková prostředí generují automaticky, včetně odměňovacího signálu, a jiný model pak ověřuje, jestli je úloha vůbec řešitelná.
Kyberbezpečnost: první místo a zároveň přiznaná propast
| Benchmark | GLM-5.3 | GLM-5.2 | Uzavřená špička |
|---|---|---|---|
| CyberGym | 84,5 | 77,2 | 83,8 |
| ExploitBench | 54,4 | 24,4 | 78,0 |
| ExploitGym (2h/6h) | 105/130 | 29/39 | 181/247 |
Tři benchmarky měří tři různá patra téže práce a dohromady kreslí obrázek, ve kterém záleží na pořadí.
CyberGym vychází z otevřeného zdrojového kódu a testuje, jestli model zranitelnost najde a ověří tím, že vyvolá chybu. Tady je GLM-5.3 první na světě.
ExploitBench vyžaduje hlubší úvahu o skutečných zranitelnostech a jejich zneužití. GLM-5.3 svůj předchozí výsledek víc než zdvojnásobil, ale uzavřená špička je o třiadvacet bodů výš.
ExploitGym měří, kolik úloh model dokončí v časovém rozpočtu. Ze 29 na 105 úloh za dvě hodiny je čtyřnásobek, jenže špička jich zvládne 181.
Vzorec je konzistentní a Z.ai ho pojmenovává sama: čím výš po řetězci zneužití benchmark sedí, tím větší je skok proti předchozí verzi a tím širší zůstává propast k uzavřené konkurenci. Schopnost roste nejrychleji přesně tam, kde má firma největší zpoždění.
Přiznat tohle v tiskové zprávě chce kus poctivosti. A popisuje to trajektorii, ne stav.
Dva tisíce čtyři sta zranitelností v reálném kódu
Benchmarky jsou jedna věc, tohle je druhá. Z.ai spolupracovala s několika čínskými bezpečnostními týmy a pouštěla model na skutečné codebase. Po odborné kontrole, prosetí a odstranění duplicit zůstalo 2 436 zranitelností ve 269 projektech.
- 107 kritických, 990 vysokých, 1 286 středních, 53 nízkých
- Nálezy pokrývají jádra systémů, operační systémy, prohlížečová jádra, otevřenou infrastrukturu, webové aplikace i síťové protokoly
- Nejstarší chyba se do kódu dostala v roce 1981
- Průměrná zranitelnost přežila nepovšimnuta 26,6 roku
Firma k tomu založila veřejný rejstřík, kde nálezy sleduje procesem zveřejňování. Zatím je 53 zveřejněných a 2 383 pod embargem.
U toho posledního čísla se vyplatí zastavit. Jedna společnost drží víc než dva tisíce dosud neopravených zranitelností v otevřeném softwaru, který používá prakticky celý svět. Postup je standardní a odpovědný, jen měřítko je nové.
Programování: velký skok, druhá až čtvrtá příčka
Ve zbytku tabulky, kterou Z.ai publikuje, vyhrává GLM-5.3 tři řádky ze šestnácti: CyberGym, AutomationBench (48,2) a GDPval-AA v2 (1769 bodů Elo). Jinde je vesměs druhý až čtvrtý a nejčastěji ho poráží Fable 5 nebo GPT-5.6 Sol.
Generační posun je přesto obrovský. Na Terminal-Bench 3.0 vyskočil ze 4,6 na 28,3 procenta, na DeepSWE ze 46,2 na 66,9. Mezi otevřenými modely je na Terminal-Bench 3.0 i na Agents’ Last Exam nejlepší.
Efektivitu tokenů zvládl GLM-5.3 lépe než konkurence. Na vlastním testu Z.ai Code Bench dává na vysoké úrovni úsilí 31,4 procenta při zhruba padesáti tisících výstupních tokenech, zatímco Claude Opus 4.8 dosáhne 29,5 procenta při sto dvaceti tisících. Lepší výsledek za necelou polovinu tokenů. Fable 5 zůstává výš s 39,5 procenta.
Co je potřeba označit
Tabulka si odporuje s vlastním textem. Sloupec je popsaný jako “Fable 5 (w/ fallback)”, ale text u týchž čísel mluví o Mythosu 5. Platí to u CyberGymu (83,8), ExploitBench (78,0) i ExploitGym (181/247). Fable 5 je běžně dostupný model, zatímco Mythos 5 Anthropic drží mimo veřejnou nabídku právě kvůli jeho schopnostem. Rozdíl mezi “porazili jsme dostupný model” a “porazili jsme model, který nikdo nedostane” je zásadní a z oznámení nejde rozhodnout, který platí.
Claude Opus 5 v tabulce chybí úplně. Z.ai se měří proti Opusu 4.8 a Fable 5, přestože Opus 5 vyšel před třemi týdny a Artificial Analysis mu na GDPval-AA v2 naměřila 1861 bodů, tedy podstatně nad zdejšími 1769. Stejné vynechání jsme před dvěma dny popsali u xAI.
Všechna čísla naměřila Z.ai. Nezávislé ověření zatím není. Firmě ovšem patří pochvala za to, jak měřila: použila harness Claude Code 2.1.207, tedy běhový rámec konkurence, poznámky pod čarou uvádějí teploty, časové limity, počty běhů i opatření proti podvádění, a u ExploitGymu dokonce normalizovala časové rozpočty podle propustnosti jednotlivých modelů z dat Artificial Analysis. Taková míra detailu je u firemních tabulek vzácná.
Dvoutýdenní odklad vah řeší výchozí chování, ne schopnost. Jakmile budou váhy venku, může si je kdokoli doladit a bezpečnostní vrstvu z modelu vytrénovat zpět ven. Z.ai to nezastírá, jen o tom mlčí.
A pro firemní nasazení ještě jedna věc. Z.ai je na americkém seznamu Entity List a hostovaná API běží přes čínskou infrastrukturu, kde platí tamní zákon o národní zpravodajské činnosti. Provoz z vlastních vah tuhle otázku obchází, hostované volání ne.
Co z toho plyne
GLM-5.3 posouvá jednu konkrétní hranici. Nejlepší nástroj na světě na hledání zranitelností přestává být uzavřený produkt pod dohledem a stává se souborem ke stažení. To mi přijde důležité a čekám, že americké firmy budou nuceny nějak reagovat.
Kontext posledních týdnů to zostřuje. Google pustil Gemini 3.5 Flash Cyber jen vládám a prověřeným partnerům. Anthropic u Opusu 5 zveřejnil rozpad na nalézání a psaní exploitů právě proto, že to považuje za dvě různě rizikové věci, a nasadil klasifikátory. Microsoft svůj MDASH drží v soukromém preview, do kterého se nikdo nedostane. Tři největší hráči zvolili tři různé podoby kontroly nad tím, kdo se k téhle schopnosti dostane.
Z.ai zvolila čtvrtou: za dva týdny si ji stáhne kdokoli.
Obrana z toho těží stejně jako útok, a těch 2 436 nalezených děr včetně jedné pětačtyřicet let staré je toho dokladem. Symetrie ale platí jen do chvíle, kdy obránce má na opravu měsíce a útočník na zneužití hodiny. A přesně na téhle části řetězce, tedy u exploitace, roste podle vlastních čísel Z.ai schopnost nejrychleji.