Alibaba vydala 3. srpna 2026 Qwen3.8-Max, svůj dosud největší model, a představila ho jako rovnocenného soupeře Claude Fable 5 i GPT-5.6 Sol. Bloomberg z toho udělal titulek o výkonu na úrovni Anthropicu, akcie Alibaby v Hongkongu vyskočily zhruba o sedm procent. Pak model změřila Artificial Analysis a dala mu 53 bodů svého indexu, tedy sedm pod Fable, šest pod Solem a přesně tolik, kolik má Claude Sonnet 5, model střední třídy. Zajímavější než ten rozdíl je ovšem otázka, jestli index měří to, na co Alibaba mířila.
Co Qwen3.8-Max je
Model stojí na architektuře MoE (Mixture-of-Experts, tedy směs expertů, kde se z celkového počtu parametrů aktivuje u každého dotazu jen malá část). Celkem má 2,4 bilionu parametrů, aktivních 95 miliard, a vychází z architektury Qwen3.5. Kontextové okno je až milion tokenů, přičemž Alibaba účtuje jednotnou sazbu napříč celým oknem. To je proti zvyku konkurence i proti jejím vlastním starším modelům, které po překročení určité délky promptu přecházejí do vyššího cenového pásma. Pro každého, kdo staví vyhledávací pipeline a občas nasype do promptu tři stovky tisíc tokenů, je absence takového pásma podstatnější než bod na benchmarku.
Cena je 2 dolary za milion vstupních tokenů a 6 za milion výstupních, čtení z mezipaměti (cache) 0,25 dolaru. Model přijímá text, obrázky, video a dokumenty, zvládne podle firmy finanční výkazy nad dvě stě stran i videa nad sto hodin, která si skládá do struktury, jíž říká video memory graph. API nabízí rozhraní kompatibilní s formáty OpenAI i Anthropicu, což může integraci do klientů jako Claude Code, Codex nebo OpenClaw výrazně zjednodušit. Alibaba mluví o pouhé změně adresy a identifikátoru modelu, v praxi ale bývá potřeba doladit mapování nástrojů, formáty volání i zacházení s bloky uvažování.
Váhy mají vyjít příští týden na Hugging Face a ModelScope. Kdyby k tomu došlo, byl by to první model produktové řady Max s otevřenými vahami, protože dosavadní vlajkové modely Alibaby zůstávaly zavřené za API. Vedle něj mají být zveřejněny i váhy menšího modelu Qwen3.8-27B. Do vydání licence přitom nejde říct, jestli půjde o otevřenost ve svobodném smyslu, nebo o váhy s komerčním omezením.
Firemní tabulka a jedna pochvala
Následující čísla jsou z vlastních běhů Alibaby. Sedmiřádkový výběr níže pochází z rozsáhlejší firemní tabulky.
| Benchmark | Qwen3.8-Max | Qwen3.7-Max | Nejlepší soupeř |
|---|---|---|---|
| PaperBench | 93,0 | 64,8 | GPT-5.6 Sol 90,5 |
| Terminal-Bench 2.1 | 86,6 | 74,5 | GPT-5.6 Sol 88,8 |
| IFBench | 82,8 | 79,1 | GPT-5.6 Sol 72,7 |
| FrontierSWE | 73,5 | 40,7 | Fable 5 88,8 |
| SWE-bench Pro | 67,7 | 60,6 | Fable 5 80,0 |
| GPQA Diamond | 92,6 | 92,4 | GPT-5.6 Sol 94,1 |
| DeepSWE 1.1 | 56,6 | 21,6 | GPT-5.6 Sol 73,0 |
V tabulce Alibaby jde o výrazný mezigenerační posun. FrontierSWE vyskočil ze 40,7 na 73,5, DeepSWE z 21,6 na 56,6, Terminal-Bench ze 74,5 na 86,6. Znalostní GPQA se přitom pohnula o dvě desetiny bodu. Největší měřený posun tedy nastal v agentních a softwarových úlohách, i když jediný stagnující benchmark k závěru o obecných schopnostech modelu nestačí. Stagnace může stejně dobře znamenat saturaci konkrétního testu nebo statistický šum.
Vůči konkurenci je obrázek pestrý a stojí za to ho říct přesně, protože firemní komunikace ho zjednodušila. Alibaba vybrala benchmarky, na nichž Qwen v některých disciplínách překonává Fable 5 nebo GPT-5.6 Sol, zatímco v jiných za nimi zaostává. Vede na PaperBench a IFBench, poráží Claude Opus 4.8 na Terminal-Benchi a FrontierSWE, a prohrává s Fable 5 na SWE-bench Pro i FrontierSWE o velké kusy. Se Solem prohrává na Terminal-Benchi, DeepSWE a GPQA. Tvrzení o celkové paritě s Fable je tedy širší, než vlastní tabulka unese.
Alibabě přitom patří pochvala za metodiku, jakou u firemních tabulek běžně nevidíme. Vlastní model proháněla harnessem Claude Code, tedy vnějším běhovým rámcem od konkurence, a průměrovala deset pokusů, zatímco u soupeřů brala jejich nejlepší publikovaná čísla. To je k rivalům velkorysejší postup, než bývá zvykem.
Dvě výhrady k tomu ale patří. Všechny hodnoty Qwenu pocházejí z vlastních běhů Alibaby, ne z nezávislého testování, byť samotné benchmarky jsou většinou cizí a zavedené. A multimodální srovnání ve firemních materiálech běží proti Qwen3.7-Plus místo proti silnějšímu Qwen3.7-Max, čímž zlepšení opticky roste.
Nezávislé měření posadilo model o třídu níž
Artificial Analysis, která modely měří standardizovaně a napříč výrobci, dala Qwen3.8-Max 53 bodů svého indexu inteligence.
| Model | Index | Ceník za tokeny |
|---|---|---|
| Claude Opus 5 | 61 | 5/25 |
| Claude Fable 5 | 60 | 10/50 |
| GPT-5.6 Sol | 59 | 5/30 |
| Kimi K3 | 57 | 3/15 |
| Claude Opus 4.8 | 56 | 5/25 |
| Qwen3.8-Max | 53 | 2/6 |
| Claude Sonnet 5 | 53 | 3/15 |
Generačně je to poctivé zlepšení, protože Qwen3.7-Max má na téže verzi indexu 46 bodů. Na úroveň, o které mluvila tisková zpráva, to ale nestačí. Model dosahuje ve výběru výše stejného skóre jako Sonnet 5, tedy jako model, který Anthropic sám staví do střední třídy pod svůj vlajkový Opus. Ceníkem je přitom Qwen levnější než Sonnet i než Kimi K3, což je jeho reálná výhoda, jen ji firemní materiály zmiňovaly méně hlasitě než srovnání s Fable.
Tenhle index si ovšem zaslouží stejnou opatrnost jako firemní tabulka. Je to vážený kompozit z devíti hodnocení a jeho výsledek závisí na volbě benchmarků, na harnessu i na rozpočtu na uvažování. Bez zveřejněných intervalů nejistoty navíc nevíme, jak robustní jsou rozdíly několika bodů na natěsnaném vrcholu. Shodné souhrnné skóre navíc může skrývat velmi odlišný profil schopností, takže “stejně jako Sonnet” znamená stejný součet, ne stejný model.
Není to ostatně první čínský model, jemuž externí měření tvrzení přistřihlo. Kimi K3 od Moonshotu, který vyšel s otevřenými vahami 27. července, dostal 57 bodů, ale nezávislé testy mu ubraly hlavně v kyberbezpečnosti a náročné matematice.
Rychlost a objem tokenů
V měření Artificial Analysis na API Alibaby generoval Qwen3.8-Max 46,5 tokenu za sekundu, při mediánu 72 u srovnatelných modelů. Jeho předchůdce Qwen3.7-Max dával 206 tokenů za sekundu, což je zhruba čtyřapůlnásobek. Čas do první odpovědi má přitom lepší než průměr, takže se rozjede rychle a pak zpomalí. Kolik z toho rozdílu jde na vrub samotnému modelu a kolik nasazené infrastruktuře, vytížení nebo způsobu streamování, z veřejných dat nezjistíte. Pro dávkové úlohy běžící na pozadí to nevadí, u interaktivní práce s dlouhými výstupy to znát bude.
Druhé číslo je objem vygenerovaných tokenů. Na proběhnutí celého indexu jich Qwen3.8-Max spotřeboval 150 milionů, při mediánu 63 milionů. Předchůdce jich potřeboval sto milionů, Kimi K3 zvládl 132 milionů a skóroval o čtyři body výš. Celý test vyšel na 2 159 dolarů.
Tady je namístě přiznat mezeru. Počet tokenů je jen zástupný ukazatel a rozhoduje cena za dokončenou úlohu, tedy metrika, kterou Artificial Analysis počítá právě proto, že ceník za token klame. U Opusu 5 víme, že vyšla na 2,03 dolaru, u Sonnetu 5 na 1,53 a u Kimi K3 na 0,94. Pro Qwen3.8-Max se mi konkrétní hodnotu z veřejně dostupných dat ověřit nepodařilo, přestože ji Artificial Analysis mezi svými grafy vede. Prostým vydělením celkových 2 159 dolarů počtem promptů ji nespočítáte, protože index váží jednotlivá hodnocení různě a některá opakuje. Zatím tedy platí jen tolik, že nízký ceník za token částečně smývá vyšší objem výstupu, a o kolik přesně, se z dostupných čísel nedozvíte.
Ještě jedna věc z firemních materiálů stojí za zmínku. Alibaba zveřejnila křivku, v níž výkon posilovaného učení kulminuje kolem čtyř tisíc tréninkových prostředí a pak mírně klesá, z 0,725 na 0,719 a 0,689. Bez popisu os, rozptylu a opakování z toho ale nejde dělat obecný závěr o limitech metody. Může jít o přeučení na konkrétní evaluační sadu, o šum nebo o vlastnost jednoho nastavení. Zajímavé to je hlavně proto, že takový graf firma zveřejnila u vydání postaveného na škálování.
Kde model ukazuje něco nového
Nejsilnější částí oznámení jsou ukázky dlouhé samostatné práce a Alibaba k nim zveřejnila celé stopy, takže jsou lépe auditovatelné než běžná marketingová videa. Pořád ovšem platí, že jde o firmou vybrané případové studie. Z veřejné stopy nepoznáte, kolik běhů skončilo neúspěchem, jestli byl model na danou úlohu předem laděn ani jak kvalitní je výsledek.
V první ukázce dostal model prázdnou složku a zadání postavit nástroj příkazové řádky. Po zhruba šestnácti dnech samostatného provozu měl repozitář 265 commitů, 127 pull requestů a 151 issues. Model si sám zakládal úkoly, posouval je stavovým automatem, spouštěl testy a mergoval, bez člověka schvalujícího jednotlivé kroky. Počty commitů a pull requestů jsou přitom slabé ukazatele kvality, protože model může vyrobit spoustu administrativního pohybu bez použitelného softwaru. Externí revizi kódu, počet regresí ani náklady běhu firma neuvádí.
Ve druhé dostal odbornou práci o výběru dat pro trénink modelů, žádný startovní kód a zadání reprodukovat výsledky a pak je překonat. Za pět dnů a 125 hodin nepřerušené práce napsal kolem 7 600 řádků kódu, provedl přes 1 100 akcí a odjel 33 kol tréninku na GPU. Prvních 37 hodin trávil reprodukcí všech šesti zjištění původní práce, dalších 88 hodin testoval osmnáct vlastních nápadů a nakonec našel metodu, která původní výsledek překonala o 2,7 bodu na matematickém testu AIME24.
Ve třetí vstoupil do živé soutěže na platformě Tianchi proti 526 lidským týmům, dostal 24 hodin a skončil před 458 z nich.
Technicky nejpůsobivější je návrh čipu. Model dostal prázdnou pracovní plochu a hodnotící skript, žádný referenční návrh, a přes pět set kol optimalizoval kryptografický akcelerátor. První funkční verze měla 8 298 logických hradel, konečná 678, tedy pokles o zhruba 92 procent. Největší jednotlivý skok přišel až ve 22. kole, kdy model vyměnil dělič za iterativní architekturu a ubral 6 288 hradel naráz. Fyzická plocha čipu po syntéze klesla ze 106 na 46 mikrometrů na stranu, což je úbytek plochy o 81 procent. Pointa Alibaby je, že strukturální průlomy přicházely i po stovkách kol, místo aby model po snadných výhrách zamrznul.
Tahle schopnost má ovšem druhou stranu, kterou oznámení neřeší. Agent, který šestnáct dní sám mergeuje vlastní pull requesty, je zároveň provozní riziko. Otevírá otázky kolem oprávnění, práce s přístupovými údaji, nekontrolovaných zásahů do dodavatelského řetězce a hlavně kolem nákladů, které při takovém běhu utečou dřív, než si jich někdo všimne.
Co chybí a na co si dát pozor
Váhy mají vyjít příští týden, ale Alibaba nezveřejnila licenci, hardwarové nároky ani přesné datum. Bez licence nejde říct, jestli na modelu půjde stavět produkt.
Praktická poznámka, která v titulcích chybí: model o 2,4 bilionu parametrů si nespustí skoro nikdo. Je to záležitost datového centra o mnoha uzlech. Reálná cesta k provozu u sebe vede přes menší 27B checkpoint, o kterém se mluví nejméně. Až váhy vyjdou, bude ostatně namístě srovnávat Qwen spíš s Kimi K3, GLM nebo DeepSeekem než s uzavřenými americkými modely, protože tam se odehraje jeho skutečná konkurence.
Pro firmy je namístě ještě jedna úvaha. Alibaba spustila současně QwenWork, firemní nástroj v otevřené betě, který pracuje s lokálními soubory, konektory a interními workflow, takže rozsah dat, která jím projdou, může být značný. QwenCloud provozuje body v Pekingu, Singapuru a americké Virginii. Před nasazením má smysl prověřit smluvní entitu, region zpracování, retenční pravidla, subdodavatele a právní režim přístupu k datům, a to zvlášť u zdrojového kódu a interních dokumentů.
A chybí ještě jedna věc, která by českého čtenáře zajímala nejvíc. Souhrnné indexy měří převážně anglicky. Jak si Qwen vede v češtině, ve zpracování českých dokumentů a v méně zastoupených jazycích, veřejná data neříkají, a právě tam by čínský model mohl mít jiný profil, než jaký naznačuje anglický kompozit.
Závěr
Qwen3.8-Max podle prvního externího měření nedosahuje celkového skóre Fable 5 ani GPT-5.6 Sol a na indexu Artificial Analysis se dělí o úroveň se Sonnetem 5. Firemní tvrzení o paritě s Fable je tedy širší, než data unesou.
Zároveň má model odlišný profil než to, co index měří. Nízké jednotkové ceny, jednotná sazba na milionovém kontextu a doložené příklady několikadenní až několikatýdenní samostatné práce jsou věci, které kompozit ze standardizovaných hodnocení bez několikadenní kontinuity nezachytí. Šestnáct dní běhu na repozitáři ani snížení počtu hradel na dvanáctinu žádný žebříček nehodnotí, a Alibaba k téhle disciplíně zveřejnila neobvykle dlouhé a podrobné případové studie.
Cenu za to model platí v rychlosti a objemu výstupu. V měření na API Alibaby běží čtyřapůlkrát pomaleji než jeho vlastní předchůdce a vygeneruje dvojnásobek tokenů proti mediánu, takže výhodný ceník se v provozu částečně smývá. O kolik přesně, by ukázala srovnatelná cena za dokončenou úlohu, jejíž konkrétní hodnotu se mi z veřejných dat ověřit nepodařilo.
Pro tým, který staví dlouhé samostatné agenty, unese pomalý běh na pozadí a má vyřešené otázky kolem oprávnění a nákladů, je Qwen3.8-Max vážný kandidát, obzvlášť po vydání vah. Kdo potřebuje nejvyšší skóre na standardizovaných úlohách nebo rychlou odezvu, sáhne dnes jinam. A o skutečné hodnotě rozhodnou měření ceny na dokončenou úlohu, spolehlivosti dlouhých běhů a nakonec kvalita vydaných vah a licence, ne jediný kompozitní index ani vybraná firemní tabulka.