Nová verze vlajkového modelu Anthropicu přichází v době, kdy na jeho pozici útočí řada jiných modelů. Obstojí Fable desetinovým vylepšením?
Sleva pětačtyřicet procent zní jako dostatečný důvod přepnout. Anthropic ji u nového Fable 5.1 slibuje a podkládá grafem. Jenže Artificial Analysis, která model měřila ještě před vydáním, došla k tomu, že jedna úloha stojí o dvacet procent víc než na starém Fable 5. Obě čísla jsou správně. Rozdíl mezi nimi je celý v tom, jakou práci modelu dáváte, a právě podle toho se rozhodujte.
Anthropic vydal 1. září Claude Fable 5.1 a Claude Mythos 5.1. Jsou to tytéž váhy, liší se jen mírou ochranných opatření: Fable dostane kdokoli přes API pod jménem claude-fable-5-1, Mythos jen prověřené organizace z kyberbezpečnosti a life sciences, tedy biomedicínského výzkumu. Kontextové okno zůstalo na milionu tokenů.
Čísla, která dodal Anthropic
Nejdřív to, co je v tiskové zprávě. Všechno níž jsou vlastní měření Anthropicu, nikdo je zatím neauditoval.
| Benchmark | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52,6 % | 24,7 % | 29,0 % | 22,4 % |
| Terminal-Bench 4.0 | 55,8 % | 42,0 % | 52,3 % | 37,3 % |
| GDPval-AA v2 (Elo) | 1853 | 1723 | 1824 | 1711 |
| AutomationBench | 31,4 % | 17,1 % | 26,9 % | 19,6 % |
| CursorBench 3.2.0 | 73,4 % | 70,5 % | 70,0 % | 67,2 % |
| Humanity’s Last Exam (bez nástrojů) | 60,9 % | 57,8 % | 56,6 % | - |
| OSWorld 2.0 (strict) | 41,7 % | 36,1 % | 39,6 % | - |
Mythos 5.1 dosahuje na Terminal-Bench 4.0 na 60,9 procenta, tedy o pět bodů víc než Fable. Rozdíl vzniká jen tím, že u části úloh zasáhly kyberbezpečnostní ochrany a Fable je nedokončil.
Pár slov, co ty zkratky měří. Terminal-Bench-Science je agentní vědecká úloha v terminálu: model dostane data a nástroje a má dojít k výsledku bez asistence. AutomationBench postavil Zapier a testuje firemní pracovní postupy, tedy propojování služeb a automatizaci kancelářské rutiny. CursorBench pochází od tvůrců editoru Cursor a měří práci s reálným kódem. GDPval-AA v2 je Elo žebříček pro znalostní práci s ekonomickou hodnotou, tedy analýzy, rešerše, přípravu podkladů.
Ten skok na Terminal-Bench-Science stojí za pozornost. Z pětadvaceti na dvaapadesát procent je víc než zdvojnásobení a Anthropic si sám v poznámce pod čarou přiznává, že směrodatná chyba měření je tři a půl až čtyři a půl bodu. Skok tedy přežije i pesimistický odhad šumu. U CursorBench už jsou všechny čtyři modely v pásu šesti bodů a tam bych rozdíly nepřeceňoval vůbec.
Nezávislá kontrola: první místo a účet navíc
Artificial Analysis je nezávislá analytická firma, která přeměřuje modely na vlastní sadě testů a publikuje ceny i rychlosti. U Fable 5.1 se podílela na předvýdejním testování, což je potřeba mít na paměti, ale její čísla jsou jediná externí data, která k dnešku existují.
Výsledek je pro Anthropic dobrý. Fable 5.1 vede Intelligence Index se skóre 66. Opus 5 má 63, GPT-5.6 Sol a Grok 4.6 shodně 61, Kimi K3 od Moonshot AI a GLM-5.1 od Zhipu po 60, Gemini 3.7 Flash 56. Náskok pěti bodů před nejbližší konkurencí z jiné laboratoře je na dnešní poměry slušný. A bude v praxi i poznat, s takovým výsledkem se například Qwen nemůže měřit.
Potud dobrá zpráva. Teď ta druhá.
Fable 5.1 na max effort stojí 3,76 USD za jednu úlohu Intelligence Indexu. Fable 5 stál 3,14 USD, Opus 5 stojí 2,34 USD. Rozdíl žene spotřeba výstupních tokenů, kterých model spálí zhruba 1,7krát víc než předchůdce. Celý běh Intelligence Indexu vyžádal 140 milionů tokenů proti mediánu 71 milionů a vyšel na 8523 USD. Artificial Analysis model rovnou označuje za velmi upovídaný.
Přepočteno na koruny při kurzu 21 Kč vyjde jedna taková úloha na 79 Kč místo dosavadních 66 Kč. Opus 5, který je o tři body horší, stojí 49 Kč.
Kde se ta sleva ztratila
Anthropic sazby za vstup a výstup nechal beze změny: 10 USD za milion vstupních tokenů, 50 USD za milion výstupních. Slevil jedinou položku, cache reads, tedy čtení kontextu, který model už jednou zpracoval a má ho uložený. Z 1 USD za milion na 0,25 USD, to je pětasedmdesátiprocentní řez.
A tady je jádro pudla. Sleva se projeví jen na té části účtu, kterou tvoří opakované čtení uloženého kontextu. Anthropic v grafu ukazuje dvě zátěže: u typické spadne indexovaná cena ze 100 na 75, u silně agentní ze 100 na 55. Ta druhá je definovaná jako práce s velkým kontextem a spoustou volání nástrojů, kde cache reads tvoří většinu nákladů.
Artificial Analysis měří něco jiného. Intelligence Index jsou složité jednorázové úlohy, kde jde většina účtu na výstupní tokeny a levnější cache moc nepomůže. Úspora z ní vyjde na agentní zátěži zhruba na 1,40 USD za úlohu. Nárůst spotřeby výstupních tokenů ji přebije.
Takže kdo z toho vyjde líp? Záleží na tom, co modelu dáváte.
- Dlouhé agentní běhy nad velkou kódovou základnou vám zlevní. Agent si čte stále dokola stejné soubory, cache je plná, sleva zabírá naplno.
- Jednorázové těžké přemýšlení vám zdraží. Složitá analýza, kde model dlouho uvažuje a málo čte z cache, vás vyjde o pětinu dráž.
- Effort je páka, kterou máte v ruce. Na xhigh dá Fable 5.1 pětašedesát bodů za 2,72 USD, tedy o dolar a čtyři centy míň než max. Jeden bod skóre za korunu navíc mi u většiny práce nepřijde jako dobrý obchod. Claude Code jede ve výchozím stavu na high, Cowork a claude.ai na medium.
Pro pětičlenné studio někde na Zlínsku, které nechá Claude Code běžet celý den nad monorepem, je to slušná úspora. Pro člověka, který si nechává na živnostenský list psát analýzy a rešerše, to bude naopak přirážka.
Upřímně, tohle je od Anthropicu chytře postavená komunikace. Sleva je reálná, procenta v tiskové zprávě jsou spočítaná poctivě, a přesto většina lidí odejde s dojmem, že model prostě zlevnil. Nezlevnil. Zlevnila jedna položka a model si přidal na jiné.
Ochrany se uvolnily, hlavně pro kyberbezpečnost
Tohle je pro vývojáře možná praktičtější změna než benchmarky. Fable 5 měl pověst modelu, který vás při bezpečnostní práci co chvíli odmítne obsloužit. Anthropic tvrdí, že uživatelé Claude Code uvidí zhruba o 60 procent méně zásahů kyberbezpečnostních ochran za sezení.
Konkrétně se povolilo hledání zranitelností v softwaru. Psaní exploitů dál povolené není, stejně jako penetrační testování a binární skenování zranitelností - tyhle úlohy putují na modely řady Opus. U biologie firma hlásí o 85 procent méně falešných poplachů u dotazů na základní biologii a medicínu.
Vedle toho běží dvě věci, o kterých se skoro nemluví, a přitom se vás můžou dotknout dřív než benchmarky.
Vodoznak v textu. Anthropic podepsal kodex k EU AI Act o transparentnosti obsahu generovaného AI a modely vydané po 2. srpnu 2026 vkládají do výstupu statistický vodoznak. Detekční API je zatím v uzavřeném testování pro regulátory, novináře a ověřovatele faktů. Na kvalitu výstupu to podle firmy nemá vliv a neobsahuje to žádnou informaci o uživateli. Ověřit si to zvenčí nejde.
Opatření proti destilaci. Nové účty API už nemůžou ručně upravovat předchozí kontext v konverzaci se zachováním přepisu Claudova uvažování. Byl to publikovaný způsob, jak z modelu tahat myšlenkový proces a trénovat na něm vlastní model. Stávající účty to zatím nepocítí, u dalších vydání modelů to bude platit pro všechny. Kdo si postavil vlastní harness nad prefillem, ať si přečte poznámku v nápovědě a přeměří si své volání.
Blog claudefa.st, který sleduje změny v API Anthropicu, k tomu přidává pozorování, že Fable 5.1 volá nástroje paralelně méně předvídatelně a v dlouhých agentních smyčkách někdy vydá jedno volání za tah tam, kde Fable 5 dávkoval několik. Nezávisle potvrzené to nemám, ale kdo si píše vlastní agentní smyčku, ať to zohlední při měření.
Věda: nejsilnější tvrzení a nejtenčí doklad
Anthropic postavil velkou část oznámení na vědeckých výsledcích. Stojí to za rozbor, protože kvalita dokladů se u jednotlivých případů liší dost výrazně.
Návrh proteinových binderů. Mythos 5.1 dostal otevřené nástroje pro návrh a skládání proteinů a jeho návrhy šly na experimentální ověření do dvou externích organizací. Na třech cílech dosáhl vazebné afinity desetkrát vyšší než nejlepší návrhy v soutěžích Adaptyv Bio. Úspěšnost návrhů, které se v laboratoři opravdu navázaly, dosáhla skoro padesáti procent na dvanácti cílech, přičemž běžný obor se pohybuje na deseti až patnácti. Tohle je z celého balíku nejsilnější doklad, protože ověření dělal někdo jiný a fyzicky.
Mapa Venuše. Fable 5.1 natrénoval neuronovou síť nad radarovými snímky z mise Magellan a vytvořil výškovou mapu třetiny planety s rozlišením dvou až tří kilometrů místo dosavadních deseti až dvaceti. Mapa je zveřejněná na Zenodo pod licencí Creative Commons, takže si ji kdokoli může stáhnout a přepočítat. Ověřená zatím není.
Zrychlení GPU kernelů. Mythos 5.1 přepsal výpočetní jádra sedmi otevřených modelů pro genomiku a proteiny a zrychlil je 1,4krát až 2,5krát při zachování identických výstupů. Anthropic slibuje optimalizace uvolnit jako otevřený kód. Do té doby je to tvrzení bez možnosti kontroly.
Podobně opatrně bych bral výroky partnerů. Hedgeový fond Millennium hlásí, že model našel příčinu pádu, kterou jeho lidé čtyři roky nerozlouskli. Browserbase, který provozuje infrastrukturu pro prohlížečové agenty, uvádí 82 procent dokončených úloh na svém nejtěžším testu proti 74 u Opus 5. Cognition, tvůrci agenta Devin, přesouvají na Fable 5.1 provoz, který dosud běžel na Opusu. Jsou to firemní vyjádření sesbíraná do tiskové zprávy. Nikdo je nezopakoval nezávisle a Anthropic k nim nedodal metodiku.
Co si z toho odnést
Fable 5.1 je k dnešnímu dni nejchytřejší model, který si můžete koupit, a náskok mu potvrdila i nezávislá kontrola. To je fakt a nemá smysl ho zlehčovat.
Zároveň je to model, který je pomalejší než průměr, hodně upovídaný a stojí 3,76 USD za úlohu proti 2,34 u Opusu 5, který je o tři body horší. Za ty tři body platíte šedesát procent navíc. Když stavíte agenta, který má běžet nad velkým kódem hodiny bez dozoru, dává to smysl. Když píšete běžnou aplikaci, sáhl bych po Opusu a ušetřené peníze utratil za víc běhů.
Co bych sledoval v dalších týdnech: jestli se ta upovídanost projeví i v Claude Code, kde effort ve výchozím stavu sedí na high. Artificial Analysis měřila max. Na high může vyjít poměr ceny a výkonu úplně jinak a zrovna tenhle údaj zatím nikdo nezveřejnil.
A ještě jedna věc, kterou mám na Anthropicu rád, i když ostatní čísla beru s rezervou. V poznámce pod tabulkou stojí, že Fable 5.1 se měřil se zapnutými produkčními ochranami, a tam kde zasáhly, dostal model na OSWorld nulu. Firma si tím sama podřezala vlastní benchmark a napsala to do tiskové zprávy. Takovou poctivost u konkurence moc nevidíme.
Zdroje: oznámení Anthropicu, system card, měření Artificial Analysis. Ceny a skóre platí k 2. září 2026 a mění se po týdnech. Přepočty do korun počítám kurzem 21 Kč za dolar.