Anthropic vydal 24. července 2026 Claude Opus 5 a Artificial Analysis ho vyhodnotila na první místo svého indexu inteligence s 61 body, těsně před vlastní Fable 5 (60) a GPT-5.6 Sol (59). Je to čtvrtý model Anthropicu za necelé dva měsíce a firemní rétorika tentokrát staví na ceně místo na schopnostech: model, který se blíží špičce Fable 5 za polovinu ceny. Je to tak, měření dává Opusu 5 o 26 procent nižší cenu za úlohu než Fable. Je to ovšem srovnání s vlastním nejdražším modelem. Vůči GPT-5.6 Sol a čínskému Kimi K3 zaplatíte za jednu úlohu zhruba dvojnásobek!
Co Opus 5 je
Opus je střední až dražší člen rodiny Claude. Pozicován je nad levnějším Sonnetem 5 a pod Fable 5, tedy pod modelem, který v červnu na dva týdny zmizel z trhu kvůli exportním kontrolám. Opus 5 nahrazuje květnový Opus 4.8 a od prvního dne běží na všech placených plánech, v API, v Claude Code i v Coworku. Na tarifu Max je nově výchozím modelem, na Pro tím nejsilnějším dostupným.
Cena zůstala na 5 dolarech za milion vstupních tokenů a 25 za milion výstupních, tedy přesně tolik, kolik stál Opus 4.8. Proti Fable 5 (10/50$) je to polovina. Model používá nadále milionové kontextové okno (tedy množství tokenů/textu, které udrží najednou v hlavě) a nabízí režim Fast, který běží zhruba dvaapůlkrát rychleji za dvojnásobek ceny.
Uživatel si u něj volí úroveň úsilí, tedy kolik výpočtu model úloze věnuje, od nízké po maximální. Tenhle přepínač se za poslední půlrok stal hlavním nástrojem, jímž se vyvažuje cena proti přesnosti, a u Opusu 5 hraje větší roli než obvykle. Vrátím se k tomu.
Benchmarky výrobce
Následující čísla pocházejí z oznámení Anthropicu a z doprovodných materiálů. Jsou to tedy údaje výrobce, se všemi obvyklými výhradami.
| Benchmark | Opus 5 | Srovnání | Co měří |
|---|---|---|---|
| Frontier-Bench v0.1 | 43,3 % | Opus 4.8 měl 21,1 % | náročné softwarové inženýrství |
| ARC-AGI 3 | 30,2 % | zhruba trojnásobek druhého nejlepšího | řešení zcela nových problémů |
| OSWorld 2.0 | 70,6 % | nad nejlepším výsledkem Fable 5 | ovládání počítače |
| FrontierCode 1.1 | 53,4 % | Fable 5 má 53,5 % | agentní programování |
| CursorBench 3.2 | do 0,5 % od vrcholu Fable 5 | za polovinu ceny za úlohu | programování v editoru Cursor |
Ve vědě model zlepšil všechny interní evaluace proti předchůdci, nejvíc v organické chemii (o 10,2 procentního bodu, například při odvozování molekulárních struktur ze spektroskopických dat) a u proteinových úloh (o 7,7 bodu). Právnická firma Harvey hlásí skok v korporátním právu a arbitráži, finanční Hebbia lepší práci s tabulkami a číselnou úvahou.
Jedna metodická poznámka, kterou Anthropic sám uvádí v poznámce pod čarou a která si zaslouží vytáhnout na světlo: Frontier-Bench běžel na harnessu mini-swe-agent, tedy ve vnějším běhovém rámci obklopujícím model, a Opus 4.8 sloužil jako záložní model při odmítnutí bezpečnostním klasifikátorem, a to u Opusu 5 i u Fable 5. Porovnávaný Fable je tedy směs dvou modelů.
Externí měření: nový lídr, ale těsně
Artificial Analysis, firma, která modely měří a srovnává standardizovaně, dala Opusu 5 na maximální úrovni úsilí 61 bodů svého souhrnného indexu inteligence. Je to nejvyšší hodnota, jakou kdy nějaký model dostal, a Opus 5 je tím pádem nejsilnější běžně dostupný model na trhu.
| Model | Index | Cena za úlohu | Ceník za tokeny |
|---|---|---|---|
| Claude Opus 5 (max) | 61 | 2,03 | 5/25 |
| Claude Fable 5 (se záložním modelem) | 60 | 2,75 | 10/50 |
| GPT-5.6 Sol (max) | 59 | 1,04 | 5/30 |
| Kimi K3 | 57 | 0,94 | 3/15 |
| Claude Opus 4.8 (max) | 56 | 1,80 | 5/25 |
| Claude Sonnet 5 (max) | 53 | 1,53 | 3/15 |
Tři upřesnění, jak to číslo brát. Artificial Analysis měla k modelu přístup před vydáním a hodnocení dělala ve spolupráci s Anthropicem, takže jde o externí měření, ne o plně nezávislý test. Měření běželo se zapnutým záložním modelem, tedy s automatickým přepnutím na Opus 4.8, když zasáhne bezpečnostní klasifikátor, a platí to shodně pro Opus 5 i pro Fable 5. Srovnání je tím pádem symetrické a odpovídá tomu, co reálně dostane zákazník. A sama firma o výsledku píše, že Opus 5 je s Fable 5 prakticky vyrovnaný. Rozdíl 61 proti 60 na kompozitu z devíti benchmarků leží uvnitř statistického šumu. Na okraj: šest laboratoří má dnes model nad hranicí padesáti bodů, zatímco začátkem června to byly dvě.
Kde Opus 5 vede přesvědčivě, je agentní znalostní práce. Na GDPval-AA v2, který hodnotí modely na reálných profesních úlohách, dosáhl 1861 bodů Elo a je o 114 bodů před Fable 5 a přes sto bodů před GPT-5.6 Sol. Na AA-Briefcase, privátním testu dlouhé znalostní práce, dává 1720 Elo, tedy o 146 nad Fable. Obojí jsou nejvyšší hodnoty, jaké kdy byly naměřeny. Pro srovnání, Kimi K3 měl na týchž testech 1668 a 1548, takže odstup je tentokrát výrazný.
Změna přišla i tam, kde jsem ji nečekal. Na Coding Agent Indexu vedl dosud GPT-5.6 Sol, a Opus 5 se na úrovni xhigh v Claude Code o první místo dělí, včetně nejlepšího výsledku na SWE-Atlas-QnA. Na Terminal-Bench v2.1 dává 89 procent, tedy zhruba na úrovni vedoucího Sola.
Prvenství přesto neplatí plošně. Kimi K3 pořád drží Frontend Code Arena i evaluace Vercelu pro Next.js, tedy webové a frontendové inženýrství. Na fyzikální úvaze CritPt se Opus 5 vyrovná Fable, ale zaostává za trojicí GPT-5.6 Sol, GPT-5.5 Pro a GPT-5.6 Terra. A drobnost pro pořádek: Anthropic se chlubí prvenstvím na Zapierově AutomationBench, zatímco Artificial Analysis vede vlastní implementaci téhož testu, kde je první Kimi K3. Jsou to dvě různá měřítka se stejným jménem a míchat je dohromady by bylo zavádějící.
Halucinace: chytřejší model, který si víc vymýšlí
Tohle je nejnepříjemnější zjištění celého měření a v oznámení Anthropicu ho nenajdete.
Na testu AA-Omniscience, který ověřuje faktické znalosti, si Opus 5 proti Opusu 4.8 polepšil v přesnosti o sedm bodů. Zároveň ale častěji odpovídá i tam, kde si není jistý, a míra halucinací mu vyskočila o 14 bodů na 50 procent. Polovina odpovědí, kde model nezná fakt, tedy skončí smyšlenkou místo přiznání nejistoty. Ve faktických znalostech navíc Opus 5 zaostává za Fable 5, což odpovídá rozdílu ve velikosti obou modelů.
Je to přesně ta vlastnost, která se špatně pozná při běžném používání a draze zaplatí v produkci. Model působí sebejistě a věcně, jenže u faktů, které nemá, si vymyslí odpověď v polovině případů. Pro rešeršní práci, právo nebo medicínu je to zásadní varování, obzvlášť když Anthropic model prodává mimo jiné na vědecký výzkum a právnické úlohy.
Cena za úlohu
Ceník za tokeny je dnes špatný ukazatel, protože modely se liší v tom, kolik tokenů na stejnou práci spotřebují. Rozhoduje cena za dokončenou úlohu, a tu Artificial Analysis změřila. U Opusu 5 na maximálním úsilí vyšla na 2,03 dolaru.
Tvrzení Anthropicu tím obstálo. Fable 5 stojí 2,75 dolaru za úlohu, takže Opus 5 je o 26 procent levnější při prakticky shodné inteligenci. Kdo dnes platí za Fable, ušetří přechodem čtvrtinu účtu.
Jenže obrázek trhu vypadá jinak. GPT-5.6 Sol odvede práci za 1,04 dolaru, Kimi K3 za 0,94. Za jednu úlohu na Opusu 5 tedy zaplatíte zhruba dvojnásobek toho, co u dvou nejbližších konkurentů, a to za dva, respektive čtyři body indexu navíc. Stojí vám to za to?
A pozor na past se dvěma stejnými čísly. Harvey hlásí o 26 procent nižší spotřebu tokenů proti Opusu 4.8, Artificial Analysis o 26 procent nižší cenu za úlohu proti Fable 5. Jsou to dvě různá dvacetišestiprocenta a jejich smíchání by vedlo k závěru, že Opus 5 vyjde levněji než jeho předchůdce. Ve skutečnosti je na maximálním úsilí o 13 procent dražší (2,03 proti 1,80), a dražší je i než Sonnet 5 (1,53).
Tady se dostáváme k tomu, proč je přepínač úsilí u tohoto modelu důležitější než jinde. Rozsah je mimořádný: na GDPval-AA v2 dělí nejnižší a nejvyšší úroveň 407 bodů Elo a spotřeba výstupních tokenů se mezi nimi liší zhruba osmkrát. Na vysoké a velmi vysoké úrovni podle měření Opus 5 překoná Opus 4.8 i Sonnet 5 při nižší ceně za úlohu. Maximum se tedy vyplatí jen tam, kde ho úloha opravdu potřebuje, a jeho paušální zapnutí je ta nejdražší možná výchozí volba.
Samo Artificial Analysis k tomu dodává výhradu, která celou věc shrnuje: na hranici nejlepšího poměru inteligence a ceny se Opus 5 drží jen v horním pásmu inteligence. Na nižších úrovních úsilí sedí kousek za rodinou GPT-5.6. Kdo tedy nepotřebuje úplnou špičku, najde lepší poměr u OpenAI.
Kimi K3 má navíc do 27. července uvolnit váhy. Pokud to vyjde, bude čtyři body za nejsilnějším běžně dostupným modelem světa, poloviční v ceně za úlohu a půjde provozovat na vlastním železe.
Efektivita proti zážitku z práce
A teď část, kterou považuju za nejzajímavější na celém vydání, protože se v ní rozchází měření a subjektivní pocit.
Odezva z firem zní přesvědčivě, jenže ty firmy jsou přátelsky nakloněné, měly Opus předem k testům. Vývojářská platforma Lovable hlásí o 22 procent lepší výsledky na nejtěžších agentních úlohách proti Opusu 4.7 a výrazně menší rozptyl mezi jednotlivými běhy. Právě stabilita je pro nasazení cennější než špičkové skóre, protože agent, který jednou uspěje a podruhé ne, se do produkce pustit nedá.
Proti tomu stojí první nezávislé zkušenosti a nejsou lichotivé. Claire Vo, která provozuje sedmimodelový slepý benchmark, nadepsala svůj test “brilantní, ale otravný” a věnovala celou kapitolu upovídanosti pod názvem Claude Slop. Popisuje neurotickou povahu modelu včetně situace, kdy se odmítl dotknout konfliktu při slučování verzí. Dan Shipper z Every píše, že se model hádal s instrukcemi a zastavoval se před dokončením práce, a že se výrazně zlepšil teprve poté, co smazali stávající workflow a skills a začali od nuly. Doporučuje pracovat na střední nebo nízké úrovni úsilí, což se shoduje s tím, co ukázalo měření: níž je model levnější a v poměru ceny k výkonu často výhodnější.
Pointa je v tom, jak Claire Vo svůj text uzavírá. Práci s modelem přímo nesnáší, a přesto ho ve slepém hodnocení zařadila nad všechny ostatní včetně Fable 5 a jejího oblíbeného GPT-5.6 Sol. Slepé hodnocení proti vlastní antipatii je silnější důkaz kvality než jakýkoli nadšený příspěvek na síti. Zároveň to říká něco nepříjemného o tom, kam se vývoj ubírá: model je lepší a současně nepříjemnější na spolupráci.
Sám tyhle zkušenosti nemám, s modelem pracuju v češtině, ale jen den. Vnímám vyšší míru halucinací, včera jsem potřeboval přepracovat plán pro projekt 3gpp-explorer, v podkladech si Opus 5 hodně vymyslel a až review Solu ho vracelo na zem. Vnímám místy úsečnější vyjadřování, ale nemám ho za problematické. Velmi kriticky jsem ale vnímal degradaci kontextu v momentu, kdy se obsazené kontextové okno přehouplo přes cca 400K tokenů, to se práce radikálně zhoršovala. Budu to ještě sledovat a později s tím sumarizuji zkušenosti, navíc s tím musím upravit workshop Claude Code pro příští týden. Plus je tedy Opus 5 do všeho hrr - v momentě, kdy teprve brainstormujeme, už kóduje, ve chvíli, kdy měl čekat na code review, už něco samostatně zapracovává, ale to je možná věc úpravy harnessu a Claude Code obecně. I to budu monitorovat.
Kyberbezpečnost a jedna praktická věc pro firmy
V kyberbezpečnosti je Opus 5 rozštěpený a Anthropic to popisuje otevřeně. Model se blíží Mythosu 5 v nalézánízranitelností, ale výrazně za ním zaostává v psaní exploitů, tedy v převádění nalezené díry v použitelný útok. Ukazuje to na vlastní evaluaci OSS-Fuzz. Anthropic model na kyber úlohy záměrně netrénoval a schopnost přišla s obecným zlepšením.
Ochranná opatření ten rozštěp kopírují. Klasifikátory zasahují podle firmy asi o 85 procent méně často než u Fable 5, dovolují hledat zranitelnosti ve zdrojovém kódu a blokují binární skenování, penetrační testování a generování exploitů. Označený požadavek v Claude.ai, Claude Code a Coworku spadne na Opus 4.8. Firmy a výzkumníci v ověřovacím programu dostanou verzi s menším omezením.
Pro firemní nákup je ale podstatnější nenápadná věta na konci oznámení: **Opus 5 nemá požadavky na uchovávání dat.**Fable 5 drží vstupy a výstupy třicet dní, protože je potřebuje pro provoz bezpečnostních klasifikátorů. Pro firmy, jejichž smlouvy nebo regulátor vyžadují nulovou retenci u zdrojového kódu, tím padá překážka, kterou Fable neuměl přeskočit. To je konkrétnější důvod k volbě než kterýkoli benchmark v tomto článku.
Alignment má Opus 5 podle firmy nejlepší v historii, s hodnotou 2,3 na interní škále nežádoucího chování. Je to ovšem automatický audit samotného Anthropicu, tedy tvrzení výrobce o vlastním produktu.
Co dělat teď a na co si počkat
Shrnuto pro rozhodování:
- Opus 5 dává smysl na dlouhé agentní úlohy, znalostní práci a všude, kde potřebujete nulovou retenci dat. V agentní znalostní práci má měřený náskok, který nikdo jiný nemá.
- Přejděte z Fable 5, pokud na něm běžíte. Stejná inteligence za o čtvrtinu nižší účet a bez třicetidenní retence dat.
- Zvažte konkurenci, pokud vás zajímá cena za dokončenou úlohu. Sol i K3 odvedou práci zhruba za polovinu a na nižších úrovních úsilí drží rodina GPT-5.6 lepší poměr.
- Nenechávejte zapnuté maximum. Rozdíl mezi úrovněmi je u tohoto modelu osminásobek spotřebovaných tokenů. Na vysoké úrovni vyjde úloha levněji než na Opusu 4.8.
- Ověřujte fakta. Halucinace na neznámých faktech dosahují poloviny případů, což je proti předchůdci znatelné zhoršení.
- Přestavte workflow. Podle prvních testerů se model chová proaktivněji a staré skripty a skills mu spíš překážejí.
Závěr
Opus 5 je nejsilnější běžně dostupný model, jaký dnes seženete, a je to podložené nezávislým měřením i slepým testem. Ten titul má ale menší dopad, než se zdá. Vyhrát o bod na indexu, kde je pět modelů v rozpětí čtyř bodů, znamená čím dál míň, a Anthropic to zjevně ví. Jinak by celé oznámení nestavěl na ekonomice provozu.
Ta cenová obhajoba přitom míří na sebe sama. Úspora čtvrtiny proti Fable 5 je změřená a platí, jenže o Sol ani o Kimi K3 neříká nic, a právě s nimi se bude Opus 5 potkávat ve výběrových řízeních. Tam vychází zhruba dvojnásobně dráž za úlohu, a měřič sám přiznává, že nejlepší poměr ceny a výkonu drží Opus 5 jen na samé špici. O patro níž vede rodina GPT-5.6. Anthropic tedy vyhrál souboj s vlastním minulým vydáním, zatímco souboj o ekonomiku provozu zůstává otevřený.
A do toho ta halucinace. Polovina smyšlených odpovědí u faktů, které model nezná, je u nástroje prodávaného na vědu a právo věc, kterou by si zasloužilo zmínit oznámení, ne až tabulka měřiče.
Zbývá to, co Claire Vo napsala mimoděk a co je asi nejpřesnější zpráva dneška: model, se kterým se blbě pracuje, a který přesto ve slepém testu porazí všechno ostatní.
Dvacet let se AI měřila tím, jestli úlohu vyřeší. Teď se měří tím, kolik za to zaplatíte, jak často si vymyslí odpověď a jak moc vás při tom bude štvát.