Strategic Analysis Patrick Zandl

Claude Opus 5: nejchytřejší model co si nejvíc vymýšlí

Nový model Opus 5 je nejchytřejší, ale jen o bod. A ano, je levnější, než Fable 5, ale také dražší, než podobně chytří konkurenti včetně Kimi K3 s otevřenými vahami. Top modely se vyrovnávají schopnostmi, liší cenou a příjemností práce...

Modely: Opus 5

Anthropic vydal 24. července 2026 Claude Opus 5 a Artificial Analysis ho vyhodnotila na první místo svého indexu inteligence s 61 body, těsně před vlastní Fable 5 (60) a GPT-5.6 Sol (59). Je to čtvrtý model Anthropicu za necelé dva měsíce a firemní rétorika tentokrát staví na ceně místo na schopnostech: model, který se blíží špičce Fable 5 za polovinu ceny. Je to tak, měření dává Opusu 5 o 26 procent nižší cenu za úlohu než Fable. Je to ovšem srovnání s vlastním nejdražším modelem. Vůči GPT-5.6 Sol a čínskému Kimi K3 zaplatíte za jednu úlohu zhruba dvojnásobek!

Co Opus 5 je

Opus je střední až dražší člen rodiny Claude. Pozicován je nad levnějším Sonnetem 5 a pod Fable 5, tedy pod modelem, který v červnu na dva týdny zmizel z trhu kvůli exportním kontrolám. Opus 5 nahrazuje květnový Opus 4.8 a od prvního dne běží na všech placených plánech, v API, v Claude Code i v Coworku. Na tarifu Max je nově výchozím modelem, na Pro tím nejsilnějším dostupným.

Cena zůstala na 5 dolarech za milion vstupních tokenů a 25 za milion výstupních, tedy přesně tolik, kolik stál Opus 4.8. Proti Fable 5 (10/50$) je to polovina. Model používá nadále milionové kontextové okno (tedy množství tokenů/textu, které udrží najednou v hlavě) a nabízí režim Fast, který běží zhruba dvaapůlkrát rychleji za dvojnásobek ceny.

Uživatel si u něj volí úroveň úsilí, tedy kolik výpočtu model úloze věnuje, od nízké po maximální. Tenhle přepínač se za poslední půlrok stal hlavním nástrojem, jímž se vyvažuje cena proti přesnosti, a u Opusu 5 hraje větší roli než obvykle. Vrátím se k tomu.

Benchmarky výrobce

Následující čísla pocházejí z oznámení Anthropicu a z doprovodných materiálů. Jsou to tedy údaje výrobce, se všemi obvyklými výhradami.

BenchmarkOpus 5SrovnáníCo měří
Frontier-Bench v0.143,3 %Opus 4.8 měl 21,1 %náročné softwarové inženýrství
ARC-AGI 330,2 %zhruba trojnásobek druhého nejlepšíhořešení zcela nových problémů
OSWorld 2.070,6 %nad nejlepším výsledkem Fable 5ovládání počítače
FrontierCode 1.153,4 %Fable 5 má 53,5 %agentní programování
CursorBench 3.2do 0,5 % od vrcholu Fable 5za polovinu ceny za úlohuprogramování v editoru Cursor

Ve vědě model zlepšil všechny interní evaluace proti předchůdci, nejvíc v organické chemii (o 10,2 procentního bodu, například při odvozování molekulárních struktur ze spektroskopických dat) a u proteinových úloh (o 7,7 bodu). Právnická firma Harvey hlásí skok v korporátním právu a arbitráži, finanční Hebbia lepší práci s tabulkami a číselnou úvahou.

Jedna metodická poznámka, kterou Anthropic sám uvádí v poznámce pod čarou a která si zaslouží vytáhnout na světlo: Frontier-Bench běžel na harnessu mini-swe-agent, tedy ve vnějším běhovém rámci obklopujícím model, a Opus 4.8 sloužil jako záložní model při odmítnutí bezpečnostním klasifikátorem, a to u Opusu 5 i u Fable 5. Porovnávaný Fable je tedy směs dvou modelů.

Externí měření: nový lídr, ale těsně

Artificial Analysis, firma, která modely měří a srovnává standardizovaně, dala Opusu 5 na maximální úrovni úsilí 61 bodů svého souhrnného indexu inteligence. Je to nejvyšší hodnota, jakou kdy nějaký model dostal, a Opus 5 je tím pádem nejsilnější běžně dostupný model na trhu.

ModelIndexCena za úlohuCeník za tokeny
Claude Opus 5 (max)612,035/25
Claude Fable 5 (se záložním modelem)602,7510/50
GPT-5.6 Sol (max)591,045/30
Kimi K3570,943/15
Claude Opus 4.8 (max)561,805/25
Claude Sonnet 5 (max)531,533/15

Tři upřesnění, jak to číslo brát. Artificial Analysis měla k modelu přístup před vydáním a hodnocení dělala ve spolupráci s Anthropicem, takže jde o externí měření, ne o plně nezávislý test. Měření běželo se zapnutým záložním modelem, tedy s automatickým přepnutím na Opus 4.8, když zasáhne bezpečnostní klasifikátor, a platí to shodně pro Opus 5 i pro Fable 5. Srovnání je tím pádem symetrické a odpovídá tomu, co reálně dostane zákazník. A sama firma o výsledku píše, že Opus 5 je s Fable 5 prakticky vyrovnaný. Rozdíl 61 proti 60 na kompozitu z devíti benchmarků leží uvnitř statistického šumu. Na okraj: šest laboratoří má dnes model nad hranicí padesáti bodů, zatímco začátkem června to byly dvě.

Kde Opus 5 vede přesvědčivě, je agentní znalostní práce. Na GDPval-AA v2, který hodnotí modely na reálných profesních úlohách, dosáhl 1861 bodů Elo a je o 114 bodů před Fable 5 a přes sto bodů před GPT-5.6 Sol. Na AA-Briefcase, privátním testu dlouhé znalostní práce, dává 1720 Elo, tedy o 146 nad Fable. Obojí jsou nejvyšší hodnoty, jaké kdy byly naměřeny. Pro srovnání, Kimi K3 měl na týchž testech 1668 a 1548, takže odstup je tentokrát výrazný.

Změna přišla i tam, kde jsem ji nečekal. Na Coding Agent Indexu vedl dosud GPT-5.6 Sol, a Opus 5 se na úrovni xhigh v Claude Code o první místo dělí, včetně nejlepšího výsledku na SWE-Atlas-QnA. Na Terminal-Bench v2.1 dává 89 procent, tedy zhruba na úrovni vedoucího Sola.

Prvenství přesto neplatí plošně. Kimi K3 pořád drží Frontend Code Arena i evaluace Vercelu pro Next.js, tedy webové a frontendové inženýrství. Na fyzikální úvaze CritPt se Opus 5 vyrovná Fable, ale zaostává za trojicí GPT-5.6 Sol, GPT-5.5 Pro a GPT-5.6 Terra. A drobnost pro pořádek: Anthropic se chlubí prvenstvím na Zapierově AutomationBench, zatímco Artificial Analysis vede vlastní implementaci téhož testu, kde je první Kimi K3. Jsou to dvě různá měřítka se stejným jménem a míchat je dohromady by bylo zavádějící.

Halucinace: chytřejší model, který si víc vymýšlí

Tohle je nejnepříjemnější zjištění celého měření a v oznámení Anthropicu ho nenajdete.

Na testu AA-Omniscience, který ověřuje faktické znalosti, si Opus 5 proti Opusu 4.8 polepšil v přesnosti o sedm bodů. Zároveň ale častěji odpovídá i tam, kde si není jistý, a míra halucinací mu vyskočila o 14 bodů na 50 procent. Polovina odpovědí, kde model nezná fakt, tedy skončí smyšlenkou místo přiznání nejistoty. Ve faktických znalostech navíc Opus 5 zaostává za Fable 5, což odpovídá rozdílu ve velikosti obou modelů.

Je to přesně ta vlastnost, která se špatně pozná při běžném používání a draze zaplatí v produkci. Model působí sebejistě a věcně, jenže u faktů, které nemá, si vymyslí odpověď v polovině případů. Pro rešeršní práci, právo nebo medicínu je to zásadní varování, obzvlášť když Anthropic model prodává mimo jiné na vědecký výzkum a právnické úlohy.

Cena za úlohu

Ceník za tokeny je dnes špatný ukazatel, protože modely se liší v tom, kolik tokenů na stejnou práci spotřebují. Rozhoduje cena za dokončenou úlohu, a tu Artificial Analysis změřila. U Opusu 5 na maximálním úsilí vyšla na 2,03 dolaru.

Tvrzení Anthropicu tím obstálo. Fable 5 stojí 2,75 dolaru za úlohu, takže Opus 5 je o 26 procent levnější při prakticky shodné inteligenci. Kdo dnes platí za Fable, ušetří přechodem čtvrtinu účtu.

Jenže obrázek trhu vypadá jinak. GPT-5.6 Sol odvede práci za 1,04 dolaru, Kimi K3 za 0,94. Za jednu úlohu na Opusu 5 tedy zaplatíte zhruba dvojnásobek toho, co u dvou nejbližších konkurentů, a to za dva, respektive čtyři body indexu navíc. Stojí vám to za to?

A pozor na past se dvěma stejnými čísly. Harvey hlásí o 26 procent nižší spotřebu tokenů proti Opusu 4.8, Artificial Analysis o 26 procent nižší cenu za úlohu proti Fable 5. Jsou to dvě různá dvacetišestiprocenta a jejich smíchání by vedlo k závěru, že Opus 5 vyjde levněji než jeho předchůdce. Ve skutečnosti je na maximálním úsilí o 13 procent dražší (2,03 proti 1,80), a dražší je i než Sonnet 5 (1,53).

Tady se dostáváme k tomu, proč je přepínač úsilí u tohoto modelu důležitější než jinde. Rozsah je mimořádný: na GDPval-AA v2 dělí nejnižší a nejvyšší úroveň 407 bodů Elo a spotřeba výstupních tokenů se mezi nimi liší zhruba osmkrát. Na vysoké a velmi vysoké úrovni podle měření Opus 5 překoná Opus 4.8 i Sonnet 5 při nižší ceně za úlohu. Maximum se tedy vyplatí jen tam, kde ho úloha opravdu potřebuje, a jeho paušální zapnutí je ta nejdražší možná výchozí volba.

Samo Artificial Analysis k tomu dodává výhradu, která celou věc shrnuje: na hranici nejlepšího poměru inteligence a ceny se Opus 5 drží jen v horním pásmu inteligence. Na nižších úrovních úsilí sedí kousek za rodinou GPT-5.6. Kdo tedy nepotřebuje úplnou špičku, najde lepší poměr u OpenAI.

Kimi K3 má navíc do 27. července uvolnit váhy. Pokud to vyjde, bude čtyři body za nejsilnějším běžně dostupným modelem světa, poloviční v ceně za úlohu a půjde provozovat na vlastním železe.

Efektivita proti zážitku z práce

A teď část, kterou považuju za nejzajímavější na celém vydání, protože se v ní rozchází měření a subjektivní pocit.

Odezva z firem zní přesvědčivě, jenže ty firmy jsou přátelsky nakloněné, měly Opus předem k testům. Vývojářská platforma Lovable hlásí o 22 procent lepší výsledky na nejtěžších agentních úlohách proti Opusu 4.7 a výrazně menší rozptyl mezi jednotlivými běhy. Právě stabilita je pro nasazení cennější než špičkové skóre, protože agent, který jednou uspěje a podruhé ne, se do produkce pustit nedá.

Proti tomu stojí první nezávislé zkušenosti a nejsou lichotivé. Claire Vo, která provozuje sedmimodelový slepý benchmark, nadepsala svůj test “brilantní, ale otravný” a věnovala celou kapitolu upovídanosti pod názvem Claude Slop. Popisuje neurotickou povahu modelu včetně situace, kdy se odmítl dotknout konfliktu při slučování verzí. Dan Shipper z Every píše, že se model hádal s instrukcemi a zastavoval se před dokončením práce, a že se výrazně zlepšil teprve poté, co smazali stávající workflow a skills a začali od nuly. Doporučuje pracovat na střední nebo nízké úrovni úsilí, což se shoduje s tím, co ukázalo měření: níž je model levnější a v poměru ceny k výkonu často výhodnější.

Pointa je v tom, jak Claire Vo svůj text uzavírá. Práci s modelem přímo nesnáší, a přesto ho ve slepém hodnocení zařadila nad všechny ostatní včetně Fable 5 a jejího oblíbeného GPT-5.6 Sol. Slepé hodnocení proti vlastní antipatii je silnější důkaz kvality než jakýkoli nadšený příspěvek na síti. Zároveň to říká něco nepříjemného o tom, kam se vývoj ubírá: model je lepší a současně nepříjemnější na spolupráci.

Sám tyhle zkušenosti nemám, s modelem pracuju v češtině, ale jen den. Vnímám vyšší míru halucinací, včera jsem potřeboval přepracovat plán pro projekt 3gpp-explorer, v podkladech si Opus 5 hodně vymyslel a až review Solu ho vracelo na zem. Vnímám místy úsečnější vyjadřování, ale nemám ho za problematické. Velmi kriticky jsem ale vnímal degradaci kontextu v momentu, kdy se obsazené kontextové okno přehouplo přes cca 400K tokenů, to se práce radikálně zhoršovala. Budu to ještě sledovat a později s tím sumarizuji zkušenosti, navíc s tím musím upravit workshop Claude Code pro příští týden. Plus je tedy Opus 5 do všeho hrr - v momentě, kdy teprve brainstormujeme, už kóduje, ve chvíli, kdy měl čekat na code review, už něco samostatně zapracovává, ale to je možná věc úpravy harnessu a Claude Code obecně. I to budu monitorovat.

Kyberbezpečnost a jedna praktická věc pro firmy

V kyberbezpečnosti je Opus 5 rozštěpený a Anthropic to popisuje otevřeně. Model se blíží Mythosu 5 v nalézánízranitelností, ale výrazně za ním zaostává v psaní exploitů, tedy v převádění nalezené díry v použitelný útok. Ukazuje to na vlastní evaluaci OSS-Fuzz. Anthropic model na kyber úlohy záměrně netrénoval a schopnost přišla s obecným zlepšením.

Ochranná opatření ten rozštěp kopírují. Klasifikátory zasahují podle firmy asi o 85 procent méně často než u Fable 5, dovolují hledat zranitelnosti ve zdrojovém kódu a blokují binární skenování, penetrační testování a generování exploitů. Označený požadavek v Claude.ai, Claude Code a Coworku spadne na Opus 4.8. Firmy a výzkumníci v ověřovacím programu dostanou verzi s menším omezením.

Pro firemní nákup je ale podstatnější nenápadná věta na konci oznámení: **Opus 5 nemá požadavky na uchovávání dat.**Fable 5 drží vstupy a výstupy třicet dní, protože je potřebuje pro provoz bezpečnostních klasifikátorů. Pro firmy, jejichž smlouvy nebo regulátor vyžadují nulovou retenci u zdrojového kódu, tím padá překážka, kterou Fable neuměl přeskočit. To je konkrétnější důvod k volbě než kterýkoli benchmark v tomto článku.

Alignment má Opus 5 podle firmy nejlepší v historii, s hodnotou 2,3 na interní škále nežádoucího chování. Je to ovšem automatický audit samotného Anthropicu, tedy tvrzení výrobce o vlastním produktu.

Co dělat teď a na co si počkat

Shrnuto pro rozhodování:

  • Opus 5 dává smysl na dlouhé agentní úlohy, znalostní práci a všude, kde potřebujete nulovou retenci dat. V agentní znalostní práci má měřený náskok, který nikdo jiný nemá.
  • Přejděte z Fable 5, pokud na něm běžíte. Stejná inteligence za o čtvrtinu nižší účet a bez třicetidenní retence dat.
  • Zvažte konkurenci, pokud vás zajímá cena za dokončenou úlohu. Sol i K3 odvedou práci zhruba za polovinu a na nižších úrovních úsilí drží rodina GPT-5.6 lepší poměr.
  • Nenechávejte zapnuté maximum. Rozdíl mezi úrovněmi je u tohoto modelu osminásobek spotřebovaných tokenů. Na vysoké úrovni vyjde úloha levněji než na Opusu 4.8.
  • Ověřujte fakta. Halucinace na neznámých faktech dosahují poloviny případů, což je proti předchůdci znatelné zhoršení.
  • Přestavte workflow. Podle prvních testerů se model chová proaktivněji a staré skripty a skills mu spíš překážejí.

Závěr

Opus 5 je nejsilnější běžně dostupný model, jaký dnes seženete, a je to podložené nezávislým měřením i slepým testem. Ten titul má ale menší dopad, než se zdá. Vyhrát o bod na indexu, kde je pět modelů v rozpětí čtyř bodů, znamená čím dál míň, a Anthropic to zjevně ví. Jinak by celé oznámení nestavěl na ekonomice provozu.

Ta cenová obhajoba přitom míří na sebe sama. Úspora čtvrtiny proti Fable 5 je změřená a platí, jenže o Sol ani o Kimi K3 neříká nic, a právě s nimi se bude Opus 5 potkávat ve výběrových řízeních. Tam vychází zhruba dvojnásobně dráž za úlohu, a měřič sám přiznává, že nejlepší poměr ceny a výkonu drží Opus 5 jen na samé špici. O patro níž vede rodina GPT-5.6. Anthropic tedy vyhrál souboj s vlastním minulým vydáním, zatímco souboj o ekonomiku provozu zůstává otevřený.

A do toho ta halucinace. Polovina smyšlených odpovědí u faktů, které model nezná, je u nástroje prodávaného na vědu a právo věc, kterou by si zasloužilo zmínit oznámení, ne až tabulka měřiče.

Zbývá to, co Claire Vo napsala mimoděk a co je asi nejpřesnější zpráva dneška: model, se kterým se blbě pracuje, a který přesto ve slepém testu porazí všechno ostatní.

Dvacet let se AI měřila tím, jestli úlohu vyřeší. Teď se měří tím, kolik za to zaplatíte, jak často si vymyslí odpověď a jak moc vás při tom bude štvát.

Patrick Zandl

Technologický publicista a vývojář, který od roku 2025 provozuje Vibecoding.cz — největší česky psaný zdroj o AI-asistovaném programování. Dříve Chief Wizard Architect v Prusa3D, dnes konzultant a lektor AI implementace ve firmách.

Profil autora →