Anthropic vydal 22. září Claude Opus 5.5 a OpenAI o devadesát minut později GPT-6 Sol a GPT-6 Luna. Ještě týž den je změřila Artificial Analysis a Opus 5.5 navíc Vals.ai, takže nemusíme vycházet jen z firemních tabulek. Jak si tato dvojice modelů vede a jaký je tržní kontext i pozice?
Jak si stojí v žebříčku
| Model | Index AA | Vstup / výstup |
|---|---|---|
| Claude Opus 5.5 (max) | 58 | 4/20 |
| Claude Fable 5.1 (max) | 53 | 10/50 |
| GPT-6 Astra (max) | 53 | 10/50 |
| Claude Opus 5 (max) | 51 | 5/25 |
| GPT-6 Sol (max) | 48 | 2/10 |
| GPT-6 Luna (max) | 37 | 0,10/0,50 |
Ceny jsou za milion tokenů. Index je verze 4.3.2 od Artificial Analysis.
Anthropic zvedl strop, OpenAI srazilo cenu. To je základní zjištění. Obě strategie dávají smysl, jen míří na jiného zákazníka či na jinou část jeho potřeb.
Opus 5.5: nejvýkonnější model, se dvěma háčky
Nejvyšší skóre, jaké Artificial Analysis naměřila, o pět bodů nad Fable 5.1 i GPT-6 Astra. to je respektováníhodný odskok od ostatních účastníků peletonu. Model vede v šesti z deseti testů indexu, nejvýrazněji v dlouhé kancelářské práci na AA-Briefcase, kde má o 143 bodů Elo víc než Fable 5.1. Vals.ai mu přiřkl první místo na šesti svých žebříčcích. Cena za token klesla o pětinu proti Opusu 5.
První háček: výsledek v terminálu. Na Terminal-Benchi 4.0 uvádí Anthropic 66 procent, Artificial Analysis naměřila 60 a Vals.ai 62. Firma navíc tenhle řádek uvádí z úrovně xhigh, zbytek tabulky z max.
Druhý háček: úspora platí jen na výchozí úrovni. Anthropic slibuje, že běžná práce vyjde o 40 procent levněji než na Opusu 5. To platí na úrovni medium, kterou má model nastavenou jako výchozí. Na maximálním úsilí ale spotřebuje na úlohu 1,6krát víc tokenů než Opus 5, takže úloha vyjde stejně draho. Osobně bych řekl, že proto došlo k cenovým změnám…
A v právu sestup. Na Harveyho testu samostatné právní agendy spadl z 11,7 na 3,75 procenta a skončil jednatřicátý ze 64 modelů. Na Legal Research Bench klesl z 55 na 50 procent.
Co z toho plyne? Opus 5.5 je v průměru lepší model, než jeho předchůdce, zlepšení jsou ale rozložená nerovnoměrně. V kódu a kancelářské práci výrazně posílil, v právu ustoupil. Totéž letos vidíme i jinde: GPT-6 Astra i nové Sol a Luna ztratily body v GDPval. Nový model dnes znamená přerozdělení schopností a souhrnný index to zakryje. Než na něj přejdete, ověřte si ho na úlohách, které děláte vy. U ceny rozhoduje hlavně výchozí úroveň úsilí, kterou výrobce nastaví. Anthropic ji u Opusu 5.5 snížil na medium a slibovaná úspora platí právě tam. Na maximální úrovni by bez zlevnění tokenů vycházela úloha výrazně dráž než na Opusu 5 (nižší ceník to přesně vyrovnal).
GPT-6 Sol a Luna: poloviční cena, stejná inteligence
| Model | Index AA | Cena za úlohu |
|---|---|---|
| GPT-6 Sol (max) | 48 | $1,06 |
| GPT-5.6 Sol (max) | 47 | $1,99 |
| GPT-6 Luna (max) | 37 | $0,07 |
| GPT-5.6 Luna (max) | 37 | $0,18 |
Úloha stojí zhruba polovinu, inteligence se skoro nepohnula. To je ten hlavní závěr, jestli nemáte čas, víc číst nemusíte. Sol si polepšil o bod, Luna zůstala na místě. Úspora přitom jde celá na vrub nižšího ceníku, protože oba modely spotřebují na úlohu o něco víc tokenů než předchůdci. Úloha na Luně vyjde zhruba na korunu a půl.
Nejvýraznější zlepšení jsou halucinace, tedy vymýšlení odpovědí u faktů, které model nezná. U Sola klesly z 92 na 60 procent, u Luny z 93 na 77. Pořád jde ale o většinu případů, takže na práci s fakty potřebují oba modely podklady, ze kterých čerpají.
V kancelářské práci se oba zhoršili. Na GDPval-AA ztratil Sol kolem sta bodů Elo a Luna 75, protože odevzdávají kratší výstupy, ve kterých častěji chybí požadované části. A na DeepSWE má Sol na maximální úrovni 69 procent, zatímco jeho předchůdce měl 73. Podle vlastního grafu OpenAI je tedy nový model levnější, na vrcholu ale mírně slabší.
Luna podlezla čínskou konkurenci. Za 0,10 a 0,50 USD je levnější než DeepSeek V4.1 Flash (0,30 a 1,20 USD) při téměř stejném skóre, 37 proti 39. Americký uzavřený model tak cenou předběhl čínský otevřený, což jsme letos ještě neviděli. Proti Claude Haiku 4.5 stojí Luna desetinu.
Závěrem: Co si z toho odnést?
Když potřebujete špičku, sáhněte po Opusu 5.5 a nechte ho na výchozí úrovni medium. Jen tam slibovaná úspora platí. V Claude Code nezapomínejte, že je lepší kvůli spotřebě cache přepínat efforty, ne modely.
Když potřebujete objem, tedy tisíce úloh denně, je Luna nejlevnější použitelný model na trhu a Sol rozumný střed. Na faktografickou práci jim dejte zdroje, protože halucinují pořád hodně.
Pokud Opus používáte na právní agendu, přechod na 5.5 si NUTNĚ nejdřív otestujte na vlastních úlohách.
Přímé srovnání Sola s Opusem 5.5 zatím chybí. OpenAI ve svých grafech srovnává s Opusem 5, protože Opus 5.5 vyšel jen pár hodin předtím, a ve stejném prostředí je zatím nikdo neporovnal.
Pro české firmy: oba poskytovatelé jsou američtí. Anthropic nabízí u Opusu 5.5 nulovou retenci dat, u OpenAI si podmínky pro Sol a Lunu ověřte předem, pokud máte vůči klientům závazek držet data v EU.
Za mě je to nejzajímavější den letošního podzimu, protože poprvé vidíme dvě velké laboratoře jít ve stejnou chvíli opačnými směry. Která strategie vydělá víc (a jestli vůbec některá), ukáže až příští rok.
A jen na závěr: oba modely vyšly v okamžiku, kdy probíhaly zářiové Vibecoding Talks. Prezentující Petr Brzek z Macaly neváhal přerušit prezentaci a ukázat výsledky Opusu 5.5 - tak to všechny oslovilo :)
Zdroje: oznámení Anthropicu a OpenAI z 22. září 2026, měření Artificial Analysis (index verze 4.3.2) a Vals.ai. Údaj o DeepSWE u GPT-6 Sol pochází z grafu OpenAI. Platnost údajů k 23. září 2026. Text vznikl s asistencí modelu Claude Opus 5.5, tedy jednoho z modelů, o kterých pojednává.