Vibecoding.cz Patrick Zandl o AI vývoji
Strategic Analysis Patrick Zandl

Grok 4.6 dohnal OpenAI Sol s cenou o třetinu nižší. Číňani ho ale porážejí

Nový Grok 4.6 přichází měsíc po předchozí verzi a hned se pasuje na konkurenta oblíbeného modelu OpenAI Sol 5.6. Stojí však o třetinu méně. Čísla, zkušenosti, určení?

Modely: Grok 4.6

SpaceXAI vydala 12. srpna 2026 Grok 4.6 a přispěchala s tvrzením, že se model vyrovnal GPT-5.6 Sol na indexu inteligence od Artificial Analysis. Měření, které dorazilo krátce po vydání, to potvrdilo: oba mají 61 bodů. A přidalo číslo, které xAI sama nezveřejnila. Jedna dokončená úloha stojí na Groku 4.6 0,84 dolaru, zatímco na Sol 1,23$. Za stejnou inteligenci tedy platíte o třetinu méně. A to se vyplatí!

Jenže druhý nezávislý žebříček, tentokrát na webovém vývoji, staví Grok 4.6 až sedmý, za dva čínské modely. Podle toho, co děláte, dostanete opačnou odpověď.

Co Grok 4.6 je

Model navazuje na červencový Grok 4.5 a cílí na dlouho běžící agenty, tedy na scénáře, kdy umělá inteligence pracuje samostatně přes desítky kroků. K tomu na interaktivní a vizuální práci, kde má z hrubého nápadu vyrobit funkční první verzi aplikace. A musím říct, že to se mu daří opravdu dobře. Je vidět, že Grok ušel dlouhou cestu. Verze 4.5 byla výborná a verze 4.6 je opravdu velký a silný posun na úroveň Opusu a to v překvapivě krátké době.

Cena zůstala beze změny proti předchůdci, tedy 2 dolary za milion vstupních tokenů a 6 za milion výstupních, čtení z mezipaměti (cache) za 0,50, což je sleva 75 procent. Rychlá varianta stojí dvojnásobek. Kontextové okno je 500 tisíc tokenů, model přijímá text i obrázky. Od prvního dne běží v editoru Cursor, v prostředí Grok Build, v API a na OpenRouteru, Vercelu i Cloudflare, přičemž první týden nabízí SpaceXAI dvojnásobek zahrnutého využití.

Způsob, jakým model vznikl, je přitom pozoruhodnější než jeho parametry. SpaceXAI použila Grok 4.5 k vygenerování trénovacích dat pro Grok 4.6, konkrétně k regeneraci trajektorií pro fázi dohledového doladění. K tomu přidala delší doplňkový trénink a posilované učení na agentních úlohách z oblastí, jako je optimalizace jádra, webový vývoj nebo počítačem podporované konstruování. Model se tedy z velké části učil od svého předchůdce.

Zapadá to do vzorce, který se letos opakuje. Cognition postavila SWE-1.7 na čínském Kimi K2.7, DeepSeek u modelu V4-Flash nechal architekturu beze změny a přepsal jen post-trénink, Meta destilovala Muse Glimmer z většího Muse Spark. Zdroj zlepšení se přesouvá z velikosti základu do toho, co se s modelem děje potom. Trénovat model na výstupech jeho vlastního předchůdce má ovšem známé riziko, kterému se říká zhroucení modelu: rekurze postupně ubírá okraje rozdělení, tedy vzácná a neobvyklá řešení, a stahuje výstupy ke středu. Zrada je v tom, že benchmarky měří právě ten střed, takže model může ztrácet rozmanitost a současně skórovat výš.

Firemní tabulka, ve které xAI většinou prohrává

Tady patří SpaceXAI pochvala, kterou jsem jí udělil už u Groku 4.5 a která pořád platí. Ve své vlastní srovnávací tabulce publikuje deset hodnocení a v sedmi z nich prohrává.

HodnoceníGrok 4.6Grok 4.5GPT-5.6 SolFable 5
GDPVal-AA v21753152617281741
AA-Briefcase1577131315021574
Harvey LAB15,8 %12,9 %2,5 %11,3 %
CursorBench v3.269,9 %66,7 %67,2 %70,5 %
FrontierCode v1.161,3 %56,6 %60,6 %63,6 %
APEX-Agents57,5 %47,1 %56,7 %59,2 %
APEX-SWE56,4 %53,6 %
58,8 %
DeepSWE v1.165,9 %54 %73 %70 %
Terminal-Bench v3.026 %15,7 %34,6 %34,1 %

Grok 4.6 vede ve třech řádcích, Fable 5 v pěti a GPT-5.6 Sol ve dvou. Generační posun proti vlastnímu předchůdci je přitom výrazný napříč celou tabulkou, u AA-Briefcase o 264 bodů Elo a u DeepSWE o dvanáct procentních bodů.

Nejhůř dopadl Terminal-Bench v3.0 s 26 procenty, tedy o víc než osm bodů za Solem i Fablem. Nová verze toho benchmarku srazila skóre všem, Grok 4.5 měl na starší v2.1 ještě 83,3 procenta. Pokud někde uvidíte u Groku 4.6 vysoké číslo z Terminal-Bench, půjde o starší verzi testu.

Z tabulky ovšem vyčnívá hlavně to, co/kdo v ní chybí. Claude Opus 5 tam není vůbec, přestože je podle téhož indexu, na který se xAI odvolává, nejsilnějším běžně dostupným modelem na trhu, a to o dva body nad Grokem 4.6.

Nezávislé měření potvrdilo cenový argument

Artificial Analysis model změřila a nárok na paritu se Solem obstál. Grok 4.6 na vysoké úrovni úsilí dosáhl 61 bodů a je šestý ze 183 modelů své třídy.

O provozních nákladech ale rozhoduje cena za dokončenou úlohu, protože ceník za token sám o sobě klame. Model, který spotřebuje dvakrát víc tokenů, vyjde dráž i s levnějším ceníkem.

ModelIndexCena za úlohuCeník
Claude Opus 5 (max)632,345/25
Claude Fable 5 (se záložním)623,1410/50
GPT-5.6 Sol (max)611,235/30
Grok 4.6 (high)610,842/6
Kimi K3 (max)600,843/15
Qwen3.8 Max58
2/6
GLM-5.2 (max)530,31
DeepSeek V4-Flash 0731520,030,14/0,28

Při shodných 61 bodech tedy Grok 4.6 odvede úlohu za 0,84 dolaru proti 1,23 u Sola. To je o 32 procent méně. Proti Opusu 5, který je o dva body výš, je rozdíl skoro trojnásobný, a proti Fable 5 skoro čtyřnásobný.

Dolní část tabulky ukazuje ještě něco jiného. DeepSeek V4-Flash zvládne úlohu za tři centy, tedy za osmadvacetinu ceny Groku, byť za rozdíl devět bodů indexu. Kdo nepotřebuje absolutní špičku, má dnes na výběr úplně jinou cenovou hladinu.

Dovolte mi předem pár osobních postřehů.

S verzí Grok 4.5 pracuji poslední měsíc a musím říct, že jsem s ní byl velmi spokojen. Je rychlá a cenově přístupnější než nabídka Anthropicu. Pokud jste sólo programátor a nepotřebujete mít úplně to nejlepší, je to velmi rozumná volba.

Nicméně model 4.6 je opravdu velký rozdíl v kvalitě, přičemž mu zůstává jako velká výhoda rychlost. Oproti Opusu je opravdu výrazně rychlejší, a to při stejných funkcích a nižší ceně.

Také harness Grok Buildu se mezitím výrazně posunul. Ne nadarmo Grok před pár dny posunul svůj Grok Build na verzi 1.0. A nejnovější funkcí je Grok Bot, kterého jsem ještě neměl možnost vyzkoušet, protože je jen pro nejvyšší předplatné a 7000 Kč měsíčně se mi za to dávat zatím nechce.

Grok Bot je prý takový lepší Claude Cowork. Ale znáte to. Víc agentů, víc Adidas.

A na agentním indexu je Grok 4.6 první

Artificial Analysis vede vedle souhrnného indexu ještě užší agentní index, tedy vážený průměr těch hodnocení, která měří samostatnou práci s nástroji přes mnoho kroků. A tady je výsledek pro xAI nejlepší možný.

ModelAgentní index
Claude Opus 5 (max)59
Grok 4.6 (high)59
Claude Opus 5 (xhigh)58
Qwen3.8 Max58
GPT-5.6 Sol (max)58
Claude Fable 5 (se záložním)57
Kimi K3 (max)54
Claude Sonnet 5 (max)50
Grok 4.5 (high)49
DeepSeek V4-Flash 073148

Grok 4.6 se dělí o první místo s Claude Opusem 5 a je nad GPT-5.6 Sol, nad Fable 5 i nad Kimi K3, kterému nadělil pět bodů. Proti vlastnímu předchůdci je to skok z 49 na 59, tedy o deset bodů a největší generační posun, jaký se v těch datech najde.

A jde přesně o tu disciplínu, na kterou xAI model stavěla. Oznámení začíná větou o dlouho běžících agentech a měření tomu dává za pravdu. Firma tedy neslibovala obecnou převahu, slíbila konkrétní schopnost a tu doložila.

Jedna výhrada k tomu ovšem patří. Agentní index skládá jen dvě hodnocení z devíti, které tvoří souhrnný index, takže je z podstaty méně robustní. Rozdíl jednoho bodu na jeho vrcholu je proto ještě křehčí než na indexu souhrnném.

Na webu je pořadí obrácené

Druhý nezávislý pohled nabízí žebříček Arena Code WebDev, kde uživatelé slepě porovnávají výstupy modelů na úlohách webového vývoje. A vychází z něj skoro opačný obrázek.

PořadíModelEloCeník
1Claude Opus 5 (Max)16915/25
2Kimi K3 (Max)16743/15
3Qwen3.8-Max16692/6
5Claude Fable 5162710/50
6GPT-5.6 Sol (xHigh)16225/30
7Grok 4.6 (High)16182/6

Grok 4.6 je sedmý, za Solem i za oběma čínskými modely. Qwen3.8-Max od Alibaby má přitom naprosto shodný ceník, tedy 2 a 6 dolarů, a je o 51 bodů výš. Kimi K3 je ještě o kus nad ním.

Generační posun je i tady nepřehlédnutelný, protože Grok 4.5 sedí až třináctý s 1553 body.

Jak ty žebříčky srovnat? Měří něco jiného a dohromady dávají překvapivě čitelný obrázek. Na agentní práci, tedy na tom, na co byl model postavený, je Grok 4.6 první a oba Číňany poráží. Na souhrnném indexu inteligence je šestý a s Kimi K3 i Qwenem si drží náskok. Na webovém vývoji hodnoceném lidmi je sedmý a oba ho porážejí.

Čím užší disciplína a čím blíž k tomu, na co model cílili, tím líp Grok dopadá. Čím dál od ní, tím hůř. O volbě modelu tedy rozhoduje typ práce víc než pořadí v jakémkoli jednom žebříčku.

Jak se s ním pracuje

Praktický pohled zatím nabízí hlavně Eric Zakariasson, který model používal několik týdnů před vydáním. Je potřeba dodat, že pracuje v Cursoru, tedy ve firmě, kterou SpaceX loni koupil a která patří do téže skupiny jako xAI, takže to není nezávislý test.

Přesto přináší dvě konkrétní zjištění, která stojí za převzetí. Nejvíc na výsledku změnila jediná věta v zadání, totiž pokyn ověřit funkci a vzhled po implementaci a iterovat, dokud to není hotové. S ní model aplikaci sám otevřel, proklikal reálné uživatelské cesty a opravil, co našel. Dvoustránková specifikace proti třem větám přitom vedla ke skoro totožnému výsledku.

A fráze jako “pracuj velmi tvrdě” podle jeho testů nedělají nic.

Nešetří ale ani kritikou. V jednom běhu shrnutí tvrdilo, že je práce hotová, jenže funkce nefungovala a rozbitý import se ukázal až po pokynu spustit to a předvést. Falešné hlášení o dokončení se objevuje napříč modely, u Opusu 5 na něj upozorňoval Dan Shipper.

Co v oznámení chybí

Bezpečnostní část je prázdná. SpaceXAI píše, že ochranná opatření byla zlepšena a kalibrována podle schopností modelu a že proběhla nejširší sada testů před nasazením v historii firmy. Neuvádí k tomu jediné číslo, žádnou metriku ani rozpad podle typu rizika.

Srovnejte to s Opusem 5 z konce července, kde Anthropic zveřejnil rozdíl mezi nalézáním zranitelností a psaním exploitů, četnost zásahů bezpečnostních klasifikátorů i skóre nežádoucího chování. SpaceXAI přitom model nabízí mimo jiné na záplatování zranitelností, tedy na úlohu, která se od útočného použití liší hlavně záměrem.

Závěr

Grok 4.6 je poctivý generační posun. Za stejný výsledek zaplatíte o třetinu méně proti Sol 5.6, a proti Opusu 5 nebo Fable 5 zlomek. Na agentním indexu, tedy v disciplíně, na kterou byl model stavěný, se dokonce dělí o první místo s Opusem 5. Firma navíc znovu ukázala tabulku, kde sama většinou prohrává, což se u konkurence nevidí.

Výhrady ale zůstávají. Efektivita tokenů se proti předchůdci zhoršila z 60 na 72 milionů, přestože Musk sliboval opak. V tabulce chybí Opus 5, tedy model, který je na souhrnném indexu o dva body výš. A bezpečnostní sekce neobsahuje jediné měřitelné číslo.

Zbývá ta druhá půlka příběhu. Na webovém vývoji Grok 4.6 prohrává s Qwenem3.8-Max, který stojí přesně totéž a je o 51 bodů výš, i s Kimi K3. Vychází z toho model, který je nejlepší přesně v tom, nač byl postavený, a slábne s každým krokem od té specializace.

Patrick Zandl

Technologický publicista a vývojář, který od roku 2025 provozuje Vibecoding.cz — největší česky psaný zdroj o AI-asistovaném programování. Dříve Chief Wizard Architect v Prusa3D, dnes konzultant a lektor AI implementace ve firmách.

Profil autora →