Brockman podle reportáže Axios osobně věří, že OpenAI dosáhla AGI, konečné posouzení však přenechal uživatelům: „Vítejte v éře AGI“. Takovou větou odpálil novinové titulky, protože média ji vděčně citovala.
Brockman potvrdil trénování na více než 100 tisících GPU, podrobnosti architektury nicméně zveřejnit odmítl. Množství výpočetní techniky vypovídá o investici do modelu, zjenže co výsledky? (Rozhovor s Gregem Brockmanem)
Souhrnný žebříček se během týdne změnil
První hodnocení působilo rozporuplně. OpenAI ukazovala velké skoky ve vybraných úlohách, zatímco Artificial Analysis, společnost provádějící srovnávací testy AI, našla v tehdejším souhrnném indexu výkon přibližně na úrovni předchozího GPT-5.6 Sol. Její rozbor z 3. září ale patří k verzi indexu v4.1.1. Při dnešním hodnocení musíme zohlednit ještě další vývoj. První rozbor Artificial Analysis
Artificial Analysis vydala 4. září verzi v4.2, kdy test rozsáhleji přepracovala. Například přidala test práce s dokumenty GDP.pdf, v němž měla Astra úspěšnost 33,2 %, Sol 28,2 % a Fable 5.1 26,2 %. Jde o přísný test, v němž se započítává úplné splnění hodnoticích kritérií odpovědi nad dokumentem. Změny indexu v4.2
Další aktualizace přišla 7. září. Verze v4.3 zahrnuje obtížnější Terminal-Bench 4.0 a širší automatizaci podnikových procesů. Její zveřejněné výsledky vypadají takto:
| Nezávislé měření Artificial Analysis | Astra | Sol | Fable 5.1 | Opus 5 |
|---|---|---|---|---|
| Intelligence Index v4.3, body | 53 | 47 | 53 | 51 |
| Terminal-Bench 4.0, úspěšnost | 59,1 % | 39,9 % | 52,0 % | 49,0 % |
| AutomationBench-AA, úplně dokončené úlohy | 41,6 % | 32,1 % | 28,3 % |
Astra, Sol a Opus používají režim max, Fable 5.1 režim „max with fallback“ podle nastavení hodnotitele. Pomlčka označuje údaj neuvedený v citovaném textovém souhrnu. Výsledky a metodika v4.3
U AutomationBench-AA má Astra také skóre 68,5 % za splněné dílčího cíle. Úplně dokončených procesů je uvedených 41,6 %. Záměna těchto metrik by výrazně nadhodnotila spolehlivost automatizace. Stejně zavádějící by bylo sledovat pokles čísel z 61 na 53 jako zhoršení modelu. Mezi verzemi se změnilo složení indexu. Musíme porovnávat stejné verze indexu.
Agregovaný výsledek testů závisí na výběru úloh a jejich vahách. Pro firmu, která automatizuje oběh dokumentů, může mít jinou výpovědní hodnotu než pro člověka řešícího vědecké výpočty. Začínáme se smiřovat s tím, že některé modely jsou na některé typy úloh lepší. A na jiné ne.
Tabulka OpenAI GPT-6 Astra
Následující čísla zachycují aktuální tabulku OpenAI. Výrobce uvádí výsledky při úrovni úsilí, která v daném testu dosáhla maxima; část konkurenčních údajů přebírá z jiných měření. Konfigurace se proto mohou lišit. Tabulka OpenAI a poznámky k měření
| Benchmark | Astra | Sol | Fable 5.1 | Opus 5 |
|---|---|---|---|---|
| FrontierMath Tier 4 v2 | 97,6 % | 83,0 % | 87,8 % | 73,2 % |
| Terminal-Bench 4.0 | 57,9 % | 37,3 % | 55,8 % | 52,6 % |
| Terminal-Bench Science 0.1 | 64,6 % | 22,4 % | 52,6 % | 30,0 % |
| OSWorld 2.0, offline, dílčí skóre | 72,6 % | 65,7 % | — | 70,2 % |
| AutomationBench | 41,4 % | 18,1 % | 31,4 % | 26,9 % |
| ExploitBench | 100,0 % | 78,5 % | — | 70,0 % |
| Humanity’s Last Exam, s nástroji | 57,2 % | — | 65,0 % | 63,6 % |
Překlad tabulky do lidštiny? Astra v testech zvládá práci s počítačem rychleji než její předchůdce, ale v odpovědích na odborné otázky za některými konkurenčními modely zaostává. Výsledky závisí na podmínkách měření, takže skutečnou úsporu času ukáže až používání na vašich vlastních úkolech.
ARC-AGI-3: dva výsledky, dvě konfigurace
ARC-AGI-3 zkoumá odvozování pravidel a plánování v neznámých hrách. ARC Prize Foundation pro Astru zveřejnila na sadě Semi-Private tato měření:
| Řídicí prostředí | Úsilí | Skóre | Cena celého běhu |
|---|---|---|---|
| Standard, společné rozhraní hodnotitele | max | 62,7 % | 26 098 USD |
| Provider Adapter, s funkcemi poskytovatele | high | 99,9 % | 18 817 USD |
| Provider Adapter, s funkcemi poskytovatele | max | 98,6 % | 17 332 USD |
Zdroj: rozbor ARC Prize Foundation, 3. září 2026.
Zjednodušeně řečeno Astra dosáhla vyššího, nezávisle ověřeného skóre s harnessem, pomocným systémem, který jí umožňuje lépe uchovávat a využívat předchozí postup řešení. V testovaných hrách si pak vystačila s méně tahy než lidé, ale tento výsledek sám nedokazuje, že zvládá stejně dobře i rozmanité situace skutečného světa.
Ohlasy: souhlas s pokrokem, spor o označení
Jensen Huang, šéf Nvidie, napsal 6. září, že AGI dorazila, a poblahopřál OpenAI. Jeho příspěvek zároveň zmiňoval další plánovanou výpočetní kapacitu. Nvidia dodává hardware, na kterém OpenAI trénuje; její vedení tedy má v úspěchu těchto systémů přímý obchodní zájem. To je kontext výroku, samo o sobě žádný důkaz jeho nesprávnosti. Reportáž o Huangově vyjádření
François Chollet, autor původního ARC, uznává rychlost pokroku. Podle The Decoder přišla saturace třetí generace přibližně dvakrát rychleji, než čekal, a posunul svou předpověď AGI před původně zmiňovaný rok 2030, bez nového přesného termínu. Současně trvá na tom, že hry v ARC zachycují potřebné schopnosti jen v omezeném rozsahu. Jeho postoj tedy obsahuje uznání výsledku i výhradu k jeho zobecnění. The Decoder o Cholletově reakci
Kognitivní vědec Gary Marcus ve své první reakci z 3. září rovněž připustil skutečný pokrok. Zaujalo ho, že Astra při řešení úloh vytváří symbolické modely prostředí. Za otevřenou otázku označil odolnost této schopnosti při změně podmínek a její využitelnost v neuzavřených úlohách. Své hodnocení výslovně označil za předběžné. Marcusova první reakce
O tři dny později Marcus kritizoval Huangovo prohlášení za chybějící definici a důkazy. Odvolal se na psychometrický rámec AGI a na konkrétní úlohy ze své dřívější sázky s Milesem Brundagem. Marcusova odpověď Huangovi
Odlišný důraz má text hlavního vědce OpenAI Jakuba Pachockého z 6. září. Pachocki očekává další růst schopností a rostoucí podíl AI na jejím vlastním vývoji. Zároveň píše, že porozumění chování modelů a jejich kontrola zaostávají, a připouští potřebu dobrovolného zpomalování vývoje. Jde o stanovisko člověka odpovědného za výzkum uvnitř OpenAI. Ukazuje, že i firemní debata zahrnuje otázku, zda dokážeme další schopnosti bezpečně zvládnout. An Alien Mind
Z těchto vyjádření vychází užší shoda na významu pokroku a spor o to, co pokrok dokládá. Žádný jednotlivý příspěvek ani několik recenzí přitom přitom nemůže zastupovat názor celé odborné komunity. A hlasitá debata na Xku i jinde o tom svědčí. Osobně považuji za užitečné požadovat po slovu AGI stejnou věc jako po jiných technických tvrzeních. Podmínky, za kterých je lze ověřit a případně vyvrátit.
Co bude rozhodovat při používání
Dokumentace API uvádí kontext 1 050 000 tokenů, výstup až 128 tisíc tokenů a úrovně uvažování low, medium, high, xhigh a max. Astra přijímá text a obrázky a vrací text. V praxi tak může zpracovávat dokumenty, psát kód a prostřednictvím připojených nástrojů pracovat s aplikacemi. Dokumentace modelu
Standardní sazba činí 10 USD za milion vstupních tokenů a 50 USD za milion výstupních (čili cena jako Fable). Čtení mezipaměti stojí 1 USD, zápis 12,50 USD za milion tokenů. U požadavku s více než 272 tisíci vstupních tokenů se vstupní i paměťové sazby zdvojnásobí a výstupní sazba vzroste na 1,5násobek, pro celý požadavek. Základní ceník tedy nevystihuje práci s dlouhými vstupy.
Cena úlohy závisí na jejím typu. V původním indexu Artificial Analysis byla Astra na úlohu přibližně o 75 % dražší než Sol; při agentním programování vycházela proti Solu zhruba stejně a měla vyšší skóre. V nové sadě v4.3 stojí vážená průměrná úloha Astry 3,26 USD proti 7,63 USD u Fable 5.1. Přenos těchto částek na vlastní provoz vyžaduje změřit také opakování, opravy a lidskou kontrolu. Původní měření nákladů, náklady ve v4.3
Astra je první model OpenAI zařazený do stupně Critical v oblasti kybernetických schopností. Firma tuto klasifikaci opírá o širší testování vyhledávání a zneužívání zranitelností, nikoli pouze o dva jednotlivé nálezy. Současně hlásí lepší dodržování oprávnění a obtížnější kontrolu zapsaného uvažování. Část zjištění o obcházení dohledu pochází z testů, které model k tomuto chování cíleně vybízely. Bezpečnostní přehled OpenAI
I skóre 100 % v ExploitBench má přesný význam. Test zahrnuje 41 známých zranitelností V8 a agreguje dosažené schopnosti přes pět pokusů. Nejde tedy o měření úspěšnosti jediného pokusu proti náhodně vybranému zabezpečenému prohlížeči. Rozšířenou obrannou práci má zpřístupňovat program Daybreak; veřejně nasazená omezení se od výzkumných testů liší. Systémová karta, kybernetické testování
Pro českou firmu zůstává podstatné, kudy procházejí data. Režim Zero Data Retention upravuje uchovávání dat a má vlastní podmínky; regionální ukládání a regionální zpracování je nutné ověřit zvlášť. OpenAI navíc vymezuje evropský region jako EHP a Švýcarsko a uvádí výjimky pro systémová data a služby třetích stran. Slib „data neopustí EU“ proto nelze odvodit jen z dostupnosti modelu v cloudu. Podmínky zpracování dat
Result?
Astra je zlepšení, ale na AGI to stále nevypadá. Pro české firmy bude důležité, že OpenAI modely v poslední době zvládají práci s češtinou lépe, než Anthropic modely, ty navíc ztrácejí náskok z kódování, který za poslední rok získaly. Obojí je pro české firmy zajímavé velmi, ale není to poslední výstřel z Aurory, tahle revoluce ještě nějakou dobu bude plápolat. Pamatujte na mne: žádné prudké pohyby, ať rozhodne cena a podmínky používání.