Vibecoding.cz Patrick Zandl o AI vývoji
Brief Patrick Zandl

Gemini 4 Argon: zpět na špičce, jen pro vyvolené

První vlajkový model Googlu po víc než sedmi měsících, který vede ve dvanácti z osmnácti testů a stojí za token stejně jako Claude Sonnet 5.5? To je bomba! Až na to, že dostupný je jen pro vyvolené a i k tomu výkonu jsou výhrady. Na co se tedy vyplatí čekat?

Modely: Gemini 4 Argon
Reklama
Obsah článku

Google představil 30. září Gemini 4 Argon. Píšu o něm, protože je to první model Googlu nad třídou Flash od začátku roku. Gemini 3.5 Pro, na který jsme od června upozorňovali jako na chybějící vlajkovou loď, Google přeskočil a rovnou vydal čtyřku. Úniky ho před vydáním označovaly jako Gemini 4 Pro, vydaný stále ještě ale není.

Model, který v jedné odpovědi vygeneruje až milion tokenů. Předchůdci měli strop 64 tisíc. Google tím cílí na dlouhou samostatnou práci, kterou model zvládne v jednom běhu bez přerušení. Interně ho už firma prý používá třeba na přepis kódu z C++ do Rustu, kde dekodér videa libgav1 po přepisu běží 2,7krát rychleji než předchozí verze v Rustu.

Cena se kryje s Anthropicem, jistě náhodou :) Zaváděcí cena je 2 USD za milion vstupních a 10 USD za milion výstupních tokenů, tedy stejně jako u Sonnetu 5.5. Po skončení zaváděcího období platí 4 a 20 USD, stejně jako u Opusu 5.5. Kdy zaváděcí cena skončí, Google neuvádí. A například u Anthropicu se zaváděcí cena překlopila do trvalé…

Zatím k mání jen pro vybrané. Argon dostali nejdřív členové programu Fairwind, tedy prověření kyberbezpečnostní obránci, a interní týmy Googlu. Platící zákazníci API a předplatitelé Google AI Ultra ho mají dostat „co nejdřív“, až Google doladí ochranná opatření. Model zatím nemá ani veřejný identifikátor v API.

Kde stojí v nezávislém žebříčku

ModelIndex AACena za úlohu
Claude Opus 5.5 (max)58$5,98
Claude Sonnet 5.5 (max)56$7,60
Gemini 4 Argon (high)53$1,99
GPT-6 Astra (max)53$3,26
Claude Fable 5.1 (max)53
GPT-6.1 Sol (max)52

Index je verze 4.3.2 od Artificial Analysis, u Argonu na nejvyšší dostupné úrovni high a při zaváděcí ceně.

Proti Gemini 3.1 Pro je to skok o 23 bodů a Argon je osmý ze 223 měřených modelů. Google se tím vrací do stejné ligy jako OpenAI a Anthropic. Na první místo to ale nestačí: Argon dorovnal Astru a Fable 5.1, zatímco Opus 5.5 i menší Sonnet 5.5 zůstávají výš.

Levný je hlavně díky zaváděcí ceně. Úloha na indexu vyjde na 1,99 USD, zatímco Astra stojí 3,26 USD a Opus 5.5 5,98 USD. Model je přitom upovídaný a na úlohu spotřebuje kolem 62 tisíc tokenů, Astra 27 tisíc. Po skončení slevy se cena za úlohu zhruba zdvojnásobí na 4 USD, tedy nad úroveň Astry.

Tabulka Googlu

BenchmarkOblastArgonAstraFable 5.1Opus 5.5Kdo měřil
Vals Indexznalostní práce68,9 %63,1 %65,8 %67,0 %Vals AI
AutomationBenchznalostní práce51,3 %41,4 %31,4 %42,5 %Zapier
Vals Finance Agent v2znalostní práce65,4 %53,5 %58,9 %58,6 %Vals AI
Harvey Legal Agentznalostní práce19,6 %5,4 %6,7 %3,8 %Vals AI
DeepSWE v1.1agentní programování77,9 %74,1 %67,4 %74,2 %Google u Argonu, ostatní převzaté
FrontierSWE v2agentní programování55,0 %65,5 %56,3 %62,3 %Proximal
Vibe Code Benchagentní programování91,9 %89,6 %90,3 %90,3 %Vals AI
Terminal-Bench 4.0agentní programování57,4 %58,2 %57,9 %66,4 %Google u Argonu, ostatní převzaté
PostTrainBenchstrojové učení45,3 %44,3 %40,2 %49,3 %Google u všech
Terminal-Bench Science 0.1věda57,6 %68,1 %52,6 %63,3 %Google u Argonu, ostatní převzaté
LABBench 2věda88,8 %85,4 %68,6 %73,1 %Google u všech
RiemannBenchmatematika76,0 %72,0 %65,6 %69,6 %Surge
GraphWalks do 128Kdlouhý kontext99,7 %98,7 %91,4 %90,6 %Google u všech
GraphWalks 256K až 1Mdlouhý kontext84,2 %71,8 %65,0 %66,8 %Google u všech
Agent’s Last Examovládání počítače39,5 %34,2 %
38,2 %Google u Argonu, ostatní převzaté
OSWorld 2.0ovládání počítače69,2 %72,6 %
Google u Argonu, Astra od OpenAI
Chartographymultimodalita71,6 %71,0 %46,2 %66,3 %Surge
LVBenchdlouhé video91,7 %87,5 %79,7 %83,7 %Google u všech
CWE-bench v1kyberbezpečnost68,0 %68,0 %58,0 %67,0 %žebříček CWE-bench

Argon vede ve 13 z 19 řádků, v jednom remizuje a v pěti prohrává. GraphWalks je v tabulce dvakrát, odtud „dvanáct z osmnácti testů“ v oznámení. Prohry se soustřeďují na práci v terminálu a ovládání počítače: na FrontierSWE i Terminal-Benchi 4.0 je Argon poslední ze čtyř.

Nejpevnější jsou řádky, kde měřila třetí strana u všech modelů. Takových je devět a Argon v nich sedmkrát vyhrává, jednou remizuje a jednou prohrává. Patří mezi ně všechny čtyři testy znalostní práce. Náskok v obchodních úlohách potvrdila i Artificial Analysis vlastním během AutomationBench, kde je Argon první se 77,5 procenta.

Jedna výhrada ke zbytku tabulky. Google na mnoha řádcích naměřil Argon sám a postavil ho vedle čísel soupeřů převzatých z žebříčků a firemních zpráv. Nejvýraznější je to u LVBench, kde Argon dostal video s jedním snímkem za sekundu, zatímco Astra jen 800 snímků na celé video a modely Claude ještě méně kvůli omezením svých API. A na Harveyho právním testu vede Argon jen proti trojici soupeřů, které si Google vybral. V žebříčku Vals má Muse Spark 1.2 25,4 procenta.

V čem vyniká

Nejméně si vymýšlí. Míra halucinací je 15 procent, nejméně ze všech modelů nad 45 body indexu. Astra má 51 procent. Má to ale svou cenu: přesnost odpovědí je jen 50 procent proti 63 u Astry. Model tedy častěji přizná, že odpověď nezná, místo aby ji uhodl. Pro rešerše a práci s fakty je to užitečná vlastnost, jen ji nezaměňujte za větší znalosti.

Vede žebříčky znalostní práce i lidského hodnocení. Na Vals Indexu, který měří práci ve financích, právu, daních a programování, je první ze 41 modelů s 68,9 procenty, o 1,9 bodu před Opusem 5.5. Je to první Gemini, které ho vede. V Text Areně, kde hlasující porovnávají odpovědi dvou anonymních modelů, je první s 1525 body, o 20 bodů před druhým.

Vydrží u dlouhé práce. Na nezávislém testu Vending-Bench 2 od Andon Labs, kde model rok řídí simulovaný prodejní automat, skončil třetí se zůstatkem zhruba 13 700 USD.

Číslo z Terminal-Benche sedí. Google uvádí 57,4 procenta, Artificial Analysis naměřila 57,1. Je to první letošní případ, kdy se číslo výrobce na tomto testu shoduje s nezávislým měřením. Pro Opus 5.5 Google převzal nadsazených 66 procent od Anthropicu, takže se v tabulce sám ukázal o devět bodů za ním. Podle nezávislého měření je rozdíl 2,5 bodu.

Kyberbezpečnost bez omezení pro vybrané

Google model trénoval hlavně na obranu, tedy na hledání a opravu zranitelností. Prověřeným obráncům a interním týmům ho dává bez kyberbezpečnostních omezení. Je to stejný postup, jaký zvolila OpenAI u Astry a xAI u Groka 4.7: plná schopnost jen pro ověřené, ostatní dostanou verzi s ochranami.

Závěrem: Co si z toho odnést?

Zatím ho běžně nevyzkoušíte, takže všechno výše je zatím informace - a kdo ví, kdy se model mezi nás, běžné lidi dostane.

Až bude dostupný, vyzkoušel bych ho na znalostní práci ve financích a v obchodních procesech, na práci s velmi dlouhými dokumenty a všude, kde vám víc vadí vymyšlená odpověď než přiznané „nevím“.

U programování bych byl opatrný. V Code Areně, kde lidé hodnotí webový vývoj, je Argon až osmý, za čtyřmi modely Anthropicu a třemi od OpenAI. Sedí to s tím, co podle Bloombergu říkají lidé z Googlu s přístupem k modelu: výsledky v benchmarcích se do reálného programování nepřenášejí dobře. I vlastní tabulka Googlu ho staví na poslední místo v práci s terminálem.

Sledujte konec zaváděcí ceny. Po něm bude úloha na Argonu dražší než na Astře.

Za mě je to první model Googlu po dlouhé době, který patří do stejné ligy jako konkurence. Na čelo to zatím nestačí (a dokud si ho nevyzkouší běžní vývojáři, nevíme, jestli se mu tam vůbec povede dostat).


Zdroje: oznámení Googlu a jeho hodnoticí dokument z 30. září 2026, měření Artificial Analysis (index verze 4.3.2), žebříčky Vals.ai, Arena a Andon Labs, zpravodajství Bloombergu. Benchmarky z tabulky Googlu jsou zčásti měřené výrobcem. Platnost údajů k 2. říjnu 2026. Text vznikl s asistencí modelu Claude Opus 5.5, tedy konkurenčního modelu.

Patrick Zandl

Lektor agentního vývoje a technologický publicista. Od roku 2025 provozuje Vibecoding.cz — česky psaný web o AI nástrojích pro vývojáře — a vede veřejné workshopy Claude Code v Praze; firemní AI workshopy vede na aivefirmach.cz.

Profil autora →