Vibecoding.cz Patrick Zandl o AI vývoji
Brief Patrick Zandl

DeepSeek V4.1-Flash: nová architektura srazila cenu inference o řád

Model s 552 miliardami parametrů, který jich při čtení vstupu zapojí jen osm. Váhy pod MIT licencí, milionový kontext, vstup obrazu a cena patnáct centů za milion tokenů. A svého vlastního vlajkového sourozence poslal do důchodu měsíc po jeho vydání. To je nový model DeepSeeku...

Reklama
Obsah článku

DeepSeek vydal 9. září V4.1-Flash a je to mnohem zajímavější vydání, než napovídá skromné označení ve jménu. Za tou cenou totiž stojí konkrétní architektonická změna, ne dotace provozu. Takže si to pojďme rozebrat.

Asymetrická aktivace a nová architektura

Model má 552 miliard parametrů celkem, proti 284 miliardám u předchozího V4-Flash. Aktivuje jich ale jen osm miliard při zpracování vstupu a šestnáct při generování odpovědi. Předchůdce jich zapojoval třináct v obou fázích.

Ta asymetrie je to zlepšení a umožňuje ji architektura, které DeepSeek říká Causal Encoder-Decoder. Model má čtyřicet vrstev rozdělených na dvacetivrstvý kauzální enkodér a dvacetivrstvý dekodér. Globální mezipaměť klíčů a hodnot, tedy ta část paměti, kde si model drží zpracovaný kontext, se promítá z posledních skrytých stavů enkodéru místo z každé vrstvy dekodéru zvlášť.

Výsledek je pozoruhodný. Mezipaměť se zmenšila čtyřikrát proti V4-Flash a 437krát proti první generaci DeepSeeku. Právě tohle dělá model levným u agentních úloh, které polykají obrovské množství vstupu.

Ostatní parametry: milionové kontextové okno, nativní vstup obrazu, váhy pod licencí MIT na Hugging Face. A jedna neobvyklost, totiž plynule nastavitelná úroveň úsilí v rozsahu 1 až 100, zatímco konkurence nabízí tři až pět pevných stupňů.

Cena je důsledek toho všeho

ModelVstupVýstup
GPT-6 Astra10,0050,00
Muse Spark 1.31,254,25
Gemini 3.8 Flash0,753,75
GLM-5.3-Flash0,150,50
DeepSeek V4.1-Flash, špička0,301,20
DeepSeek V4.1-Flash, mimo špičku0,150,60

Proti GPT-6 Astra, který vyšel před deseti dny, je to ve špičce třiatřicetinásobný rozdíl na vstupu a dvaačtyřicetinásobný na výstupu. V přepočtu zhruba tři koruny za milion vstupních tokenů proti dvěma stům deseti.

DeepSeek účtuje odlišně ve špičce a mimo ni, takže kdo si dávkové úlohy naplánuje na noc, zaplatí polovinu. Přidává to plánovací práci, kterou u konkurence řešit nemusíte.

Benchmarky a jedna past

Skoky proti předchozí verzi jsou velké. DeepSWE povyskočil o zhruba dvacet bodů, AutomationBench o sedmnáct. GPQA Diamond dává 90,9.

Tady je ale potřeba dát pozor na verzi Terminal-Benche. Po sítích se šíří, že V4.1-Flash na tomhle testu překonal GPT-5.6 Sol i Kimi K3. Platí to pro verzi benchmarku 2.1, jenže ta je nasycená a skoro všichni na ní mají kolem pětaosmdesáti až devadesáti procent.

Na těžší verzi 3.0 vypadá pořadí jinak:

ModelTerminal-Bench 3.0
GPT-5.6 Sol34,6
Claude Fable 5.133,7
DeepSeek V4.1-Flash30,0
GLM-5.328,3
Claude Opus 4.821,1
Kimi K317,4

Model tedy poráží GLM i Kimi, zatímco se Solem prohrává o čtyři a půl bodu. Na nejtěžších agentních úlohách kolísá.

DeepSeek si přitom zaslouží pochvalu za metodiku. Zveřejnil výsledky pod několika různými agentními rámci, což letos neudělal skoro nikdo, přestože volba harnessu hýbe skóre o desítky bodů. Poznámky pod čarou uvádějí počty vzorků, teploty i podmínky běhu.

Zůstává obvyklá výhrada, že všechna čísla naměřil výrobce a nezávislé ověření zatím není.

Levný model zabil vlajkovou loď. Podruhé

DeepSeek uvádí, že V4.1-Flash překonává V4-Pro-0813 ve výkonu, ceně, rychlosti i celkovém čase, a proto V4-Pro z nabídky stahuje.

Ten model byl uvolněný 12. srpna. Po čtyřech týdnech končí, protože ho porazil levnější a „menší“ sourozenec.

A není to poprvé. Koncem července porazil V4-Flash-0731 tehdejší náhled V4-Pro na všech devíti agentních benchmarcích, které firma publikuje. Levná řada tedy zlikvidovala vlajkovou během dvou měsíců dvakrát.

Za mě je to nejzajímavější věc na celém vydání. Většina laboratoří drží drahý vlajkový model jako výkladní skříň, i když ho levnější sourozenec dohnal. DeepSeek ho rovnou zruší.

Pro koho to dává smysl

Vyzkoušel bych to, pokud stavíte agenty s velkým objemem vstupu, provozujete dávkové úlohy nebo hlídáte náklady. Za tuhle cenu dnes nic srovnatelného neseženete a váhy pod licencí MIT znamenají, že si model můžete provozovat u sebe, kdyby vás to uklidňovalo.

Sáhl bych jinam, pokud potřebujete špičku v nejtěžších agentních úlohách, kde Sol i Fable vedou, nebo pokud vám plánování podle špičky a mimo ni přidělává práci.


Zdroje: model card DeepSeek na Hugging Face, doprovodné rozbory Kaitchup a DataCamp, benchmarková data Z.ai pro srovnání Terminal-Bench 3.0. Všechny benchmarkové hodnoty pocházejí od výrobců a nezávislé měření V4.1-Flash k datu vydání článku neexistuje. Ceny se u těchto modelů mění po týdnech. Platnost údajů k 13. září 2026.

Patrick Zandl

Lektor agentního vývoje a technologický publicista. Od roku 2025 provozuje Vibecoding.cz — česky psaný web o AI nástrojích pro vývojáře — a vede veřejné workshopy Claude Code v Praze; firemní AI workshopy vede na aivefirmach.cz.

Profil autora →