DeepSeek vydal 9. září V4.1-Flash a je to mnohem zajímavější vydání, než napovídá skromné označení ve jménu. Za tou cenou totiž stojí konkrétní architektonická změna, ne dotace provozu. Takže si to pojďme rozebrat.
Asymetrická aktivace a nová architektura
Model má 552 miliard parametrů celkem, proti 284 miliardám u předchozího V4-Flash. Aktivuje jich ale jen osm miliard při zpracování vstupu a šestnáct při generování odpovědi. Předchůdce jich zapojoval třináct v obou fázích.
Ta asymetrie je to zlepšení a umožňuje ji architektura, které DeepSeek říká Causal Encoder-Decoder. Model má čtyřicet vrstev rozdělených na dvacetivrstvý kauzální enkodér a dvacetivrstvý dekodér. Globální mezipaměť klíčů a hodnot, tedy ta část paměti, kde si model drží zpracovaný kontext, se promítá z posledních skrytých stavů enkodéru místo z každé vrstvy dekodéru zvlášť.
Výsledek je pozoruhodný. Mezipaměť se zmenšila čtyřikrát proti V4-Flash a 437krát proti první generaci DeepSeeku. Právě tohle dělá model levným u agentních úloh, které polykají obrovské množství vstupu.
Ostatní parametry: milionové kontextové okno, nativní vstup obrazu, váhy pod licencí MIT na Hugging Face. A jedna neobvyklost, totiž plynule nastavitelná úroveň úsilí v rozsahu 1 až 100, zatímco konkurence nabízí tři až pět pevných stupňů.
Cena je důsledek toho všeho
| Model | Vstup | Výstup |
|---|---|---|
| GPT-6 Astra | 10,00 | 50,00 |
| Muse Spark 1.3 | 1,25 | 4,25 |
| Gemini 3.8 Flash | 0,75 | 3,75 |
| GLM-5.3-Flash | 0,15 | 0,50 |
| DeepSeek V4.1-Flash, špička | 0,30 | 1,20 |
| DeepSeek V4.1-Flash, mimo špičku | 0,15 | 0,60 |
Proti GPT-6 Astra, který vyšel před deseti dny, je to ve špičce třiatřicetinásobný rozdíl na vstupu a dvaačtyřicetinásobný na výstupu. V přepočtu zhruba tři koruny za milion vstupních tokenů proti dvěma stům deseti.
DeepSeek účtuje odlišně ve špičce a mimo ni, takže kdo si dávkové úlohy naplánuje na noc, zaplatí polovinu. Přidává to plánovací práci, kterou u konkurence řešit nemusíte.
Benchmarky a jedna past
Skoky proti předchozí verzi jsou velké. DeepSWE povyskočil o zhruba dvacet bodů, AutomationBench o sedmnáct. GPQA Diamond dává 90,9.
Tady je ale potřeba dát pozor na verzi Terminal-Benche. Po sítích se šíří, že V4.1-Flash na tomhle testu překonal GPT-5.6 Sol i Kimi K3. Platí to pro verzi benchmarku 2.1, jenže ta je nasycená a skoro všichni na ní mají kolem pětaosmdesáti až devadesáti procent.
Na těžší verzi 3.0 vypadá pořadí jinak:
| Model | Terminal-Bench 3.0 |
|---|---|
| GPT-5.6 Sol | 34,6 |
| Claude Fable 5.1 | 33,7 |
| DeepSeek V4.1-Flash | 30,0 |
| GLM-5.3 | 28,3 |
| Claude Opus 4.8 | 21,1 |
| Kimi K3 | 17,4 |
Model tedy poráží GLM i Kimi, zatímco se Solem prohrává o čtyři a půl bodu. Na nejtěžších agentních úlohách kolísá.
DeepSeek si přitom zaslouží pochvalu za metodiku. Zveřejnil výsledky pod několika různými agentními rámci, což letos neudělal skoro nikdo, přestože volba harnessu hýbe skóre o desítky bodů. Poznámky pod čarou uvádějí počty vzorků, teploty i podmínky běhu.
Zůstává obvyklá výhrada, že všechna čísla naměřil výrobce a nezávislé ověření zatím není.
Levný model zabil vlajkovou loď. Podruhé
DeepSeek uvádí, že V4.1-Flash překonává V4-Pro-0813 ve výkonu, ceně, rychlosti i celkovém čase, a proto V4-Pro z nabídky stahuje.
Ten model byl uvolněný 12. srpna. Po čtyřech týdnech končí, protože ho porazil levnější a „menší“ sourozenec.
A není to poprvé. Koncem července porazil V4-Flash-0731 tehdejší náhled V4-Pro na všech devíti agentních benchmarcích, které firma publikuje. Levná řada tedy zlikvidovala vlajkovou během dvou měsíců dvakrát.
Za mě je to nejzajímavější věc na celém vydání. Většina laboratoří drží drahý vlajkový model jako výkladní skříň, i když ho levnější sourozenec dohnal. DeepSeek ho rovnou zruší.
Pro koho to dává smysl
Vyzkoušel bych to, pokud stavíte agenty s velkým objemem vstupu, provozujete dávkové úlohy nebo hlídáte náklady. Za tuhle cenu dnes nic srovnatelného neseženete a váhy pod licencí MIT znamenají, že si model můžete provozovat u sebe, kdyby vás to uklidňovalo.
Sáhl bych jinam, pokud potřebujete špičku v nejtěžších agentních úlohách, kde Sol i Fable vedou, nebo pokud vám plánování podle špičky a mimo ni přidělává práci.
Zdroje: model card DeepSeek na Hugging Face, doprovodné rozbory Kaitchup a DataCamp, benchmarková data Z.ai pro srovnání Terminal-Bench 3.0. Všechny benchmarkové hodnoty pocházejí od výrobců a nezávislé měření V4.1-Flash k datu vydání článku neexistuje. Ceny se u těchto modelů mění po týdnech. Platnost údajů k 13. září 2026.