Vibecoding.cz Patrick Zandl o AI vývoji

$ entry

Železo pro lokální AI: co v srpnu 2026 koupit a jestli se to vyplatí

Strašně to láká. Koupíte si AI počítač a provozujete lokální modely za cenu splátky hardware. Aby tahle hra vycházela, musí železo být dostupné, otevřené modely dostatečně silné a cena těch uzavřených nesmí padnout. Takže, co vybrat?

Reklama
Obsah článku

Strašně to láká. Koupíte si AI počítač a provozujete lokální modely za cenu splátky hardware. Aby tahle hra vycházela, musí železo být dostupné, otevřené modely dostatečně silné a cena těch uzavřených nesmí padnout. Takže, co vybrat?

Proč vlastně tuhle diskusi otevírám teď, Protože Apple právě oznámil Mac mini s M6 a Mac Studio s M5 Ultra. O den dřív ukázalo Xiaomi prototyp AI Cube, ve stejný týden otevřelo Arduino předprodej desky VENTUNO Q. Vedle toho stojí Nvidia DGX Spark a AMD Strix Halo, které se prodávají rok. Takže se hodně stalo a hodně děje. Prošel jsem si čísla a spočítal, kdy se ta investice vrátí.


Číslo, které rozhoduje

Většina recenzí začíná kapacitou paměti. U jazykových modelů ale rozhoduje propustnost. Důvod je mechanický: každý vygenerovaný token musí projít všemi aktivními vrstvami, takže se váhy přenášejí z paměti do GPU. Výpočtů je na jeden token málo, čtení paměti hodně. Kapacita říká, jestli se model vejde. Propustnost říká, jak rychle poběží.

StrojPaměťPropustnostCena (CZK / USD)
Mac mini M616-32 GB170 GB/sod 25 990 / $899
Mac mini M5 Prodo 64 GB307 GB/sod $1 699
Mac Studio M5 Max36-128 GB614 GB/sod 69 990 / $2 499
Mac Studio M5 Ultra96-512 GB1,2 TB/sod 154 990 / $5 499
Nvidia DGX Spark (GB10)128 GB273 GB/s~$4 000-4 700
AMD Ryzen AI Max+ 395128 GB256 GB/s$1 500-2 000 (mini PC)
Xiaomi AI Cube~80 GB (prototyp)1,22 TB/s u O100neexistuje

Mac mini s M6 je pro jazykové modely nejslabší volba ze všech. 170 GB/s a strop 32 GB. Generování tokenů zůstává omezené na těch 170 GB/s a s tím žádný driver nepohne. Kdo chce Miníka jako inferenční box, musí sáhnout po verzi s M5 Pro.

Ještě detail, který se dá přehlédnout: M6 má tři Thunderbolt 4 porty, M5 Pro tři Thunderbolt 5. Clustering přes TB5 a RDMA, kterým se Apple chlubí, na levném mini nefunguje. Kdo si plánoval koupit čtyři kusy za 26 tisíc a slepit z nich paměťový pool, má smůlu.

DGX Spark je dobrý prefill stroj a průměrný decode stroj. Georgi Gerganov to proměřil: Na gpt-oss 20B v MXFP4 přes Ollamu dává Spark zhruba 2 053 tok/s prefill a 49,7 tok/s decode, kdežto RTX Pro 6000 Blackwell 10 108 a 205. Kdo si chce na DGX i něco doladit, dostane tam nejmenší tření. Kdo chce jen rychle generovat, přeplácí.

Strix Halo je nejlepší poměr korun na gigabajt. GMKtec EVO-X2 za $1 499 nebo Framework Desktop za $1 999 dají 128 GB unifikované paměti, z toho až 96 GB alokovatelných GPU. Propustnost 256 GB/s je nejnižší z celé sestavy, takže husté modely nad 30B se plazí, MoE na tom běží slušně. A jedna věc, kterou AMD neříká nahlas: těch 50+ TOPS na XDNA 2 NPU se jazykových modelů netýká, protože Ollama, llama.cpp i LM Studio posílají LLM na GPU.

Xiaomi AI Cube do rozhodování nepatří, je to prototyp z 24. srpna, žádná cena, žádné datum, čipy O100 a D100 jdou do komerčního nasazení až v roce 2027. Architektura je zajímavá, demo ale běželo na konfiguraci 120B plus 3B. Benchmark celého systému nezveřejnil nikdo, stejně jako kvantizaci nebo software stack. Čtěte to jako signál směru čínského hardwaru, zatím nic víc.


Modely a kvantizace

Pravidlo palce: model v Q4 sežere zhruba 0,6 GB na miliardu parametrů, plus KV cache podle délky kontextu. Počítejte, že reálně máte k dispozici tak 70 % nominální paměti.

Rodina Qwen se otevřela 12. a 14. srpna. Qwen3.8-27B je dense, Apache 2.0, nativně multimodální, kontext 262K, v Q4_K_M kolem 17 GB. Vejde se do Mac mini s M5 Pro i do jakéhokoli Studia a je to dnes rozumný default.

Kolik ten model umí, se dá říct docela přesně. Na složeném indexu Artificial Analysis je Qwen3.8-27B na úrovni Claude Opus 5 s nízkým reasoningem a kousek pod Sonnetem 5 na plný výkon. Proti vlastnímu předchůdci 3.6-27B je to skok o čtrnáct bodů, přestože architektura je identická a celý rozdíl pochází z post-trainingu. Na agentních úlohách přeskočil i Claude Opus 4.8, což je model, který byl před čtyřmi měsíci frontier. A například já byl s Opus 4.8 spokojený velmi, takže za mne dobré, takhle bych to bral.

Než začnete kupovat víc paměti, zkontrolujte software. Za poslední půlrok se rychlost lokálních modelů posunula dvěma věcmi a obě jsou pro vás zadarmo. První je spekulativní dekódování, kdy malý model hádá několik tokenů dopředu a velký je jen ověřuje. Qwen3.6 a Gemma 4 už mají tu hádací hlavu zabudovanou v sobě, takže stačí ji v llama.cpp nebo v LM Studiu zapnout a běžně to znamená 1,5 až 3krát rychlejší generování. Druhou novinkou je MLX backend v Ollamě, který na Applu (ARM, ne Intel!) proti staré verzi zrychluje prefill zhruba 1,5krát a generování dvakrát až třikrát. Kdo na Macu jede na zastaralé Ollamě, přichází o víc výkonu, než by mu přinesl upgrade stroje.

A jedno tvrdé omezení. Nejlepší open-weight model dnes na žádný z těch strojů nevleze. Qwen3.8-2.4T-A95B potřebuje v Q4 kolem 1,4 TB paměti, takže na něj nestačí ani Mac Studio M5 Ultra s 512 GB za bezmála 539 tisíc korun. Lokálně hrajete v kategorii 27B až 120B, tečka!


Dvě věci, které na tezi o lokálních pracantech nesedí

Kolem lokálních strojů se ustálila představa, že lokální model je rychlý dělník a cloud (frontier model) dělá chytrého předáka. Jádro představy je správné. Dvě věci na tom ale nesedí.

Lokální model není rychlejší. Mac Studio M5 Max dá u modelu své třídy desítky tokenů za sekundu, cloudová inference na datacentrovém železe jede řádově rychleji, a to i u modelů o dva řády větších.

Takhle to ale vypadá jen na papíře. V amerických špičkách odezva frontier API znatelně klesá a uživatel to vnímá přesně tak, jak to vypadá: tokeny lezou pomalu. V těch chvílích může být lokální model subjektivně rychlejší než Opus, i když má desetinu propustnosti. Nestavěl bych na tom ale nákup, protože fronty a rate limity jsou věc, kterou vám poskytovatel může kdykoli zlepšit stejně rychle, jako je zhoršil. Kupujete hardware na tři roky, kdežto tohle se mění po týdnech.

Co je lokálně opravdu lepší: latence do prvního tokenu u rezidentního modelu, předvídatelnost bez rate limitů, nulová marginální cena a data, která nikam nejdou. To je pořád dobrý argument, jen stojí na dostupnosti a ceně.

Dělník musí být spolehlivý, a v tom jsou lokální modely nejslabší. Codersera po testech Qwen3.6-27B píše, že spolehlivost tool callů a drift na dlouhém kontextu z něj dělají model pro dohlíženou práci. Čím víc práce hodíte na lokálního dělníka, tím víc kontrolních kol musí odpracovat cloudový předák, a ta stojí cloudové tokeny. Lokální dělník se proto hodí na úlohy, kde jde výsledek ověřit strojově. Testy projdou nebo neprojdou. Na úlohy, kde je verifikace stejně drahá jako řešení, se nevyplatí.


Ekonomika

Uvažujeme o koupi hardware v nejhorší možný okamžik paměťového cenového cyklu. Paměti jsou prostě drahé. Pokles cen pamětí se čeká spíše v roce 2028, možná koncem 2027. Apple v červnu zdražil. Na druhou stranu: stroj koupený na vrcholu cyklu si podezřele dobře drží hodnotu, protože nástupce bude taky drahý. Velké pády se tu nečekají.

Propočet. Mac Studio M5 Max, základ 69 990 Kč, tříletý horizont (a to je velmi optimistické!). Elektřina při 100 W průměrné zátěže šest hodin denně a 10 W v klidu dělá 23 kWh měsíčně, tedy asi 117 Kč. Dohromady kolem 2 060 Kč měsíčně, při kurzu 21 Kč asi $98.

Modely téže třídy se v cloudu prodávají kolem 0,20 USD za milion vstupních a 0,77 USD za milion výstupních tokenů. Kolik tokenů ten stroj fyzicky stihne vyrobit? Při 50 tok/s a nepřetržitém běhu 4,3 milionu výstupních tokenů denně, což by v API stálo 3,3 USD denně neboli 100 USD měsíčně. Na samotném generování se stroj zaplatí jen tehdy, když jede naplno čtyřiadvacet hodin denně.

Se vstupními tokeny to vypadá líp. Modelový agentní požadavek 20 000 vstupních a 1 000 výstupních tokenů zabere při 2 000 tok/s prefill a 50 tok/s decode zhruba 30 sekund, tedy 2 880 požadavků denně, 57,6 M vstupních a 2,9 M výstupních tokenů. V API bez cache cca 400 USD měsíčně, se sedmdesátiprocentní úspěšností prompt cache kolem 200 USD.

Při stoprocentním vytížení je tedy stroj dvakrát až čtyřikrát levnější než API. Zlom je kolem 25 až 50 % vytížení, každý den. Pod tím vyhrává cloud. Pro jednoho člověka, který si u stroje sedí a povídá si s ním, je to prodělek. Smysl to dává v okamžiku, kdy tam pustíte dávkové pipeline, které jedou i v noci.

A připočtěte si položku, na kterou se zapomíná. Hybridní setup potřebuje cloudový lead model přes API klíč, protože předplatné Claude ho od dubna 2026 nepokrývá. Ten náklad jde na vrub lokálního řešení, protože bez něj byste zůstal na paušálu.

Splátky. Argument z x.com „kup ho na splátky místo předplatného Claude Code” zní logicky, dokud si nedopíšete čísla. Při 10 % p.a. a 36 měsících:


CenaSplátkaCelkemPřeplatek
Mac Studio M5 Max69 9902 258 Kč81 30211 312 Kč
Mac Studio M5 Ultra154 9905 001 Kč180 03925 049 Kč

Druhá řádka je zdrcující. Pět tisíc měsíčně po tři roky je víc než Claude Max 20x, a ten stroj s 96 GB stejně nerozjede nic, co by se Claudovi kvalitou blížilo. Splátka navíc mění variabilní náklad na fixní závazek u aktiva, které zastarává za dva roky. Předplatné zrušíte příští měsíc, úvěr ne.

Pro českého živnostníka ještě dvě věci k ověření s účetní: hardware nad 80 000 Kč se odepisuje jako dlouhodobý majetek, kdežto předplatné je okamžitý náklad. A jako neplátce DPH si těch 21 % nikde neodečtete, což u strojů v šestimístných cenách znamená třicet tisíc daně, kterou plátce zaplatí jen průtokem.


Závěrem: Co si z toho odnést?

Pokud chcete lokální stroj jako dělníka, sáhněte po nejlevnější variantě s dost pamětí a propustností pro model, který skutečně pustíte. To je dnes buď Strix Halo mini PC za 1 500 až 2 000 USD, pokud vám nevadí Linux a ROCm, nebo Mac mini s M5 Pro, pokud chcete, aby to prostě fungovalo a jelo tiše. Obojí utáhne Qwen3.8-27B v Q4 se zapnutým spekulativním dekódováním.

Mac Studio s M5 Max dává smysl u modelů 70B až 120B a při vytížení, které si obhájíte. Nebo tehdy, když NUTNĚ potřebujete lokální chod, například jste slíbili něčí data neposílat mimo EU / do cloudu.

Mac Studio s M5 Ultra si nekupujte jako inferenční box. Za 155 tisíc dostanete stroj, který pořád nerozjede nejlepší open weights.

DGX Spark kupte tehdy, když potřebujete CUDA na trénink a fine-tuning.

Xiaomi AI Cube sledujte, nekupujte.

A než cokoli objednáte, spočítejte si to vytížení. Pod čtvrtinou dne, každý den, je odpověď cloud.

Pokračování na příště: jak poskládat cloudového předáka s lokálním dělníkem, které nástroje to dnes umí a proč vás to může vyjít dráž, než čekáte.


Ceny a specifikace jsou k 26. srpnu 2026. Apple oznámil nové Macy 25. srpna, prodej začíná 22. září, konfigurace s 512 GB až koncem října. Benchmarková čísla pocházejí z Tom’s Hardware, měření Georgi Gerganova na llama.cpp, GPUSmith, SBCwiki a InsiderLLM. Cena 512GB Mac Studia jsou odhady, výrobci je nezveřejnili. Propočty ekonomiky vycházejí z uvedených předpokladů, přepočítejte si je vlastním vytížením.

Patrick Zandl

Lektor agentního vývoje a technologický publicista. Od roku 2025 provozuje Vibecoding.cz — česky psaný web o AI nástrojích pro vývojáře — a vede veřejné workshopy Claude Code v Praze; firemní AI workshopy vede na aivefirmach.cz.

Profil autora →