Vibecoding.cz Patrick Zandl o AI vývoji

$ entry

Kdo vydělá na tom, že si LLM spustíte doma

V poslední době se kolem lokálně provozovatelných LLM děje mnoho. Roste výkon a s tím i naděje, že nás zbaví předplatného uzavřených modelů. Jenže pod povrchem to vře. Proč by NVIDIA kupovala Hugging Face za 13 mld. USD, když jeho nejslavnější software llama.cpp rozbíhá AI i na hardwaru, který NVIDIA neprodává? Pojďme si tento svět představit.

Reklama
Obsah článku

Většina lidí, kteří dnes spouštějí jazykový model (LLM) na vlastním notebooku, jede pod kapotou na stejném softwaru, což si málokdo dnes uvědomuje. Ten software se jmenuje llama.cpp, napsal ho Georgi Gerganov a v březnu 2023 to byl večerní hack, který měl rozběhnout model Llama v čistém C a C++ bez závislostí, tedy i na stroji bez grafické karty.1 Z toho hacku vznikl formát GGUF, ze kterého se stal de facto způsob distribuce kvantovaných modelů, a inferenční engine, na němž dnes stojí Ollama, LM Studio, KoboldCpp a řada dalších desktopových nástrojů.

Ten software během letošního roku dvakrát změnil majitele. V únoru 2026 oznámil Hugging Face, že se k němu stěhuje tým kolem ggml.ai, tedy Gerganov a jeho lidé.2 Podmínky zněly dobře: projekt zůstane pod licencí MIT, tým dostane plný úvazek a technickou autonomii. A 3. září 2026 oznámil Jensen Huang, že NVIDIA kupuje celý Hugging Face za 12 930 300 000 dolarů.3 Z toho 11,9 miliardy dostanou akcionáři a další miliarda je v akciích určená na udržení zaměstnanců. Obchod má být uzavřen v první polovině roku 2027, takže zatím jde o dohodu, ne o hotovou věc.4

Ne každému je zřejmé, proč NVIDIA platí cca 13 mld dolarů za firmu, „z jejíhož webu si akorát stahujete otevřené modely“. To je totiž trestuhodné podcenění pozice, kterou si Hugging Face vybudovala.

Tak především. Lokální běh open-weight modelů na osobních počítačích dnes stojí na llama.cpp a formátu GGUF, a prochází jedním hlavním distribučním kanálem, Hugging Face Hubem. Že by se dalo stahovat odjinud? Možná. Tři sta nejstahovanějších GGUF repozitářů má na Hubu za posledních třicet dní kolem 83 milionů stažení, tedy zhruba trojnásobek proti formátu MLX pro Apple Silicon. Tomu se nedá snadno konkurovat.5 Za druhé: llama.cpp se pustil do byznysu svých uživatelů. Instalace jedním příkazem, katalog modelů, webové rozhraní, to všechno dřív nabízela Ollama, dnes to engine umí sám. A za třetí: tohle všechno teď kupuje NVIDIA, tedy firma, která vydělává na kartách, jež llama.cpp dokáže obejít. Cink cink. Faktická poznámka: obchod ještě nebyl uzavřen a dotažen.

Motor, který přestal být jenom motorem

Lokální AI se obvykle popisuje jako patra domu. V přízemí je engine, tedy program, který model skutečně počítá. V prvním patře aplikace, se kterou pracujete, třeba Ollama nebo LM Studio, a stará se o stahování modelů, jejich spouštění a chatovací okno, do kterého píšete. V nejvyšším patře pak placené služby, cloud a funkce pro firmy. Dříve mělo každé patro svého majitele a každý z nich si vydělával jinde. Jenže nájemníci se začali stěhovat: engine si postavil vlastní aplikaci a aplikace se přesouvají do cloudu. Trh se přeskupuje a na to všichni reagují.

llama.cpp už dávno není holé inferenční jádro. Jeho serverová komponenta llama-server má API kompatibilní s OpenAI a přináší vlastní vestavěné webové rozhraní.6 Model v něm navíc umí volat nástroje. Sám si řekne o vyhledání na webu nebo o spuštění kousku kódu, a zvládne jich použít i několik najednou.7 A v prosinci 2025 přibyl router mód, ve kterém llama-server dynamicky načítá, uvolňuje a přepíná modely bez restartu.8 To byly první velké posuny.

Do léta 2026 se projekt posunul ještě dále. Má vlastní spotřebitelský web llama.app, instalaci jedním řádkem v terminálu, sjednocené příkazy llama serve a llama cli a hlavně vlastní katalog modelů.9 K tomu integraci lokálního kódovacího agenta Pi, jehož propojovací plugin bydlí přímo v organizaci Hugging Face na GitHubu. Instalace jedním příkazem, katalog modelů, agent. To je přesně nabídka, se kterou před třemi lety přišla Ollama.

Engine se tak přibližuje uživatelům, zatímco aplikace postavené nad ním se posouvají směrem ke cloudu. Dobře je to vidět na Ollamě. Začínala jako pohodlný obal nad llama.cpp, dnes má vlastní katalog modelů, vlastní správu jejich spouštění a vlastní cloud. Model rozběhnete na notebooku jedním příkazem, a když vám přestane stačit, přepnete na větší model v cloudu Ollamy.10 Aplikace, která měla být lokální, se tak stává vstupní branou do cloudu.

Proč výrobce čipů kupuje katalog modelů

Tady se hodí projít si čísla, protože ta zpravidla vysvětlují motiv. Hugging Face má podle dostupných odhadů roční tržby kolem 150 milionů dolarů. NVIDIA vydělá zhruba 96 miliard za čtvrtletí. Kupovaná firma je tedy z pohledu kupujícího účetně zaokrouhlovací chyba. Kdyby šlo o tržby, nákup za 12,9 miliardy by nedával smysl. Dává ho jako investice do distribuce.

Jenže dává smysl jako investice do distribuce. Hugging Face je místo, kde „bydlí“ přes tři miliony repozitářů modelů, které používá osmnáct milionů vývojářů a dvě stě tisíc firem.3 Kdo chce dnes stáhnout otevřený model, jde tam. A NVIDIA má důvod hlídat si, aby ten ekosystém zůstal živý: velké uzavřené laboratoře jako OpenAI, Google, Amazon i Anthropic si stavějí vlastní čipy a snižují tím závislost na jejím hardwaru. Kvetoucí svět otevřených modelů dává zákazníkům alternativu k uzavřeným laboratořím, a tím otevírá trh kartám a čipům od NVIDIE.11

Huang v oznámení slibuje, že se nic nezmění. Hugging Face zůstane otevřenou platformou, vývojáři si budou vybírat modely, frameworky, cloudy i výpočetní platformy podle sebe. Doslova píše, že pro práci s Hugging Face nebude potřeba počítat na hardwaru od NVIDIE.3 To je pozoruhodný slib. Hlavně tím, že ho šéfa NVIDIA napadlo vyslovit. Proč garantovat věci, které přeci nikoho nenapadlo zpochybňovat?

Engine pro hardware, který kupující neprodává

A tady vnímám střet, protože llama.cpp se proslavil tím, že rozeběhne modely tam, kde grafická karta od NVIDIE není. Podporuje Apple Silicon pomocí Metalu, má backend pro AMD přes HIP, pro Intel přes SYCL, univerzální Vulkan a běží i na holém procesoru nebo na Raspberry Pi. Právě tahle nezávislost na železe je jeho hlavní hodnota.

Sám Gerganov reagoval veřejně a věcně. Píše, že inženýři NVIDIE do projektu aktivně přispívají už přes rok, spolupracují s komunitou a poskytli hardware na vývoj a testování. A dodává, že hardwarová nezávislost je jedním ze zakládajících principů projektu, takže vývoj a podpora všech backendů budou pokračovat jako dosud, řízená komunitou.12 Není to prázdná fráze, protože spolupráce je doložitelná. Letos v červnu Gerganov popisoval společnou práci maintainerů llama.cpp a inženýrů NVIDIE na tensor parallelismu, výsledkem čehož byly posuny na kartách RTX a základ pro hardwarově nezávislý paralelismus v ggml.

Únorový slib, že projekt zůstane open-source a zdarma, ovšem dal Hugging Face sám za sebe. Nový majitel ho zatím nezopakoval, protože formálně ještě žádný nový majitel není. Jestli NVIDIA po uzavření obchodu výslovně potvrdí governance llama.cpp a formátu GGUF, bude to pro lokální ekosystém dobrá zpráva. Jestli ta věta nikdy nezazní, bude to taky určitá odpověď…

Útěk z cloudu do lokálů

Slib lokální AI zní lákavě: spusťte si model doma a data neopustí váš stroj. Ollama tenhle argument používá jako klíč k regulovaným odvětvím, kde se data nesmějí posílat do cizího cloudu.10 Jenže tak easy to není.

Data zůstanou na stroji jen za určitých podmínek. Musí se skutečně použít lokální model, aplikace nesmí posílat telemetrii, RAG data nesmějí odtékat ven, externí nástroje a vyhledávání musejí být lokální. A hlavně: lokální běh závislost na platformě neodstraňuje, jen ji přesouvá jinam. Uživatel unikne poskytovateli API a zůstane záviset na katalogu modelů, na runtime, na CUDA, na konkrétní GGUF kvantizaci a na licenci modelu.

Asi vidíte, kam tím mířím. Katalog, engine i grafická karta totiž po uzavření obchodu patří jedné firmě. Útěk z cloudu vede k výrobci čipů, který vás ostatně nikdy nepustil ze své všeobjímací AI náruče.

Co si vlastně smíte spustit, když jste v Evropě

Pro českého čtenáře je důležité konstatování „open weight neznamená open source“. Licence modelů se liší a evropský uživatel si jich legálně spustí méně než americký. Acceptable Use Policy modelu Llama 4 výslovně nepřiznává práva k multimodálním modelům jednotlivci s bydlištěm v EU ani firmě se sídlem v EU.13 Totéž omezení platí pro vision modely Llamy 3.2. Textové modely projdou, multimodální ne. Meta oficiální důvod neuvedla, komentátoři ho spojují s nejistotou kolem evropské regulace, hlavně AI Actu a GDPR.

Debata o suverénní AI tím dostává konkrétní obrys. Evropská firma, která chce běžet lokálně a multimodálně, naráží na určitou licenční hranici nakreslenou kolem kontinentu. Katalog dostupných modelů se pro ni zužuje, ještě než dojde na technická omezení. A od příštího roku bude ten katalog provozovat americký výrobce čipů.

Otevřený kód, soustředěný vliv

Znamená to, že jedna jediná firma ovládne způsob, jakým spouštíme otevřené modely? Ne nutně, stále budou alternativní způsoby, s různou mírou použitelnosti, kvality a všeobecné známosti.

Není to zcela nová situace, protože před únorem 2026 byla koncentrace vlivu ještě vyšší. llama.cpp měl širokou základnu přispěvovatelů, ale rozhodovací autorita byla v posledku u Gerganova v roli BDFL. Únorový přesun koncetraci moci převedl od osoby k instituci. Hugging Face navíc nebyl v projektu nováčkem, klíčové přispěvatele llama.cpp měl v týmu už předtím.2 Naivní a místy prezentovaný obraz „korporace pohltila commons“ tím dostává trhlinu.

Projekt má dnes veřejně dokumentovaný třístupňový žebříček. Přispěvatelé otevírají pull requesty, spolupracovníci jsou zváni podle odvedené práce, maintaineři mohou mergovat, pracuje zde zhruba tři desítky maintainerů.1 Jsou mezi nimi lidé z Hugging Face, nezávislí vývojáři i Bartowski, jeden z nejznámějších komunitních kvantizérů. Vývojáři na Hacker News popisují režim, kde review přijde někdy za pět minut a pull request je slitý do hodiny, protože Gerganov deleguje a není „strážcem brány“.14 Rozhodovací pravomoc je rozprostřená mezi víc lidí než dřív.

Kód navíc zůstává pod licencí MIT, takže ho kdokoli může forknout. Jenže technická možnost forku a jeho reálná proveditelnost jsou dvě různé věci. Fork by musel držet krok s novými architekturami modelů, s formátem GGUF, s hardwarovými backendy a s celým tím rozrostlým ekosystémem serverů, API a webového UI. Potřeboval by lidi, kteří rozumí optimalizacím, přístup k předprodukčním modelům a testovací hardware. To není málo a rozhodně to není levné.

Rozpor je tedy podle mne někde jinde. Kód je forkovatelnější než kdy dřív, maintainerů přibývá, a přesto se rozhodování o tom, co je výchozí volba, sbíhá k jedné firmě. Otázka moci v open source zní „kdo rozhodne, že změna vstoupí do upstreamu“ a „čí modely a kvantizace budou výchozí“.

Koncentrace navíc nemá jen jedno centrum. Ollama provozuje vlastní modelový registr, druhé distribuční místo s vlastními defaulty a s pinnutou upravenou verzí llama.cpp. I tady někdo rozhoduje, problematika strážců brány je v IT stará, jak IT samo…

Startovací pole se míchá hned při startu…

Trh jsme si popsali ve chvíli, kdy do něj vstupují ještě samotné operační systémy a jejich výrobci. Apple na WWDC 2025 uvedl Foundation Models framework, který dává vývojářům přímý přístup k on-device modelu přes tři řádky Swiftu, bez API klíče, bez sítě a bez poplatku za tokeny.15 V červnu 2026 to posunul dál, AFM 3 přináší dvacetimiliardový on-device model a obrazový vstup.16 Microsoft jde stejným směrem přes Windows ML a runtime pro Copilot+ stroje. Jistěže, mít on-device LLM dává perfektní smysl.

Rozdíl je v tom, kdo model dodá. Dnes si ho uživatel stáhne jako GGUF a spustí přes Ollamu nebo llama.cpp. V modelu, který tlačí Apple a Microsoft, ho dodá rovnou operační systém jako své API. Jestli tenhle kanál převáží, všechno se změní, protože „běžní uživatelé“ budou prostě tyhle LLM používat tak, jak se naučili používat Internet Explorer a další dodávané nástroje. Souboj o katalog otevřených modelů by pak byl soubojem o zmenšující se část trhu.

Co z toho plyne

Odpověď na otázku z titulku vypadá po třetím září takhle: na lokálním běhu modelů vydělá ten, kdo vám prodal hardware. Software je zdarma. Engine je zdarma, runtime je zdarma, váhy jsou ke stažení, a přesto do té vrstvy někdo právě poslal třináct miliard dolarů. Ne proto, aby ji zpoplatnil, ale proto, aby zůstala otevřená a živá, protože otevřené modely drží zákazníky u jeho karet.

Je to v jistém smyslu dobrá zpráva. Nikdo nemá důvod stavět paywall před llama.cpp, protože peníze jsou spíše v železe. Zároveň to znamená, že nezávislost lokální AI teď závisí na obchodním zájmu jedné firmy. Dokud se ten zájem kryje se zájmem komunity, funguje to. Jakmile se rozejde, licence MIT zůstane, ale inkasní místo spolu s vrátnicí se přestěhuje.

Vedlejší, ale výmluvná je poslední linka. Nat Friedman a Daniel Gross, kteří rozjezd ggml.ai zaplatili, zmizeli v polovině roku 2025 uvnitř Mety, která odkoupila jejich fond a oba najala.17 Financiéři skončili v Big Techu, engine po dvou přesunech u výrobce grafických karet. Za tři roky se z večerního hacku na MacBooku stalo aktivum v miliardové transakci, a je to pořád tentýž kód pod toutéž licencí.

Co sledovat dál, je jednoduché říct. Jestli NVIDIA po uzavření obchodu zopakuje únorový slib o otevřenosti Huangovými ústy. Jestli commity na backendy pro AMD, Metal a procesory poběží dál stejným tempem. A jestli se do toho vloží regulátor, protože formální antimonopolní přezkum by ekosystému dal roky, ne měsíce, na stavbu alternativ.


Zdroje


Poznámka k metodice: podmínky akvizice vycházejí z oznámení NVIDIE a z podání regulátorovi popsaného v médiích. Obchod zatím není uzavřen, dokončení se očekává v první polovině roku 2027. Tržby Hugging Face a čtvrtletní tržby NVIDIE jsou odhady z odborných médií, ne auditovaná čísla. Tvrzení o produktovém povrchu llama.cpp a o licenčním omezení Llamy v EU jsou doložena primárními zdroji. Převaha formátu GGUF vychází z vlastního měření přes veřejné API Hugging Face Hubu. Údaje odpovídají stavu k 13. 9. 2026.

Footnotes

  1. Repozitář llama.cpp (první release březen 2023, licence MIT, dokumentovaný žebříček přispěvatel - spolupracovník - maintainer, soubor CODEOWNERS, seznam maintainerů). Stav k 13. 9. 2026: přes 123 tis. hvězd, 21,6 tis. forků, přes 10 300 commitů: https://github.com/ggml-org/llama.cpp 2

  2. Oznámení Hugging Face o začlenění týmu ggml a llama.cpp (20. 2. 2026; plný úvazek, technická autonomie, klíčoví přispěvatelé už dříve v týmu HF): https://huggingface.co/blog/ggml-joins-hf 2

  3. Jensen Huang, „NVIDIA to Acquire Hugging Face“ (blog NVIDIA, 3. 9. 2026) - cena 12 930 300 000 USD, 18 mil. vývojářů, 3 mil. modelů, 200 tis. firem, závazek otevřenosti a věta, že výpočet na hardwaru NVIDIA nebude pro práci s Hugging Face povinný: https://blogs.nvidia.com/blog/nvidia-to-acquire-hugging-face/ 2 3

  4. CNN Business (struktura obchodu: 11,9 mld. USD akcionářům a 1 mld. v akciích na udržení zaměstnanců, uzavření očekáváno v první polovině 2027 podle podání regulátorovi): https://www.cnn.com/2026/09/03/tech/nvidia-hugging-face-ai-acquisition

  5. Vlastní měření přes veřejné API Hugging Face Hubu, 13. 9. 2026. Součet třicetidenních stažení tří set nejstahovanějších repozitářů podle formátu: GGUF přibližně 83 mil., MLX přibližně 27 mil. Kvantizační účty za 30 dní: unsloth přibližně 35 mil., bartowski přibližně 5,7 mil. Jde o horní část distribuce, ne o součet všech repozitářů. MLX cílí jen na Apple Silicon a čísla mohou zahrnovat automatizované buildy.

  6. Dokumentace Open WebUI o llama.cpp (llama-server má vestavěné webové rozhraní a OpenAI-kompatibilní API): https://docs.openwebui.com/alternatives/llama-cpp/

  7. Dokumentace llama.cpp, function calling: https://github.com/ggml-org/llama.cpp/blob/master/docs/function-calling.md

  8. Dokumentace llama.cpp, server README (router mód): https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md

  9. Oficiální web projektu llama.app (instalace jedním příkazem, katalog modelů, integrace agenta Pi). Stav k 13. 9. 2026: https://llama.app

  10. Oznámení o Series B Ollamy (88 mil. USD celkem, 8,9 mil. vývojářů, lokální běh se škálováním do cloudu). Business Wire přes Las Vegas Sun: https://lasvegassun.com/news/2026/jul/09/ollama-raises-65m-series-b-funding-to-grow-its-ope/ 2

  11. TechCrunch (motivace NVIDIE: ochrana pozice v čipech, návrat do cloudu, kontext uzavřených laboratoří stavějících vlastní křemík): https://techcrunch.com/2026/08/26/nvidia-closes-in-on-hugging-face-acquisition/

  12. Georgi Gerganov na síti X (reakce na akvizici: NVIDIA přispívá do projektu přes rok, poskytla hardware na testování, hardwarová nezávislost zůstává zakládajícím principem, podpora všech backendů pokračuje řízená komunitou): https://x.com/ggerganov/status/2095897173376618881

  13. Llama 4 Acceptable Use Policy (multimodální modely nejsou licencovány subjektům se sídlem v EU): https://www.llama.com/llama4/use-policy/

  14. Diskuse na Hacker News k budoucnosti llama.cpp po akvizici (popis rychlosti review a delegování pravomocí): https://news.ycombinator.com/item?id=49567357

  15. Apple, Foundation Models framework (WWDC 2025, on-device model přes Swift API). Apple Machine Learning Research: https://machinelearning.apple.com/research/introducing-apple-foundation-models

  16. Apple AFM 3 (WWDC 8. 6. 2026, 20B on-device model s obrazovým vstupem). 9to5Mac: https://9to5mac.com/2026/06/11/apples-new-foundation-models-explained-on-device-ai-cloud-ai-and-everything-in-between/

  17. Meta najímá Nata Friedmana a Daniela Grosse a odkupuje jejich fond NFDG (polovina 2025). PYMNTS: https://www.pymnts.com/artificial-intelligence-2/2025/report-meta-aims-to-hire-ai-investors-nat-friedman-and-daniel-gross/

Patrick Zandl

Lektor agentního vývoje a technologický publicista. Od roku 2025 provozuje Vibecoding.cz — česky psaný web o AI nástrojích pro vývojáře — a vede veřejné workshopy Claude Code v Praze; firemní AI workshopy vede na aivefirmach.cz.

Profil autora →