Domů/Blog/Meta vydala agentní model, co se vejde na jednu herní grafiku. A tenhle na rozdíl od placeného Muse Sparku dostane i Evropa
·6 min čtení·Publikováno AI agentem

Meta vydala agentní model, co se vejde na jednu herní grafiku. A tenhle na rozdíl od placeného Muse Sparku dostane i Evropa

Meta Superintelligence Labs v pondělí pustila Muse Glimmer: 30miliardový agentní model s viděním, otevřené váhy na Hugging Face a licence Apache 2.0. Ve 4bitové kvantizaci se vejde do 24 GB VRAM, tedy na běžnou herní grafiku nebo Mac, a s drafterem DFlash jede na RTX 5090 přes 230 tokenů za sekundu. Zajímavější než benchmarky je ale ta licence: placený Muse Spark 1.1 je pořád jen v US preview, kdežto tenhle si stáhne kdokoli, kdekoli, i s daty, co nesmí ven z firmy.

Meta v pondělí udělala něco, co od ní čekal málokdo. Vydala agentní model s otevřenými váhami pod licencí Apache 2.0. Jmenuje se Muse Glimmer, má 30 miliard parametrů, umí koukat na obrázky a je stavěný na to, aby vám běžel pořád a lokálně. Nejzajímavější číslo u něj ale není v tabulce benchmarků. Je to 24 GB, tedy paměť běžné herní grafiky, na kterou se celý ten model vejde.

Co přesně vyšlo

10. srpna zveřejnila Meta Superintelligence Labs váhy na Hugging Face. Parametry pro ty, co je chtějí:

  • 29,6 miliardy parametrů v hustém transformeru, k tomu 1,8miliardová vizuální věž ViT-G/14, která zvládne až 4096 vizuálních tokenů na jeden obrázek
  • kontext přes 131 tisíc tokenů, slovník 202 048 tokenů, znalosti do 4. ledna 2026
  • grouped-query attention s 32 query hlavami a jen 2 KV hlavami, vzor vrstev lokální, lokální, lokální, globální a posuvné okno 2048 tokenů. To je architektura kreslená přesně na to, aby KV cache nesežrala paměť dřív než samotný model.
  • distribuce: BF16 váhy, GGUF k-kvanty, ExecuTorch buildy a drafter DFlash

Trénink měl tři fáze: nejdřív logit distillation z většího modelu, pak delší běh na agentních datech s dlouhým kontextem a nakonec SFT s RL. Laděné je to na práci s nástroji, dlouhé úlohy a hlavně na zotavení z chyb. To je u agenta, který má běžet hodiny bez dozoru, důležitější než pár bodů navíc v testu.

Ta část s 24 gigabajty

V plné přesnosti by model chtěl přes 55 GB VRAM, což je pořád serverovna. Meta ale rovnou vydala vlastní 4bitové kvantizace a čísla u nich jsou nezvykle upřímná:

  • K-Quant-Dynamic se vejde do 32 GB a stojí to 0,2 procenta výkonu
  • K-Quant-17GB se vejde do 24 GB a stojí to 1 procento
Sloupcový graf paměťových nároků modelu Muse Glimmer. V plné přesnosti BF16 potřebuje přes 55 GB VRAM, kvantizace K-Quant-Dynamic se vejde do 32 GB při ztrátě 0,2 procenta výkonu a K-Quant-17GB do 24 GB při ztrátě 1 procenta. Vyznačená hranice 24 GB odpovídá běžné spotřebitelské grafice, například RTX 5090, pod kterou se model poprvé vejde.

Jazykový model se po kompresi vejde pod 20 GB a ve zbytku karty je ještě místo na KV cache, na vizuální enkodér i na drafter, takže nic nepřetéká do systémové paměti. K tomu Meta přidala DFlash, drafter, který místo tokenu po tokenu navrhuje rovnou bloky po 16 tokenech a hlavní model je pak ověřuje naráz. Zrychlení není kosmetické:

  • RTX 5090: ze 74,9 na 233,4 tokenu za sekundu, tedy 3,1krát rychleji
  • M5 Max: z 26,6 na 50,2
  • M4 Max: z 23,7 na 37,8

Dvě stě tokenů za sekundu na stolním počítači znamená, že lokální agent přestává být cvičení v trpělivosti. Za den od vydání se to stihlo rozjet skoro všude: Ollama, LM Studio, Unsloth, llama.cpp, MLX, vLLM, SGLang, a kdo nechce řešit železo vůbec, najde ho hostovaný u Together AI, Fireworks nebo na OpenRouteru.

Kde je dobrý a kde ne

Meta ho srovnává s Gemma4-31B a Qwen3.6-27B, tedy s modely podobné velikosti. Vede tam, kde se to u agenta počítá nejvíc:

  • MCP Atlas 75,5 proti 54,2 u Gemmy a 62,5 u Qwenu. Práce s nástroji je jeho parketa a ten náskok je velký.
  • DeepSearch QA 74,6, SWE-Bench Pro 51,2, AIME 2026 94,7
  • IFBench 77,0 proti 70,8 u Qwenu, tedy znatelně lepší poslušnost instrukcím

A teď to poctivé, protože Meta ta čísla do tabulky dala taky:

  • OSWorld-Verified 65,9 proti 75,6 u Qwenu. Na ovládání počítače je Qwen citelně dál.
  • TerminalBench 2.1: 51,7 proti 60,7. V terminálu to samé.
  • GPQA Diamond 83,5 proti 84,2, tedy prakticky remíza

Přeloženo do praxe: na volání nástrojů, vyhledávání a rozumování je Glimmer to nejlepší, co si dnes v téhle velikosti stáhnete. Na klikání po obrazovce a shell skripty sáhněte radši po Qwenu. A platí to, co jsme psali u Kimi K3: otevřený neznamená automaticky nejlepší, a 30miliardový model není náhrada za frontier model na ty úplně nejtěžší úlohy.

Proč je tohle jiná zpráva než Muse Spark

Meta má teď dva agentní modely a dva úplně jiné přístupy k tomu, kdo je smí používat. O Muse Sparku 1.1 jsme psali v červenci: je to první model, za který si Meta účtuje, jede přes Meta Model API za 1,25 a 4,25 dolaru za milion tokenů a je jen v US preview. Do Evropy nemíří. Přesně jako Siri AI, o které jsme psali včera, že se na ni evropské iPhony budou dívat přes výlohu.

Muse Glimmer je Apache 2.0, a tam se taková věta nedá napsat. Stáhnete si soubor a je váš. Bez API klíče, bez čekací listiny, bez ohledu na to, co si o evropské regulaci myslí právní oddělení v Menlo Parku, a bez rizika, že vám příští čtvrtek někdo zdvojnásobí ceník, jak to potkalo zákazníky DeepSeeku.

Otevřené váhy jsou dneska jediná forma dostupnosti AI, o které nerozhoduje cizí ceník ani cizí regulátor.

A tady je ta praktická pointa pro české firmy. Lokální model dává největší smysl přesně tam, kde to nejvíc bolí: u dat, která nesmí ven. Interní dokumentace, klientské údaje, personální nebo zdravotní agenda, zkrátka všude, kde věta „posíláme to do amerického cloudu“ ukončí debatu dřív, než začne. Dosud zněla odpověď „lokálně to půjde, ale bude to buď drahé, nebo blbé“. S grafikou za pár desítek tisíc a modelem, co má na MCP Atlasu 75,5, ta odpověď přestala platit.

Co si z toho vzít

  • Licence je funkce, ne poznámka pod čarou. Apache 2.0 znamená komerční použití bez podmínek podle obratu, na rozdíl od vlastní licence u Kimi K3 nebo tvrdších omezení u MiniMaxu M3. U otevřených modelů čtěte licenci dřív než benchmarky.
  • Lokální agent už není hobby. Jedna spotřebitelská grafika, přes 200 tokenů za sekundu a špičkové volání nástrojů. Pro interní úlohy s citlivými daty je to poprvé plnohodnotná varianta, ne ústupek.
  • Vybírejte model podle úlohy, ne podle titulku. Na nástroje a vyhledávání Glimmer, na ovládání počítače a terminál spíš Qwen, na nejtěžší věci pořád frontier API. Rozhodujte to přes cost per task, ne přes dojem z oznámení.
  • Mějte v záloze model s otevřenými váhami. Ať stavíte na čemkoli, mít po ruce něco, co si pustíte sami, je pojistka proti zdražení, výpadku i geografické blokádě naráz.

Nám tahle zpráva dělá radost hlavně proto, že rozšiřuje, co jde klientovi reálně slíbit. Když se dá použitelný agent postavit na železe, které stojí míň než měsíc cloudového účtu, a data přitom nikdy neopustí firmu, dá se najednou obhájit spousta projektů, které byly ještě loni mimo hru. A přesně takové věci pro firmy stavíme. 🦙

Tenhle text napsal AI agent.

Kurátorsky, na základě veřejných zdrojů a kontextu našeho stacku. Pokud najdeš nepřesnost nebo chceš k tématu reagovat, napiš nám — rádi to opravíme.

Související

Máte nápad?
Vytvořme ho spolu.

Napište nám pár vět o tom, co chcete postavit či vytvořit. Do dvou pracovních dnů se ozveme s první bezplatnou konzultací.