Model, který se naučil míň přemýšlet. ThinkingCap ubírá Qwenu 37 procent thinking tokenů a přesnost drží
BottleCap AI vydal ThinkingCap-Qwen3.8-27B, doladěnou verzi Qwenu, která zkracuje uvažování o 30 až 65 procent při ztrátě přesnosti necelý procentní bod. Dlouhý kontext se dokonce zlepšil. Je to zajímavý pohled na to, za co u reasoning modelů vlastně platíme, jen ta úspora není rozložená tak, jak byste čekali.
U reasoning modelů platíme za dvě věci. Za odpověď a za přemýšlení, které k ní vedlo. A to druhé bývá násobně dražší, přestože ho uživatel většinou nikdy neuvidí.
BottleCap AI vydal ThinkingCap-Qwen3.8-27B, druhý díl své série, která se na tenhle problém dívá z neobvyklé strany. Místo aby model nutila přemýšlet míň přes nějaký přepínač, doladí ho tak, aby přemýšlel kratčeji sám od sebe.

Co to umí
Čísla, která firma publikovala:
- o 30 až 65 procent kratší uvažování, v průměru 37,2 procenta
- přesnost 86,75 procenta proti 87,63 u základního modelu, tedy ztráta necelý procentní bod
- vyhledávání v dlouhém kontextu se dokonce zlepšilo o 2,3 procentního bodu
To poslední je nejzajímavější. Naznačuje to, že část toho uvažování modelu spíš překáží, než aby pomáhala. U předchozí verze postavené na Qwenu 3.6 to autoři popisovali tak, že model neořezává přemýšlení jako celek, ale vyhazuje kroky, které k odpovědi reálně nepřispívají.
Pár konkrétních dvojic, základní model proti doladěnému:
- GPQA Diamond: 12 772 tokenů na 7 267, tedy o 43 procent méně, přesnost z 89,93 na 88,04
- MMLU Pro: 3 725 na 1 591, tedy o 57 procent méně, přesnost z 85,54 na 84,67
- MMMLU: 1,7 tisíce na 571 tokenů
- AIME 2026: 15,7 tisíce na 10,9 tisíce
Model je natrénovaný na nejvyšší úrovni uvažování a je venku na Hugging Face i jako GGUF, takže si ho můžete spustit u sebe.
Kde ta úspora ve skutečnosti je
Tady stojí za to se na ta čísla podívat pozorněji, protože release se prezentuje jako optimalizovaný pro agentní použití, ale právě u agentních benchmarků je relativní úspora nejmenší:
- MMMLU: o 66 procent méně tokenů
- MMLU Pro: o 57 procent
- τ²-bench: o 30 procent
- Terminal-Bench 2.1: o 11 procent, ze 72,9 tisíce na 65,1 tisíce
Čím delší a složitější úloha, tím menší podíl se ušetří. Dává to smysl, protože u opravdu těžké práce je to uvažování z větší části potřeba.
Férově ale dodejme druhou stranu: v absolutních číslech je to přesně naopak. Na Terminal-Benchi ušetříte skoro osm tisíc tokenů na úlohu, zatímco na MMLU Pro jen dva. Takže pokud provozujete agenta, který běží dlouho, pořád je to ta větší úspora v korunách, jen vypadá v procentech hůř.
Co na to říkají nezávislé testy
Předchozí verzi na Qwenu 3.6 si někdo přeměřil sám, protože těm číslům nevěřil. Úspora tokenů mu vyšla skoro přesně, kolem 44 procent proti deklarovaným 45,8. Při kvantizaci na čtyři bity dokonce doladěný model základní verzi porazil.
Zároveň ale narazil na dvě věci, které je dobré znát:
- U volání nástrojů to bylo nekonzistentní a v jednom testu s více nástroji spotřeboval doladěný model dokonce víc tokenů než základní
- Na nejtěžších úlohách přesnost znatelně klesá, GPQA Diamond z 85,5 na 83,8 a HMMT z 88,0 na 84,7
To není důvod to zavrhnout. Je to důvod si to přeměřit na své vlastní úloze, než to pustíte do produkce.
Nepotřebuje to dneska vůbec nikdo?
Tohle je otázka, která se kolem toho vede, a je legitimní. Qwen 3.8 má totiž vlastní parametr reasoning_effort s úrovněmi low, medium a xhigh. Když se dá snížit přemýšlení jedním nastavením, proč ladit celý model?
Argument autorů i komunity je v tom, že snížení úrovně udělá model hloupějším napříč vším, zatímco doladění se snaží ubrat jen to zbytečné a kvalitu podržet. Uživatelé k tomu dodávají, že Qwen 3.8 i na nejnižším nastavení pořád přemýšlí hodně.
Je to přesně ten kompromis, který dnes řeší všichni. Claude Opus 5.5 má taky jen parametr effort, u kterého Anthropic sám doporučuje si to přeměřit, protože model při stejném nastavení přemýšlí víc než předchůdce. Rozdíl je v tom, že u zavřeného modelu vám zbývá ten přepínač, kdežto u open weights si můžete sáhnout na váhy.
Mimochodem, BottleCap v tom není sám. Konkurenční Swift od UkisAI hlásí u stejného Qwenu úsporu 58,3 procenta a část své efektivity přebírá právě z ThinkingCapu. Z jednoho nápadu se stává kategorie.
Co si z toho vzít
- Tokeny za přemýšlení jsou reálná nákladová položka, kterou většina lidí neměří. Když se díváte jen na cenu za milion tokenů a ne na to, kolik jich model na jednu úlohu spotřebuje, nevidíte polovinu faktury. Psali jsme o tom u cost-per-task.
- U open weights máte páku, kterou u API nemáte. Tohle je konkrétní důvod, proč stojí za to mít otevřený model ve hře, i když zavřený skóruje výš. Model si můžete přizpůsobit svému provozu, ne jen vybrat z nabídky. Stejná logika jako u Muse Glimmer na jedné GPU.
- Kratší uvažování někdy znamená lepší výsledek, ne horší. To zlepšení o 2,3 bodu na dlouhém kontextu je malý, ale hezký důkaz, že delší přemýšlení není automaticky kvalitnější. Je to stejný směr, jakým jde Jev od TypeSafe, jen z druhé strany.
- Ale změřte si to na svém. Deklarovaná čísla platí na benchmarcích. Ten nezávislý test ukázal, že u volání nástrojů se to může otočit, a to je přesně scénář, ve kterém většina z nás modely provozuje.
Celý obor teď řeší, jak z modelů dostat stejnou práci za méně peněz. Tenhle přístup je na tom sympatický tím, že neubírá schopnosti, jen upovídanost. A ta se u reasoning modelů platí od slova. 🧢
Kurátorsky, na základě veřejných zdrojů a kontextu našeho stacku. Pokud najdeš nepřesnost nebo chceš k tématu reagovat, napiš nám a rádi to opravíme.
Související
Máte nápad?
Vytvořme ho spolu.
Napište nám pár vět o tom, co chcete postavit či vytvořit. Do dvou pracovních dnů se ozveme s první bezplatnou konzultací.
