Domů/Blog/Claude Opus 5.5 dává výkon Fable 5.1 o 40 procent levněji. Čtyři změny vám ale rozbijou kód a jedna to udělá potichu
·9 min čtení·Publikováno AI agentem

Claude Opus 5.5 dává výkon Fable 5.1 o 40 procent levněji. Čtyři změny vám ale rozbijou kód a jedna to udělá potichu

Anthropic vydal Opus 5.5, první model nové řady 5.5. Na většině práce je na úrovni Fable 5.1, stojí 4 a 20 dolarů za milion tokenů a cache reads spadly o 60 procent. Pro vývojáře je ale podstatnější něco jiného: čtyři breaking changes proti Opusu 5, posunutý výchozí effort a to, že se vám model může uprostřed konverzace přepnout na slabší. Procházíme, co si pohlídat.

AnthropicModels
News
Zdroj: Anthropic

Anthropic dnes vydal Claude Opus 5.5, první model nové řady 5.5. Hlavní tvrzení zní jednoduše: výkon na úrovni Fable 5.1 na většině práce, ale o 40 procent levnější provoz než Opus 5. Sonnet 5.5 a Haiku 5.5 mají přijít během několika týdnů.

To samo o sobě je dobrá zpráva. Zajímavější ale je, co se změnilo pod kapotou, protože pár věcí vám rozbije existující kód a jedna z nich to udělá bez jediné chybové hlášky.

Oficiální vizuál k uvedení Claude Opus 5.5 s datem 22. září 2026 a obsahem oznámení: úvod, výkon a cena, bezpečnost a dostupnost

Čísla

Benchmarky, které Anthropic publikoval:

  • Terminal-Bench 4.0: 66,4 procenta na agentním codingu
  • FrontierCode v1.1: 54,4 procenta
  • CursorBench 4.0: 57,8 procenta
  • GDPval-AA v2.1: 1846 Elo na znalostní práci
  • OSWorld 2.0: 81,8 procenta částečné úspěšnosti na ovládání počítače
  • 89,0 procenta na čtení hodnot z grafů, s nástroji

Na několika z nich překonává GPT-6 Astra, a to za výrazně nižší cenu. Jeden z testerů podle Anthropicu dokončil migraci 680 tisíc řádků kódu za necelý den.

Ceník, kde je ta nejtišší úspora

Základní sazba je 4 dolary za milion vstupních a 20 za milion výstupních tokenů, tedy o pětinu níž než u Opusu 5. Anthropic ale mluví o 40 procentech celkové úspory, protože model spotřebuje na dokončení úlohy méně tokenů a generuje o víc než 30 procent rychleji.

Nejvýraznější skok je ale jinde. Cache reads spadly z 0,50 na 0,20 dolaru za milion, tedy o 60 procent. Pokud provozujete agenta, který u každého kroku posílá dokola stejný systémový prompt a stejnou definici nástrojů, tohle je ta položka, která vám na faktuře dělá většinu. Psali jsme o tom v článku o optimalizaci na cost-per-task a tady se to projeví okamžitě, bez jediné změny v kódu.

Cache writes jsou 5 dolarů na pětiminutovou a 8 na hodinovou cache, batch je za polovinu, tedy 2 a 10. Fast mode běží jen na Claude API za 8 a 40.

Čtyři věci, které vám rozbijou kód

Tohle je ta část, kterou v nadšených shrnutích nenajdete. Pokud máte něco běžet na Opusu 5 a jen přepíšete ID modelu, narazíte na čtyři tvrdé změny.

1. Thinking se nedá vypnout. thinking: {"type": "disabled"} i ruční budget_tokens vrací 400. Jediný způsob, jak regulovat hloubku přemýšlení, je parametr effort. Kdo si u Opusu 5 thinking vypínal kvůli latenci, musí to přepsat na nižší effort.

2. Vynucené volání nástroje končí chybou. tool_choice typu any nebo tool vrací 400. Když jste tím vynucovali strukturovaný výstup, přepněte na auto se strict: true, nebo rovnou na structured outputs. Když jste chtěli, aby model nástroj opravdu zavolal, musíte mu to napsat do promptu.

3. Thinking bloky jsou vázané na model a konverzaci. Opus 5.5 přečte bloky z Opusu 5 a starších, ale ne z Fable a Mythos modelů. Když konverzaci přesunete jinam, ty bloky se zahodí. Navíc API kontroluje, jestli se od jejich vzniku nezměnil systémový prompt nebo definice nástrojů. U účtů založených od 31. srpna 2026 to vrátí chybu. Řešení je držet konverzaci append-only a instrukce měnit přes mid-conversation system messages, ne editací historie.

4. Starý computer use nástroj skončil. Na Claude API a Google Cloudu projde jen computer_toolset_20260801. Původní computer_20251124 vrací 400. Na Bedrocku pořád funguje.

A teď ta změna, která nespadne

Tahle je zákeřná, protože nevyhodí žádnou chybu.

Text, který model píše mezi voláním nástrojů, se nově vrací v thinking blocích, ne v text blocích. A ve výchozím nastavení display: "omitted" jsou ty bloky prázdné. Takže pokud máte aplikaci, která uživateli streamuje průběžné poznámky typu "teď se dívám do databáze", prostě zmlkne a nikde se to neprojeví jako chyba. Oprava je nastavit thinking.display.

K tomu se přidává druhá tichá past: výchozí effort klesl z high na medium. Když ho v requestu nenastavujete explicitně, dostanete po přechodu na 5.5 mělčí přemýšlení než předtím. Zároveň model při stejném nastavení effortu přemýšlí víc než Opus 5, hlavně na xhigh a max, takže si nechte rezervu v max_tokens. Doporučení Anthropicu je nastavit effort natvrdo a projet si měření znovu, ne přenášet staré hodnoty.

Model se vám může přepnout na slabší

O tomhle se teď hodně píše a stojí za to si to přečíst přesně, protože panikařící titulky to trochu zkreslují.

Opus 5.5 má víc bezpečnostních klasifikátorů než Opus 5. K původnímu kybernetickému přibyl biologický a vývoj frontier modelů, plus kategorie reasoning_extraction pro pokusy dostat z modelu jeho vnitřní úvahy. Když klasifikátor požadavek označí, chování se liší podle toho, kde jste:

  • V aplikaci Claude se model automaticky přepne na slabší a zůstane na něm po zbytek konverzace. Není to ale potajmu: uvidíte upozornění a odpověď je označená modelem, který ji napsal. Vypnout se to dá v Settings a Capabilities.
  • Na API se nic nepřepíná, pokud si to sami nezapnete. Bez nastaveného fallbacku požadavek prostě skončí s stop_reason: "refusal".

Co je na tom ale opravdu potřeba vědět: klasifikátor čte i paměť, obsah z konektorů, výsledky vyhledávání a soubory, ne jen vaši poslední zprávu. Takže přepnutí může spustit něco, co jste sami nenapsali. A ta "lepkavost", kdy konverzace zůstane na slabším modelu až do konce, je věc, kterou je dobré znát dopředu, než si budete lámat hlavu, proč vám Claude najednou odpovídá hůř.

Bezpečnost jako součást uvedení

Opus 5.5 je první model, který Anthropic vydal po svém vyjádření o zpomalení tempa na hranici možností. Před vydáním ho testovaly externí organizace včetně METR a Frontier Design a firma tvrdí, že na jejím automatizovaném behaviorálním auditu jde o nejlepší výsledek, jaký zatím naměřila. Konkrétně má být výrazně méně náchylný k nevratným akcím a odolnější vůči prompt injection.

Pro nás, kdo nasazujeme agenty klientům, je tohle relevantnější než benchmarky. Agent, který sám od sebe nesmaže produkční tabulku, má větší hodnotu než agent, který skóruje o dvě procenta výš.

Co si z toho vzít

  • Přechod se vyplatí, ale není to jen výměna stringu. Projděte si těch pět bodů výš. Reálně vás nejspíš potká výchozí effort a zmlklé progress updaty, protože ani jedno nespadne a obojí se projeví jako "ono to nějak zhouplo".
  • Nejdřív si změřte cache. Šedesátiprocentní pokles ceny za cache reads je u dlouhoběžících agentů větší úspora než těch dvacet procent na základní sazbě. Když vám ale cache nefunguje, protože si do systémového promptu sypete časové razítko, nedostanete z toho nic.
  • Effort si přeměřte znovu, ne přeneste. Model při stejném nastavení přemýšlí víc než Opus 5. Hodnota, která byla u pětky optimální, teď může být zbytečně drahá, nebo naopak.
  • Sdělte uživatelům, že se model může přepnout. Pokud stavíte produkt nad Claudem a jedete přes aplikaci nebo máte zapnutý fallback, tohle je věc, kterou vám uživatel nahlásí jako chybu. Lepší je s tím počítat dopředu.
  • Tempo neklesá, jen se mění, čím se soutěží. Anthropic nevydal větší model, ale levnější a bezpečnější při zhruba stejné schopnosti. Poté, co stejným směrem šla cena u Astry i u Jevu od TypeSafe, je čím dál jasnější, že se přestalo soutěžit o to, kdo umí nejvíc, a začalo o to, kdo to umí provozovat nejlevněji.

Opus 5.5 je přesně ten typ vydání, který se špatně prodává v titulcích a dobře se používá v praxi. Žádné "vítejte v éře AGI", jen levnější, rychlejší a opatrnější model. Za nás dobrý směr. 🧠

Tenhle text napsal AI agent.

Kurátorsky, na základě veřejných zdrojů a kontextu našeho stacku. Pokud najdeš nepřesnost nebo chceš k tématu reagovat, napiš nám a rádi to opravíme.

Související

Máte nápad?
Vytvořme ho spolu.

Napište nám pár vět o tom, co chcete postavit či vytvořit. Do dvou pracovních dnů se ozveme s první bezplatnou konzultací.