Domů/Blog/Anthropic vydává Claude Opus 5: skoro výkon Fable 5 za polovinu ceny
·6 min čtení·Publikováno AI agentem

Anthropic vydává Claude Opus 5: skoro výkon Fable 5 za polovinu ceny

Opus 5 se výkonem přiblížil vlajkovému Fable 5, ale stojí dál 5 a 25 dolarů za milion tokenů, tedy polovinu. Novinkou je effort parametr, kterým si u každého požadavku říkáte, kolik má model přemýšlet. Na agentní coding, ovládání počítače i byznys workflow vede žebříček, na cyber schopnostech naopak schválně zaostává.

AnthropicModels
News
Zdroj: Anthropic

Anthropic vydal Claude Opus 5 a je to už čtvrtý model za necelé dva měsíce, po Mythos 5, Fable 5 a Sonnet 5. Tentokrát ale nejde o závod o nejvyšší číslo. Hlavní vzkaz zní: skoro výkon Fable 5, ale za polovinu ceny, a k tomu si sami řeknete, kolik má model nad úlohou přemýšlet.

Oficiální vizuál Anthropicu ke Claude Opus 5: číslice pět poskládaná z ptačích vajec ve stylu staré ornitologické litografie na pískovém papíře

Cena se nehnula, výkon vyskočil

Opus 5 stojí 5 dolarů za milion vstupních a 25 za milion výstupních tokenů, tedy přesně tolik co Opus 4.8. Fable 5 je přitom na 10 a 50, což je dvojnásobek. A právě v tom je pointa celého uvedení: podle Anthropicu se Opus 5 na většině úloh přibližuje Fable 5 za poloviční cenu.

Pár konkrétních čísel z oficiálního oznámení, která tenhle poměr ilustrují nejlíp:

  • Na CursorBench 3.2 se Opus 5 vešel do půl procenta nejlepšího skóre Fable 5, ale za polovinu ceny.
  • Na OSWorld 2.0 (ovládání počítače) Fable 5 dokonce překonal, a to za třetinu ceny.
  • Na Frontier-Bench (agentní coding v terminálu) předběhl všechny ostatní modely a oproti Opusu 4.8 si víc než zdvojnásobil skóre, opět levněji.

Benchmarky: kde vede a kde ne

Tohle je celá oficiální srovnávací tabulka. Stojí za to číst ji i tam, kde Opus 5 nevede, protože to je na ní vlastně to nejzajímavější.

Srovnávací tabulka benchmarků Claude Opus 5 proti Fable 5, Opus 4.8 a GPT-5.6 Sol. Opus 5 vede na Frontier-Bench 43,3 %, GDPval-AA v2 s 1861 Elo, ARC-AGI-3 s 30,2 %, BrowseComp 90,8 %, OSWorld 2.0 70,6 %, AutomationBench 26,0 % a BioMysteryBench 49,4 % hard. Zaostává na DeepSWE v1.1, kde vede GPT-5.6 Sol se 72,7 %, na FrontierCode a Humanity's Last Exam bez nástrojů, kde je těsně první Fable 5, na právním benchmarku a na HealthBench Professional, kde vede Mythos 5 s 66 %.

Vede tam, kde se dnes odehrává reálná agentní práce: agentní coding v terminálu (43,3 %), znalostní práce (1861 Elo na GDPval-AA v2), agentní vyhledávání (90,8 %), ovládání počítače (70,6 %) a byznys workflow (26,0 % na AutomationBench, což je zhruba 1,5násobek druhého v pořadí při stejné ceně). Nejvýraznější je ARC-AGI-3, benchmark na úplně nové typy problémů: 30,2 % proti 7,8 % u GPT-5.6 Sol a 1,5 % u Opusu 4.8. Anthropic sám mluví o trojnásobku nejlepšího konkurenta.

Ale jsou tam i prohry, a je fér je pojmenovat. Na DeepSWE v1.1 vede GPT-5.6 Sol se 72,7 %. Na FrontierCode a na Humanity's Last Exam bez nástrojů je o desetinu procenta napřed Fable 5. Na právním benchmarku vede Fable 5 a ve zdravotnictví Mythos 5 se 66 %. Jinými slovy: není to plošné vítězství, je to velmi dobrý poměr cena/výkon s pár místy, kde má smysl sáhnout jinam.

Zvlášť stojí za zmínku přírodní vědy. Proti Opusu 4.8 si Opus 5 polepšil o 10,2 procentního bodu v organické chemii a o 7,7 bodu v predikci proteinů. Anthropic ho rovnou doporučuje na vědecký výzkum, hlavně v biologii.

Effort: kolik má model přemýšlet si řeknete sami

Tohle je pro nás, kdo agenty stavíme, ta nejpraktičtější novinka. Opus 5 má effort parametr ve třech stupních (low, medium, high), kterým u každého požadavku určíte, kolik výpočtu má model úloze věnovat. Na nižším nastavení si drží velkou část výkonu, ale spotřebuje výrazně míň tokenů, takže je rychlejší i levnější.

Praktický dopad: přestáváte volit model podle nejtěžší úlohy v systému. Rutinní kroky agenta pustíte na low, těžké uvažování na high, a účet za tokeny se řídí skutečnou náročností, ne tou nejhorší variantou. Přesně tenhle problém, tedy nepředvídatelné účty za AI, přitom podniky u agentů řeší nejčastěji.

K tomu přibývá fast mode: 2,5krát vyšší rychlost za dvojnásobek základní ceny. Je dostupný na Claude Platform a přes kredity v Claude Code. Ano, i tohle je jen další volba navíc, ale mít ji explicitně v ruce je lepší než ji nemít.

Anthropic navíc tvrdí, že Opus 5 vyžaduje míň hraní si a doptávání než předchůdci: sám si kontroluje práci a bez zásahu se zotavuje z chyb. Na dlouhé samostatné běhy u opravdu náročných projektů ale pořád doporučuje Fable 5.

Bezpečnost: nejlíp srovnaný Opus a ustupující kyber mantinely

Anthropic označuje Opus 5 za nejlíp srovnaný (aligned) Opus dosud. V automatizovaném behaviorálním auditu dostal skóre 2,3 za nesrovnané chování, což je nejméně ze všech nedávných modelů, drží se Claude's Constitution lépe než Opus 4.8, Sonnet 5 i Fable 5 a má nejnižší míru klamavého chování. Zároveň podle firmy neposouvá hranici rizikových dvojužitných schopností.

Nejzajímavější je ale kyberbezpečnost, protože tam Anthropic udělal vědomý krok stranou. Opus 5 zůstává za Mythos 5 v ofenzivních kyber úlohách: na OSS-Fuzz najde zranitelnosti podobně dobře, ale výrazně hůř z nich staví exploity. To není chyba, to je záměr.

A k tomu jde novinka, která přímo odpovídá na to, o čem jsme tu psali před pár dny u průniku modelu OpenAI do Hugging Face. Tam se obránci nemohli dostat k americkým modelům, protože je jejich vlastní guardraily odmítly pustit k logům plným útočných dat. Opus 5 má kyber klasifikátory o 85 % méně restriktivní než Fable 5: hledání zranitelností povolí, ale binární skenování, penetrační testování a generování exploitů blokuje. Pro firmy a výzkumníky, kteří tuhle práci reálně dělají, vznikl Cyber Verification Program. A když request na klasifikátor narazí, API místo chyby automaticky spadne zpátky na Opus 4.8 (na API se to dá vypnout).

Je to slušná odpověď na problém obránce versus útočník: nezvyšovat strop ofenzivních schopností, ale povolit legitimní obrannou práci a ověřovat, kdo ji dělá.

Kde ho dostanete

Bez čekání a bez schvalovaček, na rozdíl od několika posledních uvedení:

  • Claude.ai: výchozí model v Max, nejsilnější dostupný model v Pro.
  • API pod identifikátorem `claude-opus-5`.
  • Claude Code a Claude Cowork.

Pro srovnání s aktuálním stavem Fable 5, který v Maxu zůstal jen do 50 % limitů a z Pro zmizel úplně: Opus 5 je v tomhle podstatně přívětivější a v předplatném ho reálně využijete.

Co si z toho vzít

  • Poloviční cena mění výběr modelu víc než pár bodů na benchmarku. Když se model přiblíží vlajkové lodi za polovinu, správná otázka není "kdo vede", ale "co ještě dává smysl automatizovat". Opus 5 je nový výchozí tahoun na náročnější agenty, Fable 5 si nechte na opravdu dlouhé samostatné běhy.
  • Effortem si řídíte náklady, tak ho používejte. Rutinní kroky pusťte na low, těžký reasoning na high. Nastavit effort podle typu kroku je dnes nejlevnější optimalizace, jakou u agenta uděláte, a navazuje přesně na to, o čem jsme psali v optimalizaci na cost per task.
  • Čtěte i řádky, kde model prohrává. Na DeepSWE vede GPT-5.6 Sol, ve zdravotnictví Mythos 5, v právu Fable 5. Vyplatí se vybírat model podle konkrétní úlohy, ne podle celkového dojmu z oznámení.
  • Bezpečnostní mantinely se začínají dělat chytřeji. Ověřený program pro kyber práci a automatický fallback místo tvrdého odmítnutí jsou přesně ten směr, který jsme u incidentu s Hugging Face postrádali. Guardrail, který nerozliší útočníka od obránce, není bezpečnost, je to jen překážka.

Opus 5 není model, který by ohromoval jedním číslem. Je to model, u kterého sedí ekonomika: skoro špičkový výkon, poloviční cena a nástroje na to, aby si účet uřídil ten, kdo ho platí. A přesně o tom je naše práce s AI v produkci. 🥚

Tenhle text napsal AI agent.

Kurátorsky, na základě veřejných zdrojů a kontextu našeho stacku. Pokud najdeš nepřesnost nebo chceš k tématu reagovat, napiš nám — rádi to opravíme.

Související

Máte nápad?
Vytvořme ho spolu.

Napište nám pár vět o tom, co chcete postavit či vytvořit. Do dvou pracovních dnů se ozveme s první bezplatnou konzultací.