Claude Sonnet 5.5 se dotáhl na Opus 5.5 za poloviční cenu. Ten jeden benchmark, kde ho poráží, ale čtěte pozorně
Šest dní po Opusu 5.5 je venku Sonnet 5.5 a na většině benchmarků je od něj vzdálený dva až tři body, přitom stojí polovinu a cena za token se nezměnila. Generuje o 30 procent rychleji a na úlohu spotřebuje míň tokenů. Na Terminal-Benchi sice Opus poráží, jenže každý na jiném nastavení. A čeká vás pět zpětně nekompatibilních změn.
Šest dní po Opusu 5.5 je venku Claude Sonnet 5.5, druhý model rodiny 5.5. A je to podle nás zajímavější vydání než ten Opus, protože se v něm stalo něco, co se dlouho nedělo: střední třída se dotáhla na špičku.
Cena se nezměnila, náklady klesly
Tohle je ta hlavní zpráva. Sonnet 5.5 stojí 2 a 10 dolarů za milion vstupních a výstupních tokenů, tedy úplně stejně jako Sonnet 5. Cache reads 0,20 a cache writes 2,50, taky beze změny.
Levnější je tím, že spotřebuje na úlohu míň tokenů. Anthropic mluví o až 30 procentech nižší ceně za úlohu a k tomu o víc než 30 procent rychlejším generování. Nic z toho nevidíte v ceníku, ale všechno uvidíte na faktuře.
Pro srovnání, Opus 5.5 stojí 4 a 20. Sonnet 5.5 je tedy přesně na polovině.
Jak blízko to je
Tady jsou čísla, která Anthropic publikoval. Sloupce jsou Sonnet 5.5, starý Sonnet 5 a Opus 5.5:
- Terminal-Bench 4.0: 70,6 / 10,3 / 66,4
- GDPval-AA v2.1: 1844 / 1449 / 1846
- AA-Briefcase v1.1: 1811 / 1359 / 1822
- OSWorld 2.1: 80,1 / 57,0 / 81,8
- Humanity's Last Exam: 64,5 / 54,9 / 67,7
- CursorBench 4.0: 55,5 / 34,1 / 57,8
- FrontierCode 1.1: 46,2 / 42,4 / 54,4
- Chartography: 61,6 / 15,6 / 64,4
Podívejte se na ten prostřední sloupec. Skok proti Sonnetu 5 je místy brutální, u Chartography z 15,6 na 61,6, u OSWorldu z 57 na 80. A u GDPval, což je test reálné práce napříč profesemi, je Sonnet 5.5 na 1844 proti 1846 u Opusu 5.5. To jsou dva body. Za poloviční cenu.
Anthropic k tomu přidal i detail, který se dobře pamatuje: je to první Sonnet, který dohrál Pokémon Red jen z obrázků obrazovky.
Ten Terminal-Bench si ale zaslouží hvězdičku
V titulcích teď poletí, že Sonnet porazil Opus. Na Terminal-Benchi 4.0 to tak vypadá, 70,6 proti 66,4. Jenže:
Každé z těch čísel je naměřené na jiném nastavení. Sonnetových 70,6 procenta je na nastavení max, zatímco Opusových 66,4 je na xhigh. Na stejném nastavení xhigh dává Sonnet 61,5 a Opus 66,4.
Takže ne, střední třída špičku neporazila. Dostala se blízko a při maximálním úsilí se na jedné konkrétní úloze dostane výš, což je samo o sobě pozoruhodné. Ale to srovnání není jablko s jablkem a je fér to říct nahlas.
Pět zpětně nekompatibilních změn
Pokud něco provozujete na Sonnetu 5, výměna ID modelu nestačí. Anthropic jich vyjmenovává pět:
1. Thinking se vypíná jinak. thinking: {"type": "disabled"} vrací 400. Místo toho je nová nejnižší úroveň between_tools. Pozor na to, že funguje jen na low, medium a high. Na xhigh a max vrací chybu a musíte jet na adaptivním přemýšlení.
2. Vynucené volání nástroje končí chybou, stejně jako u Opusu 5.5. tool_choice typu any nebo tool vrací 400.
3. Thinking bloky jsou vázané na model, konverzaci i účet. Sonnet 5.5 přečte bloky ze Sonnetu 5 a starších, ale ne z Opusu 5 ani 5.5. A nově platí i to, že bloky fungují jen v účtu, který je vytvořil.
4. Starý computer use nástroj skončil na Claude API a Google Cloudu. Na Bedrocku funguje dál.
5. Advisor tool změnil povolené dvojice. Opus 4.8, Opus 4.7 ani Sonnet 5 už nemůžou Sonnetu 5.5 dělat poradce.
A k tomu ta tichá změna, kterou známe z Opusu: text mezi voláním nástrojů se vrací v thinking blocích, které jsou ve výchozím nastavení prázdné. Aplikace, co uživateli streamuje průběžné hlášky, prostě zmlkne bez chybové hlášky.
Effort je přeškálovaný, přeměřte si ho
Tohle je nejpraktičtější věc z celého vydání. Stejná úroveň effortu znamená na Sonnetu 5.5 něco jiného než na Sonnetu 5. Výchozí hodnota na API je high, tedy jiná než u Opusu 5.5, kde klesla na medium.
Anthropic sám radí, kde začít:
highjako výchozí bod pro běžnou prácimediumpro agentní programování a dobře zadané vícekrokové úlohy, a teprve u těžších jít nahighmediumnebolowpro chat a všechno, kde jde o odezvu
Je to přesně ta optimalizace, o které jsme psali u cost-per-task. Kdo si ten sweep neudělá, buď přeplácí, nebo zbytečně ztrácí kvalitu.
Co si z toho vzít
- Otázka "Opus, nebo Sonnet" se posunula. Ještě loni znamenal levnější model znatelně horší výsledky. Dnes je na velké části práce rozdíl dva až tři body a poloviční cena. Opus si nechte na otevřené úlohy, kde je potřeba dlouho držet úsudek. Na všechno ostatní je Sonnet 5.5 default.
- Pozor na to, že za stejné peníze dostáváte víc. Tohle je neobvyklé vydání, protože cena za token se nezměnila vůbec. Když jen přepíšete ID modelu, spadnou vám náklady samy tím, že model spotřebuje míň tokenů. Málokdy je upgrade takhle levný.
- Ale ty benchmarky si čtěte i s nastavením. Ten Terminal-Bench je učebnicový příklad. Dvě čísla vedle sebe, každé z jiného režimu, a vznikne z toho titulek, který neplatí. Platí to na všechny výrobce stejně, viz srovnání u GPT-6 Sol.
- A tohle je osmý článek o AI, který jsme tenhle měsíc napsali. Za září vyšly GPT-6 Astra, Opus 5.5, GPT-6 Sol i Luna a teď Sonnet 5.5, k tomu iPhone s vlastním AI čipem, dva zajímavé pokusy o efektivitu a jedna dobrovolná pauza v trénování. Kdo v tomhle tempu vybírá model na půl roku dopředu, vybírá špatně. Postavte si systém tak, aby se model dal vyměnit, protože do Vánoc ho vyměníte nejmíň dvakrát.
Sonnet 5.5 je z těch vydání, co se špatně prodávají v titulcích. Žádná nová schopnost, žádné velké gesto. Jen stejná cena, třetinově rychlejší odpovědi a výsledky skoro jako u dvakrát dražšího modelu. Za nás je to nejlepší poměr, který dnes na trhu je. 🎻
Kurátorsky, na základě veřejných zdrojů a kontextu našeho stacku. Pokud najdeš nepřesnost nebo chceš k tématu reagovat, napiš nám a rádi to opravíme.
Související
Máte nápad?
Vytvořme ho spolu.
Napište nám pár vět o tom, co chcete postavit či vytvořit. Do dvou pracovních dnů se ozveme s první bezplatnou konzultací.
