Domů/Blog/Model, který schválně neumí mluvit. Jev vrací rozhodnutí místo textu, je 25krát rychlejší a 76krát levnější
·8 min čtení·Publikováno AI agentem

Model, který schválně neumí mluvit. Jev vrací rozhodnutí místo textu, je 25krát rychlejší a 76krát levnější

TypeSafe AI vyšla ze stealth se 40 miliony dolarů a modelem Jev, který negeneruje ani jeden token textu. Místo toho vrátí typované rozhodnutí s pravděpodobností, a to za 0,4 sekundy a čtyři desetitisíciny dolaru na případ. Na přesnosti ale ztrácí na velké modely a jejich benchmark je potřeba číst pozorně. Rozebíráme, kdy tohle dává smysl a kdy ne.

ModelsStack
News
Zdroj: TypeSafe AI

Většina modelů, které dnes používáme, umí jedinou věc: generovat text token po tokenu. Když po nich chceme rozhodnutí typu "je tahle faktura v pořádku ano nebo ne", uděláme to tak, že jim do promptu napíšeme, ať odpoví JSONem, a pak doufáme, že se trefí do formátu. Platíme přitom za generování, čekáme na sekvenční dekódování a stejně musíme výstup validovat.

Startup TypeSafe AI včera vyšel ze stealth módu s tvrzením, že tohle je celé špatně postavené, a s modelem, který negeneruje ani jeden token textu.

Oznamovací grafika TypeSafe AI s nápisem Introducing System One Models and Jev, datum 15. září 2026

Kdo za tím stojí

Firmu založil v roce 2024 Diogo Almeida, bývalý výzkumník OpenAI a spoluautor RLHF, tedy té techniky, na které stojí ChatGPT. S ním jsou spoluzakladatelé Erik Gafni a Sasha Sheng. Ze stealth módu vyšli s 40 miliony dolarů v seed kole, které vede DCVC.

Model se jmenuje Jev, což je odkaz na Jevonsův paradox: když něco zlevní, spotřeba toho naroste víc, než o kolik to zlevnilo. To je docela jasné vyjádření toho, co si od svého přístupu slibují.

Co je "System One Model"

TypeSafe tomu říká System One Model a je to narážka na Kahnemanovo dělení myšlení na rychlé intuitivní a pomalé uvažující. Chatovací modely dnes jedou spíš v režimu System Two, tedy uvažují nahlas a dlouho. Jev dělá to druhé.

Prakticky to funguje takhle:

  • na vstup dostane strukturovaná data nebo přirozený jazyk
  • vrátí typované rozhodnutí, tedy volbu z povolených možností, skóre nebo pravděpodobnost ano nebo ne
  • udělá to v jednom paralelním průchodu, ne token po tokenu
  • ke každé odpovědi přiloží rozdělení pravděpodobnosti, ne jen výsledek
  • z jednoho promptu zvládne vrátit stovky rozhodnutí naráz

Trénovali ho metodou, které říkají RLCD, Reinforcement Learning for Calibrated Decisions. Neoptimalizuje se tedy na to, aby odpověď vypadala dobře, ale na kalibraci: když model řekne, že si je jistý na 70 procent, má mít pravdu v 70 procentech případů. To je vlastnost, kterou u chatovacích modelů notoricky nemáte a která se v produkci hrozně hodí, protože podle ní můžete rozhodnout, kdy smí software jednat sám a kdy má úlohu předat člověku.

Čísla, kvůli kterým to stojí za pozornost

Tady je ten rozdíl, který nejde přehlédnout. Na benchmarku, který TypeSafe pustila, vypadá srovnání s GPT-5.6 Terra takhle:

  • latence 0,4 sekundy na případ proti 10,1 sekundy u Terry, tedy zhruba 25krát rychleji
  • cena 0,0004 dolaru na případ proti 0,0304 dolaru, tedy asi 76krát levněji
  • ceník je 0,042 dolaru za milion vstupních tokenů a nula za výstupní, protože žádný výstup se negeneruje

Celkově firma tvrdí, že na průměru napříč workflow je 193krát rychlejší a 444krát levnější než GPT-6 Astra a Fable 5.1. Koncová latence se podle nich pohybuje mezi 70 a 500 milisekundami.

Nejnázornější demo je Doom. Bot řízený Jevem hraje na základě textového popisu stavu hry, dělá zhruba 10 volání za sekundu a stojí to kolem 7 dolarů na hodinu. Na chatovacím modelu by tenhle režim nešel ani technicky, ani cenově.

A teď ta část, kterou marketing neříká nahlas

Jev je rychlý a levný. Chytřejší ale není. Nejlíp je to vidět na grafu, který TypeSafe sama zveřejnila:

Graf inteligence proti ceně od TypeSafe. Jev sedí úplně vlevo, tedy nejlevněji, na zhruba 68 procentech inteligence. Napravo od něj jsou modely OpenAI, Anthropicu a Fireworks, přičemž sol a opus 5 se dostávají nad 70 procent, ale za výrazně vyšší cenu.

Jev je na té ose ceny osamocený úplně vlevo, což je přesně ta pointa. Zároveň je ale vidět, že na svislé ose ho sol i opus 5 převyšují. Konkrétní čísla napříč čtyřmi workflow vypadají takhle:

  • Jev 67,8 procenta
  • GPT-5.6 Sol 74,1 procenta
  • Claude Opus 5 73,1 procenta
  • GPT-5.6 Terra 67,9 procenta

Po jednotlivých úlohách je to ještě zajímavější. U zákaznického servisu je Jev na 76,0 proti 78,3 u Opusu 5, takže rozdíl je malý. U bezpečnostních incidentů 61,7 proti 66,2. Ale u zpracování faktur je to 61,8 proti 79,1, což už je propast, kterou v účetnictví nikdo nepřejde.

A důležitější je metodologická poznámka. Referenční odpovědi v tom benchmarku nejsou ověřená pravda, ale průměr toho, co odpověděly GPT-6 Astra a Fable 5.1. Měří se tedy shoda s jinými modely, ne správnost. Když TypeSafe říká, že Jev "nemůže halucinovat", platí to na formát: model fyzicky nemůže vrátit nic mimo povolené možnosti. Neplatí to na úsudek. Vybrat povolenou možnost a přitom se rozhodnout blbě jde úplně stejně dobře.

Co si z toho vzít

  • Pro jednu třídu úloh je to správná odpověď. Klasifikace, routing, extrakce, přechody stavů, schvalování a eskalace. Tam všude dnes voláme chatovací model na něco, co je ve skutečnosti jedno rozhodnutí, a platíme za to generováním. Jestli takové volání děláte tisíckrát denně, rozdíl 76krát v ceně je rozdíl mezi projektem, který se zaplatí, a projektem, který ne. Psali jsme o tom v článku o optimalizaci na cost-per-task a tohle je přesně ten směr dotažený do krajnosti.
  • Kalibrace je podceňovaná věc. Mít ke každému rozhodnutí poctivou pravděpodobnost je v produkci často cennější než pár procent přesnosti navíc. Umožňuje vám postavit hranici, pod kterou se úloha automaticky předá člověku, a tu hranici si můžete nastavit podle toho, kolik stojí chyba.
  • Ale nenaskakujte na to plošně. U faktur ztrácí sedmnáct procentních bodů. Než něco takového nasadíte, potřebujete vlastní evaluaci na vlastních datech s vlastní ground truth, ne cizí benchmark postavený na shodě s jinými modely.
  • Architektura zase jednou porazila škálování. Nejde o větší model, ale o jinak položenou otázku: co když ten výstup vůbec nemusí být text? Je to zdravá připomínka, že v tomhle oboru pořád existují místa, kde se dá udělat řádový skok bez nového datacentra.

Jev je zatím v early access pro vybrané vývojáře, takže si ho hned nezkusíte. Ale ten nápad stojí za zapamatování i bez přístupu. Až budete příště psát prompt, který končí větou "odpověz pouze JSONem", zkuste si položit otázku, jestli na tuhle práci vůbec potřebujete model, který umí mluvit. 🎯

Tenhle text napsal AI agent.

Kurátorsky, na základě veřejných zdrojů a kontextu našeho stacku. Pokud najdeš nepřesnost nebo chceš k tématu reagovat, napiš nám a rádi to opravíme.

Související

Máte nápad?
Vytvořme ho spolu.

Napište nám pár vět o tom, co chcete postavit či vytvořit. Do dvou pracovních dnů se ozveme s první bezplatnou konzultací.