Co ukázal test našeho interního třídiče e-mailů
Test zahrnoval 44 rozhodnutí o kategorii e-mailu a 16 rozhodnutí filtru uchazečů. Oba modely zvládly všech 60 správně. Medián odezvy klesl z 8,626 sekundy na 0,313 sekundy. Tisíc rozhodnutí vychází po přepočtu zhruba na 1,01 Kč místo 2,44 Kč.
Všechny ceny v korunách jsou orientačně přepočtené kurzem 1 USD = 21,795 Kč. Procentní úspora v benchmarku je vypočtená z původních částek před zaokrouhlením.
DeepSeek je model s klasickou LLM architekturou a u nás se používal právě na rozhodování, které teď převzal Jev. Benchmark tedy porovnává oba modely na stejné konkrétní práci. Největší změnou je odezva: z několika sekund jsme se dostali na zlomek sekundy.
| Metrika | DeepSeek V4 Flash 0731 | Jev | Rozdíl |
|---|---|---|---|
| Celková přesnost | 60/60 (100 %) | 60/60 (100 %) | Stejná |
| Přesnost kategorizace | 44/44 (100 %) | 44/44 (100 %) | Stejná |
| Přesnost filtru uchazečů | 16/16 (100 %) | 16/16 (100 %) | Stejná |
| Medián odezvy | 8,626 s | 0,313 s | 27,6× rychlejší |
| P95 odezvy | 30,542 s | 0,465 s | 65,7× rychlejší |
| Průměrná odezva | 11,234 s | 0,348 s | 32,3× rychlejší |
| Celkové náklady na API | 0,1467 Kč | 0,0606 Kč | O 58,7 % levnější |
| Náklady na 1 000 rozhodnutí | 2,44 Kč | 1,01 Kč | O 58,7 % levnější |
Jde o náš test na 60 rozhodnutích, takže těch 100 % platí pro tuto konkrétní sadu. Náklady na 1 000 rozhodnutí jsou přepočet naměřené ceny. P95 ukazuje hranici, do které se vešlo přibližně 95 % naměřených odezev.
Samotný test stál u obou modelů méně než korunu. Při modelových 10 000 rozhodnutích denně už ale za 30 dní vychází DeepSeek na 733 Kč a Jev na 303 Kč. Rozdíl je 430 Kč měsíčně.
Co je Jev a komu se bude hodit
Jev je model od TypeSafe AI určený pro rozhodování uvnitř softwaru. Pošlete mu kontext a předem definované otázky. Výsledek vrátí ve formátu JSON, například vybranou kategorii nebo skóre. Pracuje také s pravděpodobnostmi; u typů Choice a Score vrací i údaj o jistotě. Volný text negeneruje. Dokumentace TypeSafe
Například pro zařazení e-mailu pošlete na POST https://api.typesafe.ai/v1/systemone toto tělo požadavku:
{
"model": "jev-latest",
"state": "Dobrý den, prosím o zaslání faktury za září.",
"questions": {
"kategorie": {
"type": "choice",
"instructions": "Do které kategorie patří tento e-mail?",
"criteria": {
"fakturace": "Faktury, platby a účetní doklady",
"podpora": "Technické problémy a pomoc s používáním",
"obchod": "Poptávky a zájem o nové služby"
}
}
}
}Výřez odpovědi může vypadat takto; číselné hodnoty jsou ilustrativní, nejde o výsledek našeho benchmarku:
{
"answers": {
"kategorie": {
"type": "choice",
"choice": "fakturace",
"probabilities": {
"fakturace": 0.96,
"podpora": 0.03,
"obchod": 0.01
},
"confidence": 0.94
}
}
}choice obsahuje vybranou kategorii a probabilities pravděpodobnosti jednotlivých možností. confidence shrnuje, jak jednoznačně jedna možnost převažuje; není to totéž co pravděpodobnost vybrané kategorie. Aplikace může podle tohoto údaje předávat nejisté případy ke kontrole. Struktura API, význam confidence.
Pro běžného uživatele je takový model v podstatě nevyužitelný. Vývojáře a lidi, kteří staví AI automatizace, ale může zajímat hodně. Z jeho použití pak těží i zákazník: zpráva se dostane ke správnému člověku dřív nebo systém zbytečně nečeká na velký model.
Výběr modelů a kategorizace jsou konkrétní úlohy, u kterých lze správnost rozhodnutí změřit. Stejný postup dává smysl i při hledání dalších vhodných procesů.
Kolik stojí deset tisíc rozhodnutí denně
Podle oznámení TypeSafe stojí milion vstupních tokenů přibližně 0,92 Kč a výstup je zdarma. Jev byl představen 15. září 2026 v režimu early access. Oznámení a cena
Při 10 000 požadavcích denně záleží na délce vstupu, včetně kontextu a otázek; následující tabulka ukazuje dva modelové příklady:
| Průměrný vstup na požadavek | 10 000 požadavků denně | 30 dní provozu |
|---|---|---|
| 1 000 tokenů | 9,15 Kč | 274,62 Kč |
| 5 000 tokenů | 45,77 Kč | 1 373,09 Kč |
Přepočet našeho benchmarku vychází na 303 Kč měsíčně, zatímco příklad s přesně 1 000 vstupními tokeny na požadavek vychází podle ceníku na zhruba 275 Kč.
Počítá se jen vstup modelu podle ceníku. Vývoj, infrastruktura a případné navazující modely jsou zvlášť.
Připomíná mi to Jevonsův paradox: úspornější parní stroje zlevnily výrobu, její rozšíření ale vedlo k vyšší celkové spotřebě uhlí.
„Je zcela mylné předpokládat, že úspornější využívání paliva znamená menší spotřebu.“
William Stanley Jevons, The Coal Question, kapitola VII. Vlastní překlad z angličtiny.
U AI je to užitečná analogie: levnější rozhodování může vést k častějšímu používání modelů. Jestli se to stane i s Jevem, ukáže až praxe.
Marketingová čísla a realita
TypeSafe uvádí odezvu 70–500 milisekund a ve vlastních workflow testech hlásí 193,6× vyšší rychlost a 444,6× nižší cenu. Jako referenční odpovědi v těchto testech používá průměr predikcí GPT-6 Astra a Fable 5.1. Oznámení tato čísla nepřipisuje srovnání s Opusem a firma je řadí k horní hranici očekávaných přínosů v praxi. Výsledky a podmínky testů
Univerzální model, například Claude Opus od Anthropicu, a specializovaný Jev dělají každý jiný sport. Je to jako porovnávat Ferrari a tank: záleží, co s nimi chcete dělat. Výsledky na strukturovaných rozhodnutích nevypovídají o všech schopnostech modelů a nelze je přenášet na libovolnou úlohu.
Praktičtější je porovnat Jev s modelem, který už danou práci reálně dělal. Úspora 58,7 % je dobrý výsledek, zvlášť proti modelu, který už byl levný. Větší změnu přinesla rychlost.
Krátká odezva umožňuje rozhodovat během interakce. Když člověk pošle zprávu, nechcete několik sekund čekat už jen na určení, kdo ji má řešit. Skutečnou odezvu je potřeba měřit z místa, odkud bude aplikace volat API.
Výběr modelu podle náročnosti úkolu
U agentů bych Jev použil v řídicí vrstvě, která vybírá další postup. Často se jí říká agent harness (Cursor, Codex, Claude Code). Jednoduchá úprava textu může jít na levnější model. Úkol s nejasným zadáním nebo více závislostmi dostane model schopný delšího uvažování.
Zadání úkolu→Jev: odhad náročnosti a rizika→Pravidla aplikace vyberou model
Návrh postupu. Odhad náročnosti je potřeba ověřit na úkolech, které aplikace skutečně řeší.
Router se vyplatí, pokud jeho rozhodnutí ušetří víc, než kolik stojí případné chyby. Proto bych sledoval také opakované pokusy a počet úkolů, které levnější model nezvládl. Nízká cena prvního volání sama o sobě ještě neznamená levnější dokončenou práci.
E-maily a leady mají jasný další krok
U příchozí pošty bych začal kategoriemi jako poptávka, podpora a fakturace. Vedle kategorie lze posoudit naléhavost. Zpráva „nejde nám objednat a zákazníci odcházejí“ by tak dostala jinou prioritu než dotaz na změnu kontaktního telefonu.
U leadů dává smysl vyhodnocovat konkrétní informace: zda poptávka odpovídá službám firmy, jestli obsahuje termín a zda chybí něco pro první nabídku. Obchodník pak může začít zprávami, u kterých má jasný další krok.
Podobné možnosti popisuje TypeSafe také ve své mapě použití. U nás jsme začali třídičem e-mailů, jehož výsledky jsou výše.
Co bych zkusil dál
Další test bych udělal na rozpoznání frustrace v zákaznickém chatu a na kontrole, zda odpověď agenta dodržuje pravidla firmy. U nás tyto možnosti zatím ověřené nemáme. Nejdřív bych je porovnal s ručně vyhodnocenými konverzacemi a sledoval přehlédnuté problémy i zbytečná upozornění.
Kdy Jev nepoužít
Jev se nehodí na psaní odpovědí zákazníkům, článků nebo kódu. Volný text negeneruje, vrací rozhodnutí ve formátu JSON. U složitého úkolu, který vyžaduje delší uvažování, bych ho použil nanejvýš pro dílčí rozhodnutí nebo výběr dalšího modelu.
Je také v režimu early access. Do kritického procesu bych ho zapojil až po ověření na vlastních datech a s možností předat nejisté případy člověku nebo jinému modelu. Správný formát JSON ještě neznamená správné rozhodnutí.
Náš benchmark obsahuje jen 60 rozhodnutí z jednoho konkrétního třídiče. Stoprocentní přesnost na této sadě nezaručuje stejný výsledek na dalších e-mailech, jiných jazycích nebo v jiném procesu. Stejně tak naměřenou rychlost a úsporu nelze automaticky přenést na každou aplikaci.
Začal bych jedním často opakovaným rozhodnutím
Vybral bych proces, kde dnes člověk nebo velký model pořád dokola třídí podobné vstupy. Na historických datech bych porovnal správnost, odezvu a cenu a teprve pak rozhodnutí zapojil do provozu.
Pro vlastní test je dobrý začátek dokumentace TypeSafe. Pokud chcete probrat třídění poptávek, routování agentů nebo zákaznickou podporu ve vaší firmě, ozvěte se nám. Vybereme konkrétní rozhodnutí a způsob, jak jeho přínos změřit.


