Přeskočit na obsah

Otestovali jsme Jev: Model optimalizovaný na rozhodování

Aktualizováno: 9.10.2026, Zabere vám 7 minut času

Logo TypeSafe AI

TypeSafe AI představila Jev, model specializovaný na rozhodování. Co to znamená a v čem se liší od ChatGPT? V Anycoders máme interní třídič e-mailů, který přesně takovou práci řeší. Proto jsme Jev vyzkoušeli na jeho rozhodnutích a porovnali ho s modelem, který jsme používali dosud.

Nový model, který se soustředí na rozhodování

TypeSafe AI představila Jev, model určený pro rozhodování uvnitř softwaru. Zaujalo nás, že se soustředí na práci, kterou už u nás AI dělá každý den: přečíst vstup, posoudit ho podle zadání a vybrat další krok. V našem případě třeba určit, do jaké kategorie patří příchozí e-mail.

Taková úloha vypadá nenápadně. Systém při ní nepotřebuje napsat dlouhou odpověď ani vést konverzaci. Potřebuje se správně rozhodnout a předat výsledek dál. Právě pro tento typ práce TypeSafe Jev nabízí. Chtěli jsme zjistit, jestli nám specializovaný model přinese něco navíc oproti modelu, který jsme už používali.

V čem se Jev liší od ChatGPT

Když používáte ChatGPT, můžete se ptát, nechat si vysvětlit problém nebo si připravit návrh textu. Jev funguje jinak: do aplikace mu předáte kontext a předem definované otázky. Vrátí rozhodnutí, například vybranou kategorii nebo skóre. Volný text negeneruje.

Představte si zprávu: „Dobrý den, prosím o zaslání faktury za září.“ Třídič má určit, zda patří do fakturace, podpory, nebo obchodu. Jev může vybrat fakturaci a vrátit tento výsledek v podobě, kterou software rovnou zpracuje. Napsání odpovědi zákazníkovi je už další, samostatný úkol.

Výsledky vrací ve formátu JSON, tedy jako strukturovaná data pro aplikaci. U výběru mezi možnostmi vrací také jejich pravděpodobnosti a údaj confidence, který shrnuje, jak jednoznačně jedna možnost převažuje. Aplikace podle něj může předat nejisté případy ke kontrole. Správný formát odpovědi ale sám o sobě nezaručuje správné rozhodnutí. Dokumentace TypeSafe, význam confidence.

Pro člověka, který si chce s AI povídat, tak Jev nemá moc využití. Pro vývojáře automatizace může být zajímavý právě tím, že řeší jednu konkrétní část procesu. Zákazník ho vůbec nemusí vidět; pozná jen, že se jeho zpráva dostala ke správnému člověku rychleji.

Podobná rozhodnutí už řešíme v našem třídiči e-mailů

V Anycoders máme interní nástroj, který pomocí AI třídí e-maily. Jeho součástí jsou rozhodnutí o kategorii zprávy a filtr uchazečů. Model v těchto krocích posuzuje vstup a vrací výsledek, se kterým nástroj dál pracuje.

Dosud tuto práci dělal DeepSeek V4 Flash 0731. Potřebovali jsme od něj konkrétní rozhodnutí, přesto jsme k tomu používali univerzální jazykový model. Když se objevil Jev, měli jsme tedy po ruce úlohu, na které šlo jeho přínos ověřit.

Zajímaly nás tři věci: jestli zachová správnost rozhodnutí, jak dlouho budeme na výsledek čekat a kolik budou stát volání API. Samotná nižší cena by nám nepomohla, kdyby nástroj začal zprávy zařazovat špatně.

Proto jsme oba modely porovnali na stejné práci

Test obsahoval 60 rozhodnutí z našeho třídiče: 44 rozhodnutí o kategorii e-mailu a 16 rozhodnutí filtru uchazečů. U obou modelů jsme vyhodnotili správnost, odezvu a náklady na API.

Šlo o porovnání na konkrétní práci, kterou náš nástroj potřebuje zvládnout. Takový test nám řekne víc o vhodnosti modelu pro náš proces než obecné tvrzení, kolikrát je rychlejší nebo levnější.

Zároveň jde o malou sadu. Výsledek na 60 rozhodnutích nemůže zaručit stejnou přesnost na dalších e-mailech, v jiných jazycích ani v jiné aplikaci. Pro další nasazení je potřeba průběžně kontrolovat i nové a nejasné případy.

Kde by podobný model mohl pomoci dál

Třídění e-mailů je jeden příklad. Podobně lze u příchozích poptávek posuzovat, zda odpovídají službám firmy, zda obsahují termín nebo jestli chybí informace pro první nabídku. U podpory může jít o určení naléhavosti: problém, kvůli kterému zákazníci nemohou objednat, potřebuje jinou prioritu než žádost o změnu telefonu.

Další možností je výběr modelu pro AI agenta. Jednoduchý úkol může dostat levnější model, zatímco nejasné zadání nebo úkol s více závislostmi model schopný delšího uvažování. I takový výběr se ale musí ověřit na skutečných úkolech. Pokud levnější model práci nezvládne a musí ji opakovat jiný, úspora z prvního volání může zmizet.

U nás bych dál zkusil rozpoznání frustrace v zákaznickém chatu nebo kontrolu, zda odpověď agenta dodržuje pravidla firmy. Tyto možnosti zatím ověřené nemáme. Nejdřív bych výsledky porovnal s ručně vyhodnocenými konverzacemi a sledoval přehlédnuté problémy i zbytečná upozornění. Další příklady uvádí TypeSafe ve své mapě použití.

Jev přitom nenahradí model pro psaní článků, kódu nebo odpovědí zákazníkům. Jeho místo je v dílčích rozhodnutích. Podle oznámení TypeSafe byl představen 15. září 2026 v režimu early access; do kritického procesu bych ho zapojil až po ověření na vlastních datech a s možností předat nejisté případy člověku nebo jinému modelu. Oznámení TypeSafe.

Co ukázal náš test

Oba modely správně vyhodnotily všech 60 testovaných rozhodnutí. Rozdíl byl hlavně v čekání: medián odezvy klesl z 8,626 sekundy na 0,313 sekundy. V našem testu tak Jev odpovídal v mediánu 27,6× rychleji.

Náklady na API byly o 58,7 % nižší. Po přepočtu vychází tisíc rozhodnutí přibližně na 1,01 Kč místo 2,44 Kč.

MetrikaDeepSeek V4 Flash 0731JevRozdíl
Celková přesnost60/60 (100 %)60/60 (100 %)Stejná
Přesnost kategorizace44/44 (100 %)44/44 (100 %)Stejná
Přesnost filtru uchazečů16/16 (100 %)16/16 (100 %)Stejná
Medián odezvy8,626 s0,313 s27,6× rychlejší
P95 odezvy30,542 s0,465 s65,7× rychlejší
Průměrná odezva11,234 s0,348 s32,3× rychlejší
Celkové náklady na API0,1467 Kč0,0606 KčO 58,7 % levnější
Náklady na 1 000 rozhodnutí2,44 Kč1,01 KčO 58,7 % levnější

Medián představuje prostřední naměřenou hodnotu. P95 ukazuje hranici, do které se vešlo přibližně 95 % odezev. Stoprocentní přesnost platí pro naši testovací sadu; nejde o příslib stejného výsledku v provozu.

Všechny ceny v korunách jsou orientačně přepočtené kurzem 1 USD = 21,795 Kč. Procentní úspora je vypočtená z původních částek před zaokrouhlením a náklady na tisíc rozhodnutí jsou přepočtem naměřené ceny.

Samotný test stál u obou modelů méně než korunu. Při modelových 10 000 rozhodnutích denně ale za 30 dní vychází DeepSeek přibližně na 733 Kč a Jev na 303 Kč. Rozdíl je 430 Kč měsíčně. Jde o odhad podle našeho testu, který zahrnuje jen API, nikoli vývoj a infrastrukturu.

Cena v jiném procesu bude záviset také na délce vstupu. Podle oznámení TypeSafe stojí milion vstupních tokenů přibližně 0,92 Kč a výstup je zdarma. Při přesně tisíci vstupních tokenech na požadavek by deset tisíc požadavků denně vyšlo podle tohoto ceníku zhruba na 275 Kč za 30 dní. Oznámení a cena.

Pro nás byla nejvýraznější změnou rychlost. Rozhodnutí, na které třídič čekal několik sekund, dostal během zlomku sekundy. V této sadě přitom zůstala správnost stejná. To je konkrétní důvod, proč nám dávalo smysl Jev pro tuto práci vyzkoušet.

Pokud ve firmě řešíte podobná opakovaná rozhodnutí, začal bych jedním procesem a testem na vlastních datech. Porovnal bych správnost, odezvu a cenu a teprve pak rozhodl o nasazení. Jestli chcete probrat třídění poptávek, routování agentů nebo zákaznickou podporu, ozvěte se nám. Vybereme konkrétní rozhodnutí a způsob, jak jeho přínos změřit.

Autor článku
Medvěd lední

Zajímá vás k tomu více?

Napište. Ozveme se, i když to není poptávka.

Odesláním souhlasíte se zpracováním osobních údajů .