Ho avuto accesso in anteprima a Jev e l'ho messo subito dentro i sistemi che uso tutti i giorni con Claude Code: il radar che mi filtra le notizie, lo scraping di Hacker News, l'analisi dei commenti del canale. Volevo capire una cosa sola: quanto si risparmia davvero sostituendo un LLM economico con un modello che non genera testo ma solo decisioni.
Il video è uscito il 19 settembre 2026 sul canale YouTube Coco Satoru, con quattro test misurati in diretta e la parte finale su come installarlo in Claude Code.
Se preferisci guardarlo su YouTube: Addio agli LLM? Ho inserito Jev nei miei sistemi di Claude code. Qui sotto trovi cos'è Jev, i tre formati di risposta, i numeri dei quattro test, i prezzi a confronto e i casi in cui secondo me non ha senso usarlo.
Cos'è Jev e perché non è un LLM
Jev è il primo modello di Typesafe AI, la startup di Diogo Almeida, ricercatore ex OpenAI che ha lavorato sui metodi dietro ChatGPT. L'annuncio ufficiale è del 15 settembre 2026 e l'azienda lo chiama "System One Model", una categoria diversa dagli LLM.
La differenza principale sta nell'output. Un LLM produce stringhe, cioè testo che poi devi parsare e validare. Jev produce valori strutturati definiti in anticipo, accompagnati sempre da una probabilità: se gli chiedi "il cielo è blu?" ti risponde vero al 98% e falso al 2%, e se nel contesto gli scrivi che il cielo è arancione la risposta si ribalta.
L'altra differenza è il sampling. Gli LLM generano un token alla volta, ognuno condizionato dal precedente. Jev genera tutte le risposte in parallelo in una sola query, quindi che tu gli faccia una domanda o diecimila il tempo resta praticamente lo stesso.
Come si fanno le domande a Jev: noul, choice e score
Con Jev non puoi chattare. Nella console lo scrivono chiaramente e nel playground la prima domanda del quiz è proprio "puoi chattare con Jev?": la risposta è falsa al 97%. Gli passi uno stato (testo o dati strutturati) e una mappa di domande tipizzate, e ti tornano le risposte nello stesso formato.
I tipi di domanda sono tre, come si legge nella documentazione API: noul per il sì/no con probabilità, choice per scegliere tra opzioni che definisci tu, score per assegnare un livello su una scala che descrivi tu.
noul
Domanda binaria. Nel playground c'è l'esempio "un hot dog è un sandwich?": senza criteri risponde vero al 60%, aggiungendo la definizione di cosa conta come sandwich sale al 77%. Se al posto della variabile metti un avocado toast scende al 3%, se metti un burger sale al 95%.
choice
Domanda a opzioni. Ho provato "di che colore è il cielo?" con sette colori: risponde baby blue all'82% ed electric blue al 17%, con la distribuzione completa delle probabilità.
score
Valutazione su livelli ordinati, tipo la gravità di un bug: cosmetico, rotto ma con workaround, bloccante. Ti torna un valore pesato sulle probabilità dei livelli.
La cosa importante sono i criteri. Senza criteri Jev risponde con quello che sa, con i criteri risponde dentro le regole che gli dai tu. È lì che il modello diventa utile in un sistema reale.
Quanto è più economico e veloce di Gemini 3.8 Flash?
Nel mio test è 52 volte più economico a parità di lavoro. Ho preso due dei miei sistemi, ho usato le stesse domande e gli stessi dati, e ho misurato tutto il 18 settembre 2026 dall'Italia.
Primo test: 200 titoli di articoli tech e AI, una domanda sola, "questo articolo è utile a chi si occupa di automazioni AI?". Jev ha processato i 200 titoli in parallelo in 14,3 secondi per 0,0029 dollari totali, meno di un terzo di centesimo, giudicandone rilevanti 102. Gemini 3.8 Flash ci ha messo 123 secondi e ne ha trovati 91. Su un milione di titoli il conto sarebbe 15 dollari con Jev contro 623 dollari con Gemini, e ricordo che Gemini 3.8 Flash è già un modello economico: con Fable 5 o Opus quel numero cresce di 10-20 volte.
Sul test dei commenti il confronto è stato 0,015 euro per Jev contro 0,79 per Gemini. Proiettato su un milione di commenti: 40 dollari con Jev, 845 dollari con Gemini senza ragionamento, 2.084 dollari con il ragionamento attivo.
Sulla velocità, 10 commenti richiedono 0,62 secondi a Jev, 146 secondi a Gemini senza ragionamento e 252 con ragionamento. E aggiungendo domande il tempo di Jev resta quasi identico, cambia solo la latenza di rete, mentre con Gemini il tempo si somma domanda dopo domanda.
Sull'accuratezza il quadro è più onesto di quanto sembri: Jev 89%, Gemini senza ragionamento 96%. Ma se considero solo i casi in cui Jev si dichiara sicuro, scartando quelli intorno al 50-55%, si passa al 96% contro il 98,5% di Gemini. Tradotto: la probabilità non è un dettaglio estetico, è la soglia con cui filtri l'output.
Jev serve davvero se uso già una regex?
Nel secondo test l'ho messo contro il filtro regex che uso da mesi, e la regex ha perso su tutta la linea tranne che sul costo. Ho fatto scraping degli articoli di Hacker News delle ultime 24 ore: 31 notizie, 2,8 secondi per giudicarle tutte, 13 rilevanti secondo Jev contro 4 secondo la regex.
Il caso che mi ha convinto è un titolo su LLM a parametri infiniti. La mia regex cercava "LLM" e non ha agganciato "LLMs" per via della s finale, quindi quella notizia l'avrei persa. Jev l'ha presa perché legge il significato, non la stringa.
La regex costa zero e resterà utile in tanti punti. Ma qui il confronto è tra zero e un decimo di centesimo per run, mentre con Gemini la stessa cosa mi sarebbe costata 12-13 centesimi ogni volta. Su volumi giornalieri, 13 centesimi a run non li spendo. Un decimo di centesimo sì.
Adesso ho la possibilità di pagare comunque vicino allo zero e avere tanti più risultati di qualità.
Cosa succede se dai 380 commenti YouTube a Jev?
Terzo test: ho fatto scraping di tutti i commenti ricevuti sul canale e ho chiesto a Jev di categorizzarli. 380 commenti, 10 domande per ciascuno, quindi 3.800 risposte totali, in 24 secondi e 0,015 euro. Le categorie erano tre: cliente potenziale, richiesta di risposta e basta, e "guarda tu" per i casi in cui il modello non è sicuro e devo ricontrollare a mano.
Il risultato pratico sono 21 potenziali clienti individuati dentro commenti che altrimenti sarebbero rimasti lì. Una domanda tecnica su Claude Code con intento positivo viene marcata come possibile conversione, un "se possibile manda il link, grazie" finisce tra le risposte da dare senza altro seguito.
Da segnalare una cosa: Jev nasce sull'inglese e non è ottimizzato per l'italiano. Ho fatto il test lo stesso sui miei commenti in italiano e i risultati sono utilizzabili, ma è un dato da tenere presente se ci costruisci sopra qualcosa per un cliente italiano.
Come si installa Jev in Claude Code?
L'installazione passa da una pagina di quickstart con un prompt pronto e un file SKILL.md: lo incolli in Claude Code, lui installa il plugin, tu aggiungi la chiave API generata dalla console. Da lì Claude legge la documentazione e costruisce le chiamate da solo, senza che tu debba studiarti la struttura dei JSON.
- 1Copia il prompt del quickstart
Nella pagina di onboarding c'è il prompt con la skill da incollare direttamente in Claude Code.
- 2Lascia installare il plugin
Claude Code installa il plugin e si legge la documentazione di Typesafe per capire come formattare le domande.
- 3Inserisci la chiave API
La generi dalla console e la metti nel tuo ambiente, poi puoi chiamare Jev da qualsiasi script.
- 4Metti Jev prima dell'LLM
Lo usi per filtrare, classificare o instradare, così l'LLM riceve meno contesto e ti costa meno.
Il quarto test è quello che mi interessa di più. Il mio Claude Code ha 181 skill e normalmente è Claude a scegliere quale invocare leggendo titolo e descrizione di ognuna. Con tante skill simili tra loro le descrizioni si assomigliano e la scelta diventa imprecisa. Ho messo un hook che, prima della chiamata, passa a Jev tutte le skill complete e gli fa restituire le 3 più probabili con la relativa probabilità: Claude riceve già una rosa ristretta invece di scegliere alla cieca.
Sul mio account la giornata di test si è chiusa con 9.000 token e 18 richieste, sotto il centesimo. Se ti interessano altri modi per tagliare il consumo dei sistemi con Claude Code, ne ho parlato anche in Browser di Claude Code: cosa fa, quanto costa, 2 automazioni.
Quando conviene usare Jev e quando no
Conviene quando devi smistare volumi: mail, ticket, lead, commenti, recensioni. Conviene per filtrare notizie rilevanti, trovare spam, moderare contenuti, verificare gli output di altri sistemi e prendere decisioni in tempo reale, tipo dentro un game loop. Typesafe ha pubblicato una demo in cui Jev gioca a Doom, e nel loro annuncio scrivono che 10 query al secondo costano circa 7 dollari all'ora.
Non conviene quando ti serve testo: articoli, analisi scritte, risposte articolate. Lì Jev è inutile per definizione, perché non scrive. Non conviene nemmeno per calcoli, date o elaborazioni numeriche, ma può stare a monte: capisce la complessità della richiesta e decide quale script lanciare, poi il calcolo lo fa il codice.
I prezzi ufficiali chiariscono perché il discorso ha senso economicamente.
| Input | Output | |
|---|---|---|
| LLM di frontiera | da 0,20 a 10 dollari per milione di token | circa 5 volte il costo dell'input |
| Jev | 0,042 dollari per milione di token, cioè 42 dollari per miliardo | gratis |
I numeri della tabella sono quelli pubblicati da Typesafe nell'annuncio ufficiale, dove trovi anche i loro workflow evals con query, disaccordi e metodologia. Nei loro test usano come riferimento la media di GPT-6 Astra e Fable 5.1, che è un modo onesto di dirti che il confronto è tarato sui modelli più costosi.
- Definisci sempre i criteri di
trueefalse, altrimenti Jev risponde con le sue conoscenze generiche - Imposta una soglia di confidenza, io scarterei tutto sotto il 70%
- Tieni una categoria "controlla a mano" per i casi ambigui
- Testalo in un ambiente sicuro prima di metterlo in un sistema che vendi
- Ricorda che non è ottimizzato per l'italiano
Io non posso dirti in anticipo se nel tempo reggerà. Quello che posso dirti è che con l'abbonamento Claude Code da 100 dollari al mese sbatto continuamente contro il limite delle 5 ore e contro quello settimanale, e spostare le decisioni su un modello che costa quasi zero è la prima leva sensata che ho in mano. Sul fronte costi degli LLM di frontiera avevo raccontato numeri simili anche nel redesign di un sito con GPT-6 Astra.
Domande frequenti
Jev sostituisce ChatGPT o Claude?
No, e non ci prova. Jev non genera testo, quindi non lo usi per scrivere, programmare o chattare. Lo usi dentro il codice per decidere, classificare, assegnare punteggi e instradare, lasciando all'LLM solo la parte che richiede scrittura o ragionamento lungo.
Quanto costa Jev rispetto a un LLM?
Typesafe indica 0,042 dollari per milione di token in input, cioè 42 dollari per miliardo, con i token in output gratuiti. Gli LLM di frontiera costano tra 0,20 e 10 dollari per milione di token in input, con output circa 5 volte più caro. Nel mio test su 380 commenti la differenza misurata è stata di 52 volte a favore di Jev.
Jev può sbagliare?
Sì, come qualsiasi modello. Nei miei test l'accuratezza è stata dell'89%, che sale al 96% se considero solo le risposte in cui si dichiara sicuro. La probabilità che restituisce serve proprio a questo: imposti una soglia nel codice e mandi a revisione manuale tutto quello che resta sotto.
Funziona in italiano?
Non è ottimizzato per l'italiano, nasce sull'inglese. Nel test sui commenti del mio canale, scritti in italiano, i risultati sono stati comunque utilizzabili, ma se ci costruisci un sistema per un cliente conviene verificare l'accuratezza sul tuo dataset prima di andare in produzione.
Serve saper programmare per usarlo in Claude Code?
Non serve conoscere a memoria il formato delle richieste. Copi il prompt del quickstart in Claude Code, lui installa il plugin e legge la documentazione, tu inserisci la chiave API generata dalla console. Da quel punto in poi è Claude a scrivere le chiamate dentro i tuoi script.