Il tuo agente sa dire "non so"?

Il 15 settembre 2026 TypeSafe AI ha rilasciato Jev, un modello che non scrive: decide, e restituisce una probabilità calibrata insieme alla decisione. Fra le opzioni può dire "non so". Il concetto che ne esce — confidenza calibrata, soglia, escalation — è architettura, non prodotto: cambia il modo in cui un'azienda decide quando fermare l'agente e chiamare una persona.

BlueSky Agent AI ·

Il tuo agente sa dire non so? Confidenza calibrata, soglia ed escalation

Il 15 settembre 2026 TypeSafe AI, fondata da Diogo Almeida (co-autore di InstructGPT, il lavoro che ha trasformato GPT-3 in ChatGPT), ha rilasciato Jev. Non è un chatbot. Restituisce decisioni strutturate: un booleano, un punteggio, una scelta dentro un insieme chiuso. E insieme alla decisione restituisce una probabilità calibrata, cioè un numero che dice quanto quella decisione è affidabile.

Fra le opzioni che può restituire c'è "non so".

Questo dettaglio, più dei benchmark, è la ragione per cui vale la pena parlarne a chi gestisce un'azienda. Perché descrive la differenza fra un sistema che produce testo e un sistema di cui ci si può fidare abbastanza da lasciarlo lavorare da solo.

Cosa ha annunciato TypeSafe, e con quale grado di certezza

Partiamo dai numeri, e da quanto valgono. TypeSafe dichiara che su flussi specifici Jev è 193,6 volte più veloce e 444,6 volte più economico degli LLM attuali, con token di input a 0,042 dollari per milione e output gratuiti. Le dimostrazioni mostrate vanno dallo screening di curricula al web scraping, da un bot che gioca a Minecraft per un centesimo ogni due minuti a una guida autonoma ricostruita in meno di un'ora.

Sono tutti numeri del fornitore. Al 21 settembre 2026 non esiste una verifica indipendente, e vanno citati come dichiarazioni di TypeSafe, non come dato acquisito. Lo scriviamo perché il pezzo funziona lo stesso senza crederci: quello che conta è l'idea architetturale, che è vecchia e solida.

Perché un LLM è sicuro di sé anche quando sbaglia

Un LLM di uso generale è addestrato sulle preferenze umane: fra due risposte, il sistema impara a produrre quella che una persona avrebbe preferito leggere. Il risultato è un modello che scrive bene, e che scrive bene anche quando i fatti sono sbagliati. La sicurezza espositiva è il prodotto dell'addestramento, non una misura dell'affidabilità.

Da qui vengono due difetti noti. Il mode dropping: il modello converge su una risposta tipica e perde le alternative. E la sovra-confidenza: il tono resta identico fra una risposta che il modello "sa" e una che sta ricostruendo.

Per un testo da rileggere è un problema gestibile. Per un agente che decide se approvare una pratica, se un documento è completo, se un fornitore rientra nei parametri, è il problema centrale. Non c'è nessun segnale che distingua il caso facile da quello al limite, quindi o si controlla tutto o non si controlla niente. È la ragione per cui, secondo l'inchiesta Fortune del 16 settembre, l'87% dei responsabili tecnici ricontrolla a mano il contesto degli agenti.

La soglia, e cosa cambia nell'organizzazione

Un modello ottimizzato per l'automazione lavora diversamente. Restituisce una decisione e un numero associato, e quel numero ha un significato statistico: se dice 0,7, su cento casi simili ne azzeccherà circa settanta. A quel punto in azienda si può scrivere una regola.

Sopra una certa soglia l'agente procede da solo. Sotto, si ferma e passa la pratica a una persona.

Sembra banale. Cambia tre cose concrete.

La prima è che l'escalation diventa numerica e non caratteriale. Oggi, nella maggior parte delle aziende che hanno messo in produzione un assistente, la regola è "se ti sembra strano chiedi", e dipende da chi è di turno. Una soglia è la stessa per tutti e si può alzare o abbassare con una decisione esplicita.

La seconda è che la soglia diventa una manopola di rischio governabile. Su una pratica da 300 euro si accetta più margine di errore che su una da 30.000. La stessa procedura, due soglie.

La terza riguarda il conto economico. Se si sa quanti casi finiscono sotto soglia, si sa quante ore di lavoro umano serviranno. Il costo dell'automazione smette di essere il costo dei token e diventa il costo per decisione, che include il costo del controllo. È l'unica forma in cui un direttore finanziario può confrontare due fornitori.

Dove sta la soglia nella piattaforma BlueSky

Il concetto non dipende da Jev. In BlueSky Agent AI la logica di soglia è già dentro il prodotto, su tre piani diversi.

I guardrail si configurano per singolo agent: rilevamento delle risposte non verificate con un punteggio di confidenza impostabile, rilevamento dei tentativi di aggiramento con una soglia propria, trattamento dei dati personali con mascheramento o blocco. Sono numeri che il cliente decide, non impostazioni nascoste.

Le azioni sensibili richiedono un'autorizzazione esplicita prima di partire, indipendentemente da quanto l'agent sia sicuro di sé. La soglia governa quando fermarsi a chiedere; questa regola governa cosa non si fa mai senza chiedere.

Il motore di autoapprendimento assegna a ogni piano di miglioramento un livello di rischio dichiarato, e in modalità "solo report" non applica nulla: propone, e una persona sceglie. Anche qui la decisione di quanto rischio accettare resta scritta da qualche parte.

ModelMatch™ lavora sul costo per decisione: sceglie quale modello impiegare per ciascun nodo del processo, perché la fase che deve ragionare e quella che deve solo riformulare non hanno bisogno dello stesso motore. Il consumo si legge in BlueSky Credit, quindi il confronto fra una configurazione e l'altra è fatto sulla stessa unità.

Il limite, detto per intero

Un rilevatore di risposte non verificate montato sopra un LLM non è la stessa cosa di un modello addestrato a produrre probabilità calibrate. Nel primo caso il numero è la stima di un secondo sistema su un output già prodotto; nel secondo il numero nasce insieme alla decisione. Sono due qualità di segnale diverse, e chiunque dica il contrario sta vendendo.

Quello che possiamo dire con onestà è che la struttura organizzativa (soglia, escalation, chi guarda cosa) si costruisce già oggi, e che il giorno in cui modelli di questo tipo saranno maturi e verificati da terzi, chi ha già la struttura li innesta, e chi non ce l'ha ricomincia dall'inizio.

Aggiungiamo un secondo limite, che riguarda Jev e non noi. Un modello che decide su un insieme chiuso di opzioni è utilissimo dove le opzioni sono chiuse davvero. Molti processi aziendali italiani non lo sono: la risposta giusta è "dipende, chiedi al responsabile di area", e nessuna calibrazione la produce.

In sintesi

  • TypeSafe AI ha rilasciato Jev il 15 settembre 2026: restituisce decisioni strutturate con una probabilità calibrata, e può rispondere "non so".
  • I numeri di velocità e costo (193,6× e 444,6×) sono dichiarati dal fornitore e al 21 settembre non hanno verifica indipendente.
  • Un LLM generalista è addestrato sulle preferenze umane, quindi risulta convincente anche quando sbaglia. Per un agente che decide, questo è il problema principale.
  • Una soglia di confidenza trasforma l'escalation da regola caratteriale a regola numerica, rende il rischio governabile per tipo di pratica e permette di calcolare il costo per decisione.
  • In BlueSky Agent AI la soglia esiste già nei guardrail per agent, nell'autorizzazione obbligatoria sulle azioni sensibili e nel livello di rischio dei piani di autoapprendimento. Non è confidenza calibrata nel senso stretto, e lo distinguiamo.

Il tuo agente sa dire "non so"? — BlueSky Agent AI