Il blog sulla sicurezza di FireAI

Di FireAI Security & Research Team · Pubblicato

Jev e l'ascesa dei modelli decisionali: cosa significa l'intelligenza artificiale di System One per gli strumenti di sicurezza

Jev e l'ascesa dei modelli decisionali: cosa significa l'intelligenza artificiale di System One per gli strumenti di sicurezza

Il 25 settembre 2026, TypeSafe AI ha annunciato Jev, il primo modello in quella che chiama la categoria "System One": non un chatbot, e non semplicemente un modello linguistico più grande, ma quello che l'azienda descrive come un modello decisionale: qualcosa costruito per rispondere a una domanda delimitata con una risposta digitata e calibrata piuttosto che con un paragrafo di prosa. L'annuncio è denso di cifre specifiche, quindi questo articolo lo esamina esattamente come affermato, evidenzia chiaramente ciò che abbiamo potuto e non potuto verificare e analizza il motivo per cui vale la pena prendere sul serio l'idea di fondo, decidere invece di generare, per i software di sicurezza in particolare.

Ciò che TypeSafe ha effettivamente annunciato

TypeSafe AI viene fondata da Diogo Almeida, che scrive nell'annuncio che "In OpenAI ho contribuito a costruire i metodi che rendevano i modelli linguistici utili per seguire le istruzioni e parlare con le persone". Jev, definito il "primo modello pubblico" dell'azienda, è concepito come un lavoro completamente diverso: produrre ciò che TypeSafe chiama valori strutturati type-safe con probabilità calibrate e punteggi di confidenza, generati attraverso quello che chiama un campionatore parallelo anziché la solita decodifica token per token, e addestrato con un metodo che l'azienda chiama Reinforcement Learning for Calibrated Decisions, o RLCD.

  • TypeSafe riporta un tempo di risposta end-to-end di "70ms-500ms", rispetto a quello misurato come "da 3 a 329 secondi" per i modelli linguistici di frontiera con cui ha confrontato Jev.
  • TypeSafe valuta i token di input a "$ 0,042 / MTok", con i token di output elencati come gratuiti.
  • Nelle proprie valutazioni del flusso di lavoro, TypeSafe riporta che Jev funziona "193,6 volte più veloce, 444,6 volte più economico" rispetto alle policy rispetto alle quali è stato misurato.
  • TypeSafe descrive un errore di tipo nell'output di Jev come, nelle sue parole, "matematicamente impossibile".
  • Jev è in accesso anticipato; TypeSafe afferma che sta portando gli sviluppatori "fuori dalla lista d'attesa il più rapidamente possibile".

Generazione contro decisione

Gran parte di quella che viene chiamata "AI in produzione" non è affatto un compito di scrittura. Consenti o blocca una connessione. Incrementare o chiudere un ticket. Contrassegna o cancella una transazione. Instradare un messaggio a una coda o all'altra. Il risultato desiderato non è la prosa, è un'etichetta estratta da un breve elenco fisso, a volte con una partitura allegata. Eseguire questo tipo di domanda attraverso un modello costruito per produrre paragrafi fluenti è una mancata corrispondenza: ritorna un blob JSON che deve essere analizzato e sperato che sia valido, e qualsiasi confidenza dichiarata tende a significare poco in particolare, perché nulla lo obbliga a tenere traccia del reale tasso di errore del modello.

Vale la pena separare qui due affermazioni, perché non sono la stessa cosa: digitate e calibrate. Un output digitato vincola la forma della risposta: una domanda di "scelta" restituisce una delle opzioni nell'elenco, un "punteggio" restituisce un numero all'interno di un intervallo dichiarato, mai una frase vagante o un campo inventato. La calibrazione è un'idea molto più antica e completamente separata. È una proprietà statistica, non stilistica: significa che quando il sistema dichiara una probabilità di 0,62, è proprio così spesso in molte previsioni simili, quindi un programma a valle può effettivamente superare quel numero invece di trattarlo come decorazione.

La denominazione stessa di TypeSafe prende in prestito il suo vocabolario dalla psicologia piuttosto che dalle statistiche. Daniel Kahnemann, che ha ricevuto il Premio Nobel per le scienze economiche nel 2002 "per aver integrato le intuizioni della ricerca psicologica nella scienza economica, in particolare per quanto riguarda il giudizio umano e il processo decisionale in condizioni di incertezza", ha reso popolari i termini in Pensare, veloce e lento: "Sistema 1" è "veloce, automatico, frequente, emotivo, stereotipato, inconscio", mentre "Sistema 2" è "lento, faticoso, poco frequente, logico, calcolatore, cosciente". La metafora è evocativa, ma descrive la cognizione umana, non una garanzia su un pezzo di software. Un modello può essere veloce come lo è il Sistema 1, senza che la sua sicurezza dichiarata significhi nulla: la calibrazione deve essere guadagnata e misurata, non implicita in un nome.

Ciò che "non può avere allucinazioni" può e non può significare

L'affermazione di TypeSafe secondo cui un errore di tipo è "matematicamente impossibile" descrive la decodifica vincolata, una tecnica che già esiste altrove. La guida agli output strutturati di OpenAI fornisce una garanzia simile: la funzionalità, afferma, "assicura che il modello generi sempre risposte che aderiscono allo schema JSON fornito, quindi non devi preoccuparti che il modello ometta una chiave richiesta o abbia allucinazioni su un valore enum non valido." Questa garanzia è reale e utile. È anche più ristretto di quanto sembri: vincola la forma della risposta, non se la risposta sia giusta. Una domanda a "scelta" con tre opzioni restituirà sempre una delle tre, inclusa, se il modello ha valutato erroneamente l'input, una risposta sbagliata sicura, validamente digitata.

La calibrazione è il pezzo che deve essere controllato, non affermato. Lo strumento standard è un diagramma di affidabilità: previsioni per bucket in base alla confidenza dichiarata e per ciascun bucket tracciare la frequenza con cui tali previsioni si sono rivelate effettivamente corrette; lo spazio tra la diagonale e la linea osservata viene solitamente riassunto come errore di calibrazione previsto. Questa non è una domanda nuova per l'apprendimento automatico: Articolo del 2017 di Guo et al. "Sulla calibrazione delle reti neurali moderne" ha scoperto che "le moderne reti neurali... sono scarsamente calibrate" per impostazione predefinita e che una semplice correzione a parametro singolo chiamata ridimensionamento della temperatura era "sorprendentemente efficace" nel ripararlo. La lezione si generalizza oltre quell'articolo: la calibrazione non è una proprietà che un modello può annunciare su se stesso. È qualcosa che controlli, sui tuoi dati etichettati, perché tende a degradarsi esattamente dove ne hai più bisogno, su input che non assomigliano per niente a ciò su cui è stato sintonizzato il modello.

Un'imbracatura di valutazione minima (modello)

Prima di indirizzare una decisione reale attraverso qualsiasi modello decisionale, Jev o meno, tre domande contano più di qualsiasi figura del fornitore: la risposta digitata viene analizzata ogni volta rispetto al tuo schema, la confidenza dichiarata tiene traccia del suo tasso di successo reale su un campione etichettato dei tuoi dati e quella calibrazione sopravvive su input che differiscono da ciò che il modello ha già visto. Lo schizzo seguente è un modello costruito attorno alla forma della richiesta mostrata nella documentazione di avvio rapido di TypeSafe. Non fa alcuna affermazione su cosa mostrerebbe eseguirlo contro Jev: non l'abbiamo eseguito, e questo è uno pseudo-codice illustrativo, non un rapporto.

calibrazione_check.py: solo modello, non eseguito contro Jev
# Illustrative pseudo-code. Mirrors the request shape shown in TypeSafe's own
# quickstart docs (POST /v1/systemone with state, model, and typed questions).
# Not run against Jev or any live API; no results are claimed here.
import requests

def ask(state: str, question_id: str, question: dict) -> dict:
    resp = requests.post(
        "https://api.typesafe.ai/v1/systemone",
        headers={"Authorization": f"Bearer {API_KEY}"},
        json={"state": state, "model": "jev-latest", "questions": {question_id: question}},
    )
    return resp.json()["answers"][question_id]

# 1. Shape check: does every response parse against the declared type, on your
#    own edge cases, not just a vendor demo set?
# 2. Calibration check: bucket the stated confidence and compare it to the
#    true label rate, on data the model has never seen.
buckets = {i: {"n": 0, "correct": 0} for i in range(10)}
for state, true_label in labeled_sample:          # your own traffic, labeled by hand
    answer = ask(state, "decision", {"type": "noul", "instructions": "Should this be allowed?"})
    bucket = min(int(answer["noul"] * 10), 9)
    buckets[bucket]["n"] += 1
    buckets[bucket]["correct"] += int(round(answer["noul"]) == true_label)

for b, s in buckets.items():
    if s["n"]:
        stated = (b + 0.5) / 10
        observed = s["correct"] / s["n"]
        print(f"stated~{stated:.2f}  observed={observed:.2f}  n={s['n']}")  # the gap here is your calibration error
  • Se la risposta digitata analizza sempre gli input prodotti dal tuo sistema, non solo il set demo di un fornitore.
  • Se uno 0,9 dichiarato è corretto circa nove volte su dieci sul tuo traffico etichettato, non sul set di valutazione di qualcun altro.
  • Se quella calibrazione resiste a input diversi da qualsiasi cosa vista prima: una nuova app, un nuovo protocollo, un mittente che ha letto lo stesso annuncio che hai appena letto.
  • Cosa fa il chiamante in caso di timeout o interruzione, poiché un sistema decisionale necessita di un'impostazione predefinita sicura quando il modello decisionale è irraggiungibile.

Perché questo è importante per gli strumenti di sicurezza

Un firewall, un filtro antispam, un controllo antifrode, una coda di triage: ognuno di questi è un sistema decisionale, che risponde ripetutamente alla stessa forma di domanda: dato questo input, consentilo o bloccalo, con quanta sicurezza e dove si trova la soglia. La stessa pagina di valutazione di TypeSafe trae i suoi esempi proprio da questo territorio: giudicare se chiudere un avviso di sicurezza, inoltrarlo a una persona o contenerlo immediatamente è una decisione di triage, non un compito di scrittura, ed è il tipo di chiamata che uno strumento di sicurezza fa costantemente, a un volume che nessun analista potrebbe rivedere manualmente.

Confronto illustrativo, non trascrizione di alcun sistema reale.
Risposta LLM generativaDecisione digitata (stile Jev)
ProduzioneUn paragrafo che spiega il collegamento a un indirizzo sconosciuto su un porto insolito "potrebbe valere la pena di essere rivisto"{consenti: falso, confidenza: 0,81}
AnalisiRegex, o un secondo modello, per tirare fuori un'azione dalla prosaGarantito per corrispondere allo schema dichiarato
SogliaNessuna confidenza numerica da confrontare con una policyUn valore di confidenza su cui un chiamante può impostare direttamente la soglia
Modalità di fallimentoFluente, apparentemente plausibile e talvolta semplicemente sbagliatoSbagliato con un numero allegato, che un controllo di calibrazione può almeno individuare in media

Il compromesso sulla privacy, onestamente

Jev, come lo descrive TypeSafe, è un'API ospitata: una richiesta trasporta lo "stato", ovvero qualunque dato riguarda la domanda, ai server di TypeSafe su Internet. Per quanto riguarda gli esempi di incidenti di sicurezza e triage evidenziati da TypeSafe, quello stato è esattamente il tipo di informazioni che molte persone preferirebbero non fornire a terzi per impostazione predefinita: quale app sta comunicando con quale indirizzo, quanto spesso, da quale dispositivo. Inviarlo a qualsiasi modello cloud, per quanto veloce o economico, significa che i dati lasciano la macchina da cui provengono.

FireAI, il firewall macOS di HisnLabs, ha fatto la scelta opposta per l'esatta categoria di decisione di cui tratta questo articolo. FireAI funziona su macOS 14 o versioni successive su silicio Apple, per € 49 una tantum, e non è esplicitamente un antivirus e non è una VPN. Quando un'app che non hai mai visto prima tenta di raggiungere la rete, FireAI può eseguire un piccolo modello sul dispositivo stesso - un download opzionale da 1,5 GB - per verificare tale connessione e richiederti un motivo in linguaggio semplice allegato; il traffico esaminato non viene mai inviato da nessuna parte. Ognuna di queste decisioni assistite dall'intelligenza artificiale diventa una regola visibile, legata alla firma del codice dell'app, che puoi vedere e annullare, accanto ai feed delle minacce che vengono applicati localmente anziché interrogati su un server remoto.

Non stiamo affermando che il modello sul dispositivo di FireAI corrisponda a Jev, o a qualsiasi altro modello system-one, in termini di correttezza, velocità o prezzo: non abbiamo eseguito quel confronto e non abbiamo nostre valutazioni da pubblicare qui. Ciò che questo annuncio supporta è una direzione progettuale: che una decisione sulla sicurezza sia ben servita da un modello piccolo, veloce e delimitato che funziona vicino ai dati, piuttosto che instradarli attraverso un chatbot generico da qualche altra parte. TypeSafe sta affrontando questo problema dal lato API; FireAI si basa già su di esso dal lato del dispositivo, e per un motivo diverso: perché specificamente per un firewall, i dati in questione non dovrebbero affatto lasciare la macchina per essere giudicati.

Domande aperte

  • Valutazioni indipendenti: nessuna parte esterna ha ancora pubblicato una riproduzione dei multipli di velocità o di costo nell'annuncio di TypeSafe, su dati che TypeSafe non ha scelto.
  • Calibrazione in caso di spostamento della distribuzione: lo scenario esatto di cui parla l'articolo di Guo et al., e quello che conta di più contro un avversario che si adatta una volta che un metodo di difesa è pubblico.
  • Se il prezzo è valido per il volume di produzione reale e se la latenza dichiarata è valida in caso di carico sostenuto anziché di una singola richiesta dimostrata.
  • Come si comporta il modello in caso di input contraddittori o genuinamente ambigui, in cui una risposta digitata con sicurezza può essere meno onesta di una risposta che dice "poco chiaro".
  • Quando si apre l'accesso anticipato oltre la lista d'attesa, a chi e in quali termini per i dati inviati come "stato".

Per ora, Jev è una serie di affermazioni da parte di una squadra con credenziali reali e nessuna verifica esterna ancora. La categoria che sta cercando di nominare, modelli decisionali piuttosto che modelli di generazione, evidenzia una reale lacuna nel modo in cui finora i software di sicurezza sono stati realizzati per utilizzare l’intelligenza artificiale. Indipendentemente dal fatto che Jev stesso resista o meno ai test indipendenti, è utile ricordare che la domanda interessante per un firewall, un filtro antifrode o una coda di triage non è mai stata "può scrivere una frase convincente" ma "può prendere una decisione che può sostenere, abbastanza velocemente da avere importanza". Questa è la domanda che poniamo sul modello sul dispositivo all'interno di FuocoAI ogni volta che lo modifichiamo ed è per questo che, per noi, la risposta rimane sul dispositivo anziché diventare una richiesta all'API di qualcun altro.

Il ruolo di FireAI e di HisnLabs

We have not tested Jev and make no claim it works as described or that FireAI matches it in any way — but the idea that a security decision deserves a small, bounded, fast model instead of a paragraph from a chatbot is one we built FireAI around a year before TypeSafe wrote a blog post about it.

FireAI è il prodotto di HisnLabs: un firewall con IA che funziona direttamente sul Mac. Mostra in linguaggio chiaro ogni connessione che le tue app effettuano e ti lascia decidere cosa esce dal tuo Mac — la sua IA lavora in locale, quindi il tuo traffico non viene mai inviato a noi né a nessun altro. Il team di ricerca sulla sicurezza di HisnLabs è quello che mantiene affidabili queste decisioni: cataloga quali domini sono semplice telemetria e quali un servizio reale, traccia il Paese e la rete dietro una connessione e addestra il modello locale (la funzione Autopilot) su schemi di traffico reali, senza che nulla lasci il tuo Mac.

Puoi leggere le scelte tecniche che ci stanno dietro, oppure provare FireAI per 17 giorni, su FireAI, di HisnLabs.

Fonti