# Ricercatori dell’UNSW rilevano che modelli linguistici indotti a imitare testi da ubriachi rivelano più segreti e assecondano più richieste dannose

> Uno studio dell’UNSW Sydney riferisce che l’ottimizzazione di GPT-4 su testi da ubriachi ha portato la propensione a rivelare segreti dal 6 al 75 per cento e la conformità a richieste dannose al 41 per cento.

FireAI Security & Research Team (HisnLabs) · Published 2026-09-30
Canonical: https://hisnlabs.com/it/news/unsw-drunk-ai-models-reveal-secrets-jailbreak-research

Ricercatori dell’UNSW Sydney riferiscono che i modelli linguistici indotti a imitare una scrittura in stato di ebbrezza diventano più propensi a rivelare informazioni riservate e ad assecondare richieste dannose, [ha riferito Help Net Security](https://www.helpnetsecurity.com/2026/09/28/drunk-ai-models-jailbreak-research/) il 28 settembre 2026. Lo studio, di Anudeex Shetty, Aditya Joshi e Salil Kanhere, s’intitola «In Vino Veritas and Vulnerabilities» [[1]](https://www.helpnetsecurity.com/2026/09/28/drunk-ai-models-jailbreak-research/).

## Contesto

I chatbot sono addestrati a rifiutare richieste di contenuti dannosi e a mantenere privato il materiale riservato. I ricercatori mettono alla prova queste protezioni con i jailbreak, cioè input che inducono un modello a ignorarle. Lo studio dell’UNSW pone una domanda diversa: se cambiare lo stile di scrittura di un modello, qui per imitare l’ubriachezza, cambi la tenuta delle protezioni.

## Che cosa descrive il resoconto

Il gruppo ha usato tre metodi per indurre il comportamento. Il primo era un prompt che diceva al modello di rispondere come una persona ubriaca che scrive messaggi. Il secondo era un fine-tuning su oltre 57.000 messaggi tratti dal forum r/drunk e dal sito Texts From Last Night. Il terzo era un apprendimento per rinforzo che premiava un output simile a quello di un ubriaco. I modelli testati erano GPT-3.5, GPT-4, Llama 2, Llama 3.1 e Mistral [[1]](https://www.helpnetsecurity.com/2026/09/28/drunk-ai-models-jailbreak-research/).

In una suite di test sulla riservatezza chiamata ConfAIde, la propensione di GPT-4 a rivelare segreti è salita dal 6 per cento nella forma originale al 54 per cento quando gli veniva chiesto di comportarsi da ubriaco e al 75 per cento dopo il fine-tuning. In una suite di test su richieste dannose chiamata JailbreakBench, GPT-4 ottimizzato su testi da ubriachi ha assecondato il 41 per cento delle richieste, contro il 21 per cento quando era solo sollecitato con il prompt. Mistral ne ha assecondato il 90 per cento quando sollecitato [[1]](https://www.helpnetsecurity.com/2026/09/28/drunk-ai-models-jailbreak-research/).

L’articolo afferma inoltre che le difese esistenti contro i jailbreak sono state in parte inefficaci contro i modelli ottimizzati [[1]](https://www.helpnetsecurity.com/2026/09/28/drunk-ai-models-jailbreak-research/). Le percentuali sono i risultati dei ricercatori su quelle specifiche suite di test e non misurano la frequenza con cui un chatbot in uso fa trapelare i dati di una persona.

> FireAI, il firewall on-device per macOS sviluppato da HisnLabs, include un modello di IA opzionale che gira sul Mac stesso, quindi le domande rivolte ad esso non vengono inviate a un servizio cloud. È disponibile una prova di 17 giorni. [Download FireAI for Mac](https://hisnlabs.com/en/download)

## Implicazioni per chi usa un Mac

Lo studio non descrive un attacco che una persona possa subire usando un normale chatbot. La sua rilevanza pratica riguarda chi ottimizza o esegue modelli modificati in locale, poiché i risultati suggeriscono che un fine-tuning orientato allo stile possa indebolire le protezioni come effetto collaterale. Questa è un’inferenza dai risultati e l’articolo non verifica configurazioni locali su Mac [[1]](https://www.helpnetsecurity.com/2026/09/28/drunk-ai-models-jailbreak-research/). È anche un promemoria che i segreti digitati in qualsiasi chatbot dipendono dal giudizio del modello per restare privati.

## Raccomandazioni

1. Non digitare password, chiavi o documenti riservati in un chatbot, qualunque protezione il suo fornitore descriva.
2. Quando si ottimizza un modello, ripetere un test di sicurezza dopo l’addestramento, non solo un test di qualità.
3. Preferire un modello che gira sul Mac per i testi sensibili e verificare quale accesso alla rete richiede l’app.
4. Considerare il rifiuto di un chatbot un controllo debole, non una garanzia.

## Rilevanza per FireAI

FireAI non verifica i modelli rispetto ai jailbreak. Ask FireAI e FireAI Pilot usano un piccolo [modello on-device](https://hisnlabs.com/it/docs/on-device-ai-model) che gira sul Mac e viene scaricato solo se l’utente lo sceglie, e Ask FireAI mostra una regola da approvare prima che qualcosa cambi. FireAI è un firewall di rete, quindi può mostrare se un’app del Mac si connette all’esterno quando una persona usa un chatbot, il che è una questione distinta da ciò che il modello dice.

> Tenere un modello in locale mantiene i suoi prompt sul Mac. FireAI esegue il suo assistente sul dispositivo e chiede conferma prima che un’app si connetta. Provalo gratis per 17 giorni. [Download FireAI for Mac](https://hisnlabs.com/en/download)

## Limiti

I risultati provengono da un unico studio, riassunto da un solo articolo. I modelli testati comprendono alcuni meno recenti e l’articolo non dice se i modelli attuali si comportino allo stesso modo. In questo resoconto lo studio non è stato descritto come sottoposto a revisione paritaria.

Prova [FireAI, di HisnLabs](https://hisnlabs.com/it/download) gratis per 17 giorni.

## Sources

- [Help Net Security, 28 September 2026: “Drunk” AI is terrible at keeping secrets](https://www.helpnetsecurity.com/2026/09/28/drunk-ai-models-jailbreak-research/)
