Le AI hallucination generano falsi positivi e falsi negativi nei sistemi di sicurezza. Scopri perché sono un rischio per la cybersecurity.

L’intelligenza artificiale è entrata ormai negli strumenti di sicurezza, finendo per coprire diversi compiti prima riservati esclusivamente agli esperti. Analisi dei log, rilevazione delle anomalie, gestione degli incidenti e anche supporto ai SOC. Indubbiamente, questa integrazione porta grandi vantaggi per chi lavora nel settore, ma finisce per introdurre inesorabilmente anche un rischio di non poco conto: le allucinazioni.

  1. Cos’è un’hallucination
  2. I rischi dell’hallucination
  3. Strategie per ridurre l’AI hallucination
ai hallucination immagine

Si tratta di errori generativi intrinsechi al modello stesso, che ha serie ripercussioni sul suo operato. Nel contesto della cybersecurity è facile comprendere che un dato inventato, o un’interpretazione errata si traducono automaticamente in falsi allarmi e scelte operative basate su informazioni non affidabili. La credenza comune vuole che questo sia un problema futuro. In realtà, questo già accade in tutti i sistemi che utilizzano modelli linguistici o algoritmi predittivi per automatizzare parte del lavoro. Ecco perché bisogna comprendere i limiti dell’IA generativa e il modo in cui questi influenzano processi critici di sicurezza.

In questo articolo affronteremo da vicino il rischio dell’hallucination degli LLM, da cosa deriva e come lo si può riconoscere prima di validare un’informazione.

Cos’è un’hallucination

Come anticipato in fase di introduzione, le allucinazioni (hallucinations) sono errori generativi interni al modello linguistico di grandi dimensioni (LLM). Il modello produce informazioni inventate e fuori contesto con assoluta certezza. Ciò accade quando l’algoritmo interpreta male i dati di partenza, o completa gli spazi vuoti nelle informazioni che ottiene con informazioni plausibili, ma false. Si tratta, a conti fatti, di un limite vero e proprio nella struttura stessa dei modelli.

Finché si resta confinati a contesti creativi privati, in cui la revisione finale di un testo è affidata a un essere umano, le hallucinations sono facilmente individuabili e correggibili in tempo. Il discorso è diverso se un errore del genere si presenta in strumenti usati per analizzare log, segnali di rete o indicatori di minaccia, le conseguenze sono a dir poco serie. Questo perché una singola hallucination causa falsi positivi, che saturano i team con allarmi irrilevanti, o falsi negativi, che nascondono attività realmente dannose. In entrambi i casi l’efficacia del sistema di rilevazione viene compromessa.

Da qui è facile capire che se un modello linguistico esagera, inventa correlazioni inesistenti, o fraintende l’intero contesto operativo, analisti e SOC prendono decisioni su basi non veritiere. Ciò mina enormemente l’affidabilità dei sistemi di difesa basati su IA, proprio perché l’informazione ottenuta non è attendibile. Il risultato dinale è un aumento dei costi, perdita di fiducia negli strumenti e un’esposizione maggiore agli attacchi.

I rischi dell’hallucination

Quando un sistema difensivo AI-driven commette un errore di valutazione, questo si ripercuote su tutte le fasi operative del team di sicurezza. La priorità assegnata ai vari alert finisce per essere distorta, con attività innocue che assumono la massima priorità, mentre i segnali più importanti passano in secondo piano. Allo stesso modo, nei processi di validazione l’IA può ignorare indicatori di compromissione importanti, ritardando l’identificazione di attacchi già in corso.

Gli errori da hallucination si manifestano anche nelle attività di automazione. Infatti, modelli poco accurati possono generare script incompleti o insicuri, con la conseguenza di introdurre nuove vulnerabilità. Anche le logiche di rilevamento delle minacce ne sono vittima, proprio perché influenzate da presupposti errati. Il risultato è che il modello finisce per creare una serie di regole che non intercettano minacce critiche.

Non ne sono esclusi nemmeno i suggerimenti legati alla mitigazione, in quanto un’hallucination porta l’IA a proporre interventi inadatti allo stato reale dei sistemi analizzati. In questo caso, il rischio è quello di rallentare, o addirittura complicare ulteriormente la risposta.
Ma attenzione: qui è doveroso porre un punto fermo. Sebbene questi siano rischi più comuni di quanto si possa credere, essi non annullano il valore dell’IA, ma impongono la condizione di dover controllare e verificare manualmente gli strumenti in uso. L’affidabilità finale dipende sempre dalla supervisione umana.

Strategie per ridurre l’hallucinations

Secondo diversi esperti del settore, tra cui Chetan Conikee, CTO di Qwiet AI, le hallucinations sono il risultato naturale del funzionamento probabilistico dei modelli linguistici. Per questo l’obiettivo non può essere eliminarle, ma limitarne l’impatto attraverso un uso più controllato dell’IA nei processi di sicurezza.

Il primo passo è progettare sistemi in cui i modelli non agiscono mai da soli. Input e output devono essere verificati da componenti intermedi, come controlli deterministici, filtri specifici per dominio o policy aziendali. Questi sono essenziali, poiché impediscono al modello di produrre risposte fuori contesto. In questo modo si mantiene un perimetro chiaro attorno alle attività che l’IA può svolgere.

Un secondo elemento riguarda la tracciabilità. Ogni risposta dell’IA dovrebbe includere metadati su modello, contesto e data di generazione. Questo consente di capire rapidamente cosa è successo in caso di errore e riduce il rischio di integrare nei processi operativi risultati non verificati. Di sicuro il metodo più efficace per ridurre il rischio di un’hallucination è ricorrere alla RAG (Retrieval-Augmented Generation). Il modello si basa su una conoscenza interna verificata, permettendogli di ancorarsi a informazioni affidabili, riducendo la creatività non richiesta e mantenendo coerenza con gli standard aziendali.

Il testing ha un ruolo altrettanto importante. Infatti, prima di portare un modello in produzione, è necessario definire soglie di rischio accettabili, verificare il comportamento del sistema in condizioni insolite e integrare strumenti che rilevino errori generativi in fase di prova. Tutte queste strategie possono funzionare solo se accompagnate dalla supervisione umana. Le decisioni finali devono restare nelle mani di chi conosce i sistemi e le minacce. La formazione dei team, la comprensione dei limiti dell’IA e l’adozione di strumenti che verificano la coerenza dei risultati sono condizioni necessarie per evitare errori gravi.

Solo così l’IA può diventare realmente utile, senza trasformarsi in una fonte di vulnerabilità.



    Dichiaro di aver letto e compreso l'Informativa sul trattamento dei dati