È un periodo particolarmente impegnativo per un CISO di un’organizzazione che opera nell’UE. Non solo deve fare i conti con le scadenze dell’ormai imminente EU AI Act, che sembrano continuare a cambiare, ma deve anche confrontarsi con le nuove risorse annunciate nell’ambito dell’EU Action Plan on Cybersecurity and Artificial Intelligence. Il fatto che si stia dedicando così tanta attenzione alla sicurezza dell’AI non è certo un aspetto negativo, ma si potrebbe sostenere che i team stiano lavorando per raggiungere gli obiettivi sbagliati. Si è infatti dato per scontato che, se l’AI aziendale è in grado di rispettare gli standard di compliance e di ottenere buoni risultati nei nuovi ambienti di test dedicati alla sicurezza, allora sia anche sicura. Ma, come abbiamo già visto con le precedenti normative in materia di cybersecurity, la conformità alle normative non equivale alla sicurezza operativa, tutt’altro.
In questo caso, il collegamento mancante che finora sia i regolatori sia le organizzazioni non sono riusciti a individuare, nonostante sia sotto gli occhi di tutti, sono i dati. Perché rispettare gli standard di compliance e ottenere buoni risultati in un ambiente di test sicuro per l’AI serve semplicemente a creare modelli tecnicamente sicuri. Ma nel momento in cui questi modelli vengono alimentati con dati ridondanti, obsoleti e banali (ROT), tutti i risultati ottenuti nei test vengono di fatto vanificati.
Tanto movimento, pochi risultati
Le ultime settimane sono state particolarmente turbolente sul fronte della regolamentazione dell’AI nell’UE. Per prima cosa, abbiamo assistito alla revisione delle scadenze previste dall’EU AI Act. In particolare, la principale scadenza per la conformità dei sistemi di AI impiegati in contesti ad alto rischio è stata posticipata da agosto 2026 a dicembre 2027, soprattutto perché gli standard tecnici di settore necessari per verificare la conformità non sono ancora pronti.
E appena poche settimane dopo l’annuncio di questo rinvio, l’UE ha pubblicato il Piano d’azione dell’UE per la cybersecurity e l’intelligenza artificiale, anche con l’obiettivo di colmare questa lacuna in materia di benchmark e valutazione della conformità. Invece di introdurre nuovi obblighi normativi, il piano promette l’accesso a nuove piattaforme di test sicure, framework di riferimento e strumenti di valutazione pre-market, tutti pensati per garantire che l’AI avanzata venga utilizzata in modo sicuro e nel rispetto delle normative europee, come l’AI Act e la direttiva NIS2.
Tutto questo contribuirà certamente a creare modelli di AI più sicuri, ma rappresenta solo un tassello del problema. I team di sicurezza possono, e probabilmente dovranno, dedicare innumerevoli ore all’analisi del codice e alla raccolta di tutte le evidenze necessarie per ottenere le certificazioni di conformità. Il rischio, però, è che in questo processo si perda di vista l’altra faccia dell’AI. Si può progettare uno strumento completamente sicuro by design e conforme alle normative, ma se viene utilizzato nel modo sbagliato può comunque portare a una violazione della compliance e provocare conseguenze anche molto serie.
Se consideriamo che, in un’azienda media, le identità non umane e gli agenti autonomi sono ormai 82 volte più numerosi dei dipendenti umani, è evidente che ci sia motivo di preoccuparsi. Il rischio operativo non riguarda più soltanto gli errori commessi dalle persone, ma anche quelli che si verificano alla velocità delle macchine. Un errore umano, nella maggior parte dei casi, verrebbe individuato e segnalato prima di provocare conseguenze catastrofiche. Con i modelli autonomi, invece, dati errati possono compromettere silenziosamente anche il modello più sicuro, alterandone gli output senza far scattare i consueti campanelli d’allarme. E tutto questo può accadere anche su sistemi perfettamente conformi dal punto di vista tecnico e normativo.
Essere conformi non significa essere sicuri
Con tutta l’attenzione concentrata sui modelli di AI, i dati aziendali sono finiti un po’ in secondo piano. E anche quando sono entrati nel dibattito, l’attenzione si è concentrata soprattutto sulla loro sicurezza, più che sulla loro qualità, finendo per aggravare ulteriormente il problema.
Oggi, quasi l’80% dei dati aziendali è costituito da dati non strutturati, con una grande quantità di file ROT al loro interno. Non è una situazione che si è creata da un giorno all’altro: è il risultato di decenni di accumulo nei sistemi di cloud storage legacy e rappresenta un vero e proprio veleno a lento rilascio per i modelli di AI.
Per quanto un modello possa essere sicuro dal punto di vista tecnico e per quanto possa aver superato brillantemente i test nei nuovi ambienti di valutazione dell’UE, alimentarlo con dati non strutturati contaminati da informazioni ridondanti, obsolete o prive di valore può compromettere tutto. Il modello potrebbe generare allucinazioni, prendere decisioni prive di senso, produrre analisi distorte e persino portare a violazioni della compliance, semplicemente perché sta lavorando su dati obsoleti o su record duplicati.
E questo non è l’unico costo che i dati non strutturati possono comportare. Gestire ed elaborare tutta questa mole di dati inutili, in gran parte duplicati, rappresenta una sorta di tassa invisibile sui budget aziendali: si sprecano costosi cicli di elaborazione delle GPU e si sostengono i costi di infrastrutture cloud dedicate all’indicizzazione di dati che non generano alcun valore concreto né un ritorno sull’investimento. Solo quest’anno, la spesa in conto capitale per l’AI dei principali colossi tecnologici ha superato i 650 miliardi di dollari, e chissà quanto potremmo arrivare a spendere tra un altro anno. Sebbene le normative dell’UE pongano grande attenzione ai costi legati alla sicurezza dell’AI, finora non hanno considerato adeguatamente il costo dei dati che stanno alla base dell’AI.
Controllare le fondamenta prima di iniziare a costruire
Naturalmente, questo non significa ignorare gli standard normativi per concentrarsi esclusivamente sui dati. Si tratta piuttosto di trovare un equilibrio tra i due aspetti, portando avanti i test e le certificazioni a livello di modello mentre si mette ordine nell’infrastruttura dei dati. Questo diventerà sempre più importante man mano che l’EU AI Act entrerà pienamente in vigore nei prossimi anni, introducendo per le organizzazioni l’obbligo di tracciare, documentare e verificare l’origine dei dataset utilizzati per l’addestramento e dei contenuti generati.
Le organizzazioni non devono soltanto effettuare un audit approfondito e classificare tutti i dati presenti nella propria infrastruttura, ma anche eliminare tutti quei dati ROT, così da creare una base pulita su cui i modelli di AI possano lavorare. Questo passaggio sarà fondamentale per abbandonare la logica degli audit di compliance statici e periodici e passare a un monitoraggio continuo della provenienza dei dati e della classificazione dei singoli record, indispensabile per garantire operazioni di AI realmente sicure. Tutte queste attività si riflettono direttamente sui modelli, contribuendo a creare sistemi conformi non solo dal punto di vista tecnico, ma anche da quello operativo.
E oltre alle sfide normative e operative che le organizzazioni devono affrontare oggi, una revisione su larga scala dell’infrastruttura dei dati può portare benefici anche in futuro. Man mano che ci avviciniamo a un mondo sempre più autonomo e gli agenti diventano una presenza sempre più costante nei workflow aziendali, avere una visione precisa del livello dei dati sarà fondamentale per isolare e correggere gli input errati con il minimo impatto sulle operazioni. Anziché bloccare l’intera attività, i team potranno intervenire a livello del singolo record per individuare e correggere gli errori. Le organizzazioni che si muoveranno oggi in questa direzione saranno quindi anche quelle che in futuro potranno affrontare le situazioni con meno interruzioni operative.
Guardare avanti, senza dimenticare di guardare indietro — o meglio, in basso
È giusto destinare risorse significative al rispetto delle scadenze di compliance dell’UE e sfruttare al meglio le funzionalità di sandbox promesse, ma senza trascurare i dati alla base dei propri modelli. Alla domanda “Il nostro modello di AI è sicuro?” deve quindi seguirne un’altra: “I dati che alimentano il nostro modello sono verificati, accurati e puliti?”.
Perché una certificazione di compliance o un certificato ottenuto attraverso i test dell’UE rischia di essere soltanto un costoso pezzo di carta se il modello viene poi alimentato con dati obsoleti o corrotti. Queste sandbox per la compliance possono sembrare una soluzione interessante, ma la vera sicurezza dell’AI non si ottiene attraverso i test: si costruisce attraverso il lavoro continuo e meno appariscente necessario a mantenere pulita la pipeline dei dati. Potrebbe non essere particolarmente glamour, ma è efficace.


