Joey Victorino
Capacità
Valutazione sicurezza IA
Responsabile
Joey Victorino — condotto personalmente
Fondamento
Ambito scritto · prima del lancio, prima di un'operazione o dopo un incidente · il sistema in produzione, non la demo

Una valutazione di sicurezza IA del sistema che ha rilasciato, non di quello nella presentazione.

Un'applicazione LLM, un agente o una pipeline di retrieval è in produzione o sta per andarci, e nessuno di indipendente ha verificato cosa fa quando l'input è ostile. Lo metto alla prova, leggo l'architettura sottostante e scrivo cosa ha retto e cosa no.

Cosa faccio

Prompt injection e OWASP LLM Top 10Prompt injection diretta e indiretta tramite input dell'utente, documenti recuperati, risultati degli strumenti, email e contenuti web, oltre al resto della OWASP Top 10 for LLM Applications: gestione insicura dell'output, divulgazione di informazioni sensibili, agency eccessiva, supply chain e denial of service. Ogni risultato è riprodotto sul sistema in esecuzione, non descritto a partire dal progetto.
Esposizione agentica e MCPCosa può raggiungere l'agente, e cosa un attaccante può fargli fare. Inventari degli strumenti, fiducia e autenticazione dei server MCP, perimetrazione dei permessi, percorsi confused-deputy, e se un input avvelenato può trasformare una lettura in una scrittura, o una scrittura in un'esfiltrazione.
Retrieval, provenienza di dati e modelliSe il retrieval applica i permessi di chi pone la domanda o quelli dell'account di servizio che ha indicizzato il corpus. Da dove provengono i dati di addestramento e fine-tuning, da dove provengono i pesi e come sono verificati, e cosa il sistema è autorizzato a inviare all'esterno, a chi, e se qualcuno se ne accorgerebbe.
Efficacia di guardrail e monitoraggioVerifica dei controlli che il fornitore dice di avere. Filtri di input e output, classificatori, limiti di frequenza, logging e alerting, giudicati in base al fatto che abbiano intercettato gli attacchi che ho eseguito e che la loro traccia sarebbe stata notata.

A chi si rivolge

CISO, general counsel e product owner responsabili di un sistema LLM che tocca dati dei clienti, documenti interni o strumenti con effetti collaterali, che hanno bisogno di una risposta prima del lancio, prima di una security review di un cliente o prima che un regolatore la chieda. Investitori e acquirenti che hanno bisogno che il prodotto IA venga verificato prima di essere prezzato, come estensione della due diligence tecnica. Consigli di amministrazione e legali che si preparano all'AI Act dell'UE, dove gli obblighi per i sistemi ad alto rischio e per finalità generali dipendono da gestione del rischio documentata, governance dei dati, logging e supervisione umana, e dove una valutazione indipendente è l'evidenza che questi esistono, non una policy che dice che dovrebbero esistere.

L'ambito è il sistema così come è distribuito: prompt injection in ogni percorso di consegna, la OWASP LLM Top 10, esposizione agentica e MCP, provenienza di modelli e dati, applicazione dei permessi nel retrieval, efficacia di guardrail e monitoraggio, ed egress. È distinto dalla costruzione di un ambiente di IA privata, che è un servizio separato, e dal red teaming dell'infrastruttura circostante, che definirò separatamente se la valutazione mostra che è necessario. Costruisco e metto in sicurezza questa classe di sistemi nel mio lavoro operativo, quindi i risultati sono verificati rispetto a come questi sistemi si comportano in produzione.

Quando non ingaggiarmi

Non mi ingaggi per una casella da spuntare. Se ciò che le serve è un questionario per fornitori compilato o un certificato da allegare a una presentazione commerciale, ci sono modi più economici per ottenerlo e il risultato non cambierà ciò che il sistema fa. Non vendo né rivendo prodotti di sicurezza IA, quindi non ne raccomanderò uno come soluzione. Non sono la scelta giusta per la valutazione benchmark della qualità di un modello, né per un sistema che non mi è permesso attaccare in un ambiente rappresentativo, perché una valutazione condotta su una copia sanificata le dice qualcosa della copia. Se il sistema è un prototipo che nessuno ha deciso di rilasciare, aspetti, e faccia valutare la cosa di cui sarà responsabile.

Cosa ottiene

Un elenco di ciò che sono riuscito a far fare al sistema e che non avrebbe dovuto fare, con i passaggi per riprodurlo, la ragione architetturale per cui ha funzionato e una classificazione in base a quanto le costerebbe se lo scoprisse qualcun altro. Accanto, una dichiarazione dei controlli che hanno retto al test, così sa su cosa può contare e su cosa no. I risultati sono scritti per il dirigente che approva e per l'ingegnere che deve correggerli, in un unico documento, con la correzione che funziona in produzione anziché una raccomandazione di policy. Una persona con nome e cognome ha eseguito i test, letto l'architettura e firma la conclusione.

Arriva come conclusione scritta nel formato del memorandum di esempio: la domanda, le evidenze esaminate, le ipotesi su cui poggia, i risultati, le incognite e cosa fare dopo.

Domande frequenti

Cos'è una valutazione di sicurezza IA?

Un test indipendente di un sistema IA o LLM rispetto ai modi in cui può essere abusato: prompt injection, fuga di dati, agency eccessiva tramite strumenti e agenti, retrieval che ignora i permessi sui documenti e guardrail che non tengono. Legge l'architettura e attacca il sistema in esecuzione, poi riferisce cosa ha funzionato, cosa ha retto e cosa cambiare.

Quanto costa una valutazione di sicurezza IA?

Gli incarichi vengono definiti e quotati per iscritto dopo una breve chiamata di inquadramento. L'ambito dipende dal numero di modelli, strumenti e fonti di dati coinvolti e dal fatto che il sistema sia agentico o meno. Mi contatti con una descrizione del sistema e la data entro cui le serve la risposta, e risponderò con un ambito scritto.

È la stessa cosa del red teaming LLM o di un penetration test?

Si sovrappone a entrambi e non è nessuno dei due. Un penetration test prende di mira l'infrastruttura. Il red teaming LLM spesso si ferma al modello. Questa valutazione verifica l'intero sistema così come è distribuito: il modello, i prompt, il livello di retrieval, gli strumenti e i server MCP che l'agente può richiamare, i guardrail e i percorsi di egress, rispetto alla OWASP LLM Top 10 e oltre.

Letture correlate