- Capacidad
- Evaluación de seguridad de IA
- Responsable
- Joey Victorino — dirigido personalmente
- Fundamento
- Alcance escrito · antes del lanzamiento, antes de una operación o después de un incidente · el sistema en producción, no la demo
- Contacto
- joey@victori.no
Una evaluación de seguridad de IA del sistema que ha desplegado, no del de la presentación.
Una aplicación LLM, un agente o una canalización de recuperación está en producción o a punto de estarlo, y nadie independiente ha probado qué hace cuando la entrada es hostil. Yo lo pruebo, leo la arquitectura que hay detrás y dejo por escrito qué resistió y qué no.
Qué hago
A quién va dirigido
CISO, abogados de empresa y responsables de producto que responden de un sistema LLM que toca datos de clientes, documentos internos o herramientas con efectos secundarios, y que necesitan una respuesta antes del lanzamiento, antes de una revisión de seguridad de un cliente o antes de que pregunte un regulador. Inversores y compradores que necesitan que el producto de IA se pruebe antes de ponerle precio, como extensión de la diligencia debida técnica. Consejos de administración y abogados que se preparan para el Reglamento de IA de la UE, donde las obligaciones para los sistemas de alto riesgo y de propósito general dependen de una gestión de riesgos documentada, gobernanza de datos, registro y supervisión humana, y donde una evaluación independiente es la evidencia de que existen, y no una política que dice que deberían existir.
El alcance es el sistema tal como está desplegado: inyección de prompts por todas las vías de entrega, el OWASP LLM Top 10, exposición agéntica y de MCP, procedencia de modelos y datos, aplicación de permisos en la recuperación, eficacia de guardarraíles y monitorización, y salida de datos. Es distinto de construir un entorno de IA privada, que es un servicio aparte, y del red teaming de la infraestructura circundante, que delimitaré por separado si la evaluación muestra que es necesario. Construyo y aseguro esta clase de sistemas en mi propio trabajo operativo, de modo que los hallazgos se contrastan con cómo se comportan estos sistemas en producción.
Cuándo no contratarme
No me contrate para marcar una casilla. Si lo que necesita es rellenar un cuestionario de proveedor o un certificado que adjuntar a una presentación comercial, hay formas más baratas de conseguirlo y el resultado no cambiará lo que hace el sistema. No vendo ni revendo productos de seguridad de IA, así que no recomendaré uno como solución. No soy la elección adecuada para la evaluación comparativa de la calidad de un modelo, ni para un sistema que no se me permita atacar en un entorno representativo, porque una evaluación realizada sobre una copia saneada le habla de la copia. Si el sistema es un prototipo que nadie ha decidido lanzar, espere, y evalúe aquello de lo que va a tener que responder.
Qué recibe
Una lista de lo que conseguí que hiciera el sistema y que no debería haber hecho, con los pasos de reproducción, el motivo arquitectónico por el que funcionó y una clasificación según lo que le costaría si lo encontrara otra persona. Junto a ella, una declaración de los controles que resistieron la prueba, para que sepa de qué puede fiarse y de qué no. Los hallazgos están escritos para el directivo que da el visto bueno y para el ingeniero que tiene que corregirlos, en un único documento, con la solución que funciona en producción y no con una recomendación de política. Una única persona con nombre ejecutó las pruebas, leyó la arquitectura y firma la conclusión.
Llega como una conclusión escrita en el formato del memorando de muestra: la pregunta, la evidencia revisada, los supuestos en que se apoya, los hallazgos, las incógnitas y qué hacer a continuación.
Preguntas habituales
¿Qué es una evaluación de seguridad de IA?
Una prueba independiente de un sistema de IA o LLM frente a las formas en que puede ser objeto de abuso: inyección de prompts, fuga de datos, agencia excesiva a través de herramientas y agentes, recuperación que ignora los permisos de los documentos y guardarraíles que no aguantan. Lee la arquitectura y ataca el sistema en funcionamiento, y después informa de qué funcionó, qué resistió y qué cambiar.
¿Cuánto cuesta una evaluación de seguridad de IA?
Los encargos se delimitan y se presupuestan por escrito tras una breve llamada de alcance. El alcance depende del número de modelos, herramientas y fuentes de datos implicados y de si el sistema es agéntico. Contacte conmigo con un esquema del sistema y la fecha en que necesita la respuesta, y contestaré con un alcance escrito.
¿Es lo mismo que un red teaming de LLM o un test de penetración?
Se solapa con ambos y no es ninguno de los dos. Un test de penetración se dirige a la infraestructura. El red teaming de LLM suele detenerse en el modelo. Esta evaluación prueba el sistema completo tal como está desplegado: el modelo, los prompts, la capa de recuperación, las herramientas y los servidores MCP que el agente puede invocar, los guardarraíles y las rutas de salida de datos, frente al OWASP LLM Top 10 y más allá.