- Направление
- Оценка безопасности ИИ
- Ведущий
- Joey Victorino — личное ведение
- Основание
- Письменный объём · до запуска, до сделки или после инцидента · система в промышленной эксплуатации, а не демонстрация
- Контакты
- joey@victori.no
Оценка безопасности той ИИ-системы, которую Вы выпустили, а не той, что в презентации.
Приложение на базе LLM, агент или конвейер поиска уже в промышленной эксплуатации или вот-вот будет, и никто независимый не проверял, что он делает при враждебном вводе. Я тестирую его, изучаю стоящую за ним архитектуру и письменно фиксирую, что выдержало, а что нет.
Что я делаю
Для кого
CISO, главные юрисконсульты и владельцы продуктов, отвечающие за систему на базе LLM, которая работает с данными клиентов, внутренними документами или инструментами с побочными эффектами, и которым нужен ответ до запуска, до проверки безопасности со стороны заказчика или до вопроса регулятора. Инвесторы и приобретатели, которым нужно протестировать ИИ-продукт до его оценки, как расширение технической due diligence. Советы директоров и юристы, готовящиеся к EU AI Act, где обязательства для систем высокого риска и систем общего назначения зависят от документированного управления рисками, управления данными, журналирования и человеческого надзора, и где независимая оценка является доказательством того, что всё это существует, а не политикой, которая говорит, что должно существовать.
Объём — система в том виде, в каком она развёрнута: инъекции промптов по всем путям доставки, OWASP LLM Top 10, экспозиция агентов и MCP, происхождение моделей и данных, соблюдение прав доступа при поиске, эффективность защитных механизмов и мониторинга, исходящий трафик. Это отличается от построения среды приватного ИИ, которое является отдельной услугой, и от red teaming окружающей инфраструктуры, объём которого я определю отдельно, если оценка покажет такую необходимость. Я сам строю и защищаю системы этого класса в своей операционной работе, поэтому выводы проверяются по тому, как такие системы ведут себя в промышленной эксплуатации.
Когда не стоит меня привлекать
Не привлекайте меня ради галочки. Если Вам нужен заполненный опросник для поставщика или сертификат для презентации отделу продаж, есть более дешёвые способы его получить, и результат не изменит того, что делает система. Я не продаю и не перепродаю продукты для безопасности ИИ, поэтому не буду рекомендовать их как решение. Я не подхожу для бенчмарк-оценки качества модели или для системы, которую мне не разрешено атаковать в репрезентативной среде, потому что оценка, проведённая на очищенной копии, говорит о копии. Если система — прототип, который никто не решил выпускать, подождите и оцените то, за что Вы будете нести ответственность.
Что Вы получаете
Перечень того, что мне удалось заставить систему сделать из недопустимого, с шагами воспроизведения, архитектурной причиной успеха и ранжированием по тому, во что это обошлось бы Вам, найди это кто-то другой. Рядом — перечень средств защиты, которые выдержали проверку, чтобы Вы знали, на что можно полагаться, а на что нет. Выводы написаны для руководителя, который их утверждает, и для инженера, который должен их исправить, в одном документе, с исправлением, работающим в промышленной эксплуатации, а не с рекомендацией по политике. Один названный человек провёл тесты, изучил архитектуру и подписывает заключение.
Результат — письменное заключение в формате образца меморандума: вопрос, изученные доказательства, допущения, на которых оно основано, выводы, неизвестные и дальнейшие шаги.
Частые вопросы
Что такое оценка безопасности ИИ?
Независимое тестирование системы на базе ИИ или LLM на возможные способы злоупотребления: инъекции промптов, утечки данных, избыточная агентность через инструменты и агенты, поиск, игнорирующий права доступа к документам, и защитные механизмы, которые не выдерживают. Изучается архитектура, атакуется работающая система, затем составляется отчёт о том, что сработало, что выдержало и что нужно изменить.
Сколько стоит оценка безопасности ИИ?
Объём и стоимость работ определяются письменно после короткого звонка. Объём зависит от числа задействованных моделей, инструментов и источников данных, а также от того, является ли система агентной. Пришлите описание системы и дату, к которой нужен ответ, — я отвечу письменным описанием объёма работ.
Это то же самое, что red teaming LLM или тест на проникновение?
Пересекается с обоими, но не является ни тем, ни другим. Тест на проникновение нацелен на инфраструктуру. Red teaming LLM часто останавливается на модели. Эта оценка проверяет всю систему в том виде, в каком она развёрнута: модель, промпты, слой поиска, инструменты и MCP-серверы, которые может вызывать агент, защитные механизмы и пути исходящего трафика — по OWASP LLM Top 10 и за его пределами.