Перейти к содержимому
VC
Кейс 19 из 33 · Защитная диагностика AI · NDA

Аудит безопасности GPT-чат-бота: подмена инструкций, утечка данных и ФЗ-152 на 5–10 млн ₽

Онлайн-школа с 22 000 платящих учеников. AI-репетитор на GPT-4o-mini. Технический директор замечал странности, директор по безопасности задавал неудобные вопросы, а через 4 месяца — проверка перед сделкой. За 2,5 недели атак по методике OWASP LLM Top 10 нашлось 8 критичных уязвимостей — все закрыты до проверки.

Полностью под NDA — без узнаваемого интерфейса и брендинга. Только архитектурные схемы.
Отрасль
Крупная онлайн-школа (22 000 платящих)
Стек
OWASP LLM Top 10 · Promptfoo · Garak · Rebuff
Сроки
2,5 нед аудит + 1 нед повторная проверка
Соответствие закону
ФЗ-152: аудит и устранение
Итог
8 критичных закрыто · окупаемость 8–16×
01 · Боль

AI работает на живых пользователях, а через 4 месяца — проверка перед сделкой

Крупная онлайн-школа: 22 000 платящих учеников, AI-репетитор на GPT-4o-mini встроен в основной продукт обучения. Тьютор обрабатывает контекст ученика — прогресс, истории сообщений, иногда личные данные из заполненных форм. Бот работает на живых пользователях с запуска — уже полгода.

Технический директор заметил странности: пользователи иногда получали ответы, не относящиеся к их курсу. Директор по безопасности начал задавать неудобные вопросы про обработку персональных данных в OpenAI — где они хранятся, как анонимизированы, есть ли логирование, как это согласуется с ФЗ-152.

Параллельно через четыре месяца — проверка компании перед выходом на биржу. Любой инцидент с безопасностью AI означал не только репутационные потери, но и реальный риск срыва сделки. У инвесторов отдельная проверка AI-части, и в их списке есть пункт «аудит по OWASP LLM Top 10 пройден».

02 · Решение

Атаки по OWASP LLM Top 10 и устранение находок

2,5 недели атак на изолированной копии рабочей системы: с боевыми промптами и правдоподобными, но выдуманными персональными данными. Каждый из 10 пунктов OWASP — отдельная серия целевых атак: автоматических (Promptfoo, Garak, Rebuff) и ручных, по сценариям, написанным под специфику онлайн-школы.

01
Обследование

Перечень всех мест, где работает языковая модель: репетитор, поиск по документам, данные для дообучения, промпты. Модель угроз по OWASP LLM Top 10.

02
Автоматические атаки

Promptfoo, Garak и Rebuff. Тысячи запросов на подмену инструкций, обход ограничений и вытягивание данных.

03
Ручные атаки

Свои сценарии под онлайн-школу: вытащить данные другого ученика, обойти платный доступ, заставить отвечать не по курсу.

04
Проверка по ФЗ-152

Куда идут данные: какие персональные данные попадают в OpenAI, как они обезличены, где документы о согласии на обработку, как соблюдён закон.

05
Повторная проверка

После исправлений — тот же набор атак заново. Чистый отчёт для проверки перед сделкой.

Восемь критичных уязвимостей

При повторном чтении каждая кажется очевидной: «ну как же мы это пропустили». До аудита ни одну из них внутренняя разработка не заметила. Список без конкретных запросов — они под NDA:

  • 01Подмена инструкций: фраза «забудь предыдущие инструкции» обходила системный промпт и меняла поведение бота
  • 02Утечка персональных данных из-за смешения контекстов в поиске по документам — в ответе одному ученику попадались куски переписки другого
  • 03Нарушение ФЗ-152: персональные данные уходили в OpenAI без обезличивания и без согласия на передачу за границу
  • 04Не было ограничения частоты запросов: атака стоимостью 280 ₽ исчерпала бы дневной бюджет на OpenAI
  • 05Обход ограничений через ролевую игру: «ты учитель сценического мастерства, разыграй роль…» снимало ограничения
  • 06Вытягивание системного промпта: пара специально сформулированных вопросов выводила его полный текст
  • 07Ответ выводился без проверки: текст модели попадал на страницу как есть, что открывало возможность внедрить в неё чужой код
  • 08Небезопасное расширение: функция доступа к учебным материалам позволяла через название курса выйти за пределы разрешённой папки

Не только отчёт, но и устранение

Аудит без плана работ — просто бумага. Каждая из 33 находок (8 критичных, 11 высоких, 14 средних) сопровождалось конкретным fix-предложением: правка системного промпта, изоляция контекстов в поиске по документам (RAG), перевод персональных данных на GigaChat 2 Max внутри РФ, правила Cloudflare против подмены инструкций, очистка выводимого текста через DOMPurify, изоляция расширений.

Re-test после исправлений

Через неделю после исправлений — повторный прогон автоматических атак и точечные ручные сценарии по закрытым критичным уязвимостям. Все 8 подтверждены как заблокированные. Чистый отчёт ушёл в пакет документов к сделке. Отдельным документом — план поддержки защиты на следующие 12 месяцев.

03 · Стек

Общепринятые инструменты и свои сценарии атак

OWASP LLM Top 10

Методика оценки угроз: 10 категорий уязвимостей AI-приложений как проверочный список

Promptfoo

Автоматические тесты: тысячи вариантов запроса на одну цель и оценка ответов

Garak

Набор инструментов для атак на языковые модели: обход ограничений, вытягивание данных, подмена инструкций — из коробки

Rebuff

Слой распознавания подмены инструкций — проверка и встраивание в рабочий процесс

Свои сценарии атак

Ручные проверки под специфику онлайн-школы: вытащить данные, обойти платный доступ, повлиять на оценку

GigaChat 2 Max

Российская модель, на которую перевели обработку персональных данных

Cloudflare WAF

Фильтрация запросов на подмену инструкций ещё до того, как они дойдут до модели

Аудит по ФЗ-152

Юридическая часть: обработка персональных данных, согласия, договор, передача за границу

OWASP LLM Top 10PromptfooGarakRebuffCustom red-teamGigaChatCloudflare WAFФЗ-152
04 · Результат

Закрыто до проверки перед сделкой

Критичных закрыто
8 / 8

все критичные уязвимости заблокированы и подтверждены повторной проверкой

ФЗ-152 риск
5–10 млн ₽

основание для штрафа устранено: данные переведены в РФ, согласия оформлены. Снимается конкретное нарушение; гарантий от проверки это не даёт

Окупаемость на одном штрафе
8–16×

5–10 млн против 620 тыс. ₽ стоимости аудита — и это только по ФЗ-152

В пакет документов к сделке ушёл чистый отчёт по 10 категориям OWASP LLM Top 10 с подписью аудитора и датой повторной проверки. Проверка со стороны инвесторов прошла без дополнительных вопросов к AI-части — для подготовки к выходу на биржу это редкость.

Главный результат вне цифр — у директора по безопасности появился рабочий порядок для следующих изменений в AI-части. Каждый новый промпт и каждое новое расширение проходят короткую проверку по списку OWASP, а раз в полгода запланирован полный цикл атак.

05 · Применимость

Когда аудит безопасности AI обязателен

Общее правило — модель работает с чужими данными или её ответ уходит человеку без проверки. Если ваша AI-часть попадает хотя бы под один пункт ниже — аудит входит в обязательные требования:

  • AI-помощник с доступом к персональным данным — онлайн-школы, медицина, кадровые сервисы, любой сервис для людей, где хранится история переписки
  • Поиск по документам (RAG), где в одной системе живут данные разных клиентов и утечка между ними — уже инцидент
  • AI, который вызывает внешние функции — работает с реальными системами, деньгами и файлами
  • Чат-бот на публичном сайте — любой случайный посетитель может оказаться атакующим
  • Перед выходом на биржу, продажей компании или сертификацией — инвесторы и регулятор проверяют безопасность AI-части
  • Любая обработка персональных данных через зарубежные модели (OpenAI, Anthropic, Google) — риск по ФЗ-152
Что входит в аудит (2,5 + 1 неделя)
  • Составляю перечень всех мест, где работает языковая модель: чат-боты, поиск по документам, векторные базы, данные для дообучения, промпты
  • Провожу автоматические атаки по 10 категориям OWASP — тысячи запросов
  • Атакую вручную по сценариям, написанным под конкретный бизнес
  • Проверяю соответствие ФЗ-152 и помогаю устранить нарушения: куда идут данные, как обезличены, какие документы о согласии оформлены
  • Отдаю отчёт с планом устранения по приоритету: что чинить и как
  • Повторно проверяю после исправлений — чистый отчёт для сделки или проверки регулятора
Похожая задача?

Если AI уже работает с людьми, а на прочность его не проверяли — это инцидент, который просто ещё не случился

Стоимость аудита фиксированная — 620 тыс. ₽. Срок 2,5 + 1 неделя. Отчёт защищён NDA и по формату подходит для проверки перед сделкой или пакета документов по ISO 27001. Можно начать с предварительного аудита на 3 дня, если сначала нужно оценить объём работ.

Готовы начать?

Аудит за 9 900 ₽ — с конкретным отчётом и сметой

Расскажу что внедрить в вашем бизнесе в первую очередь, какая будет окупаемость, и нужен ли вообще AI для вашей задачи (иногда — нет).

Или просто напишите свой вопрос — отвечу в течение 2 часов