Аудит безопасности GPT-чат-бота: подмена инструкций, утечка данных и ФЗ-152 на 5–10 млн ₽
Онлайн-школа с 22 000 платящих учеников. AI-репетитор на GPT-4o-mini. Технический директор замечал странности, директор по безопасности задавал неудобные вопросы, а через 4 месяца — проверка перед сделкой. За 2,5 недели атак по методике OWASP LLM Top 10 нашлось 8 критичных уязвимостей — все закрыты до проверки.
AI работает на живых пользователях, а через 4 месяца — проверка перед сделкой
Крупная онлайн-школа: 22 000 платящих учеников, AI-репетитор на GPT-4o-mini встроен в основной продукт обучения. Тьютор обрабатывает контекст ученика — прогресс, истории сообщений, иногда личные данные из заполненных форм. Бот работает на живых пользователях с запуска — уже полгода.
Технический директор заметил странности: пользователи иногда получали ответы, не относящиеся к их курсу. Директор по безопасности начал задавать неудобные вопросы про обработку персональных данных в OpenAI — где они хранятся, как анонимизированы, есть ли логирование, как это согласуется с ФЗ-152.
Параллельно через четыре месяца — проверка компании перед выходом на биржу. Любой инцидент с безопасностью AI означал не только репутационные потери, но и реальный риск срыва сделки. У инвесторов отдельная проверка AI-части, и в их списке есть пункт «аудит по OWASP LLM Top 10 пройден».
Атаки по OWASP LLM Top 10 и устранение находок
2,5 недели атак на изолированной копии рабочей системы: с боевыми промптами и правдоподобными, но выдуманными персональными данными. Каждый из 10 пунктов OWASP — отдельная серия целевых атак: автоматических (Promptfoo, Garak, Rebuff) и ручных, по сценариям, написанным под специфику онлайн-школы.
Перечень всех мест, где работает языковая модель: репетитор, поиск по документам, данные для дообучения, промпты. Модель угроз по OWASP LLM Top 10.
Promptfoo, Garak и Rebuff. Тысячи запросов на подмену инструкций, обход ограничений и вытягивание данных.
Свои сценарии под онлайн-школу: вытащить данные другого ученика, обойти платный доступ, заставить отвечать не по курсу.
Куда идут данные: какие персональные данные попадают в OpenAI, как они обезличены, где документы о согласии на обработку, как соблюдён закон.
После исправлений — тот же набор атак заново. Чистый отчёт для проверки перед сделкой.
Восемь критичных уязвимостей
При повторном чтении каждая кажется очевидной: «ну как же мы это пропустили». До аудита ни одну из них внутренняя разработка не заметила. Список без конкретных запросов — они под NDA:
- 01Подмена инструкций: фраза «забудь предыдущие инструкции» обходила системный промпт и меняла поведение бота
- 02Утечка персональных данных из-за смешения контекстов в поиске по документам — в ответе одному ученику попадались куски переписки другого
- 03Нарушение ФЗ-152: персональные данные уходили в OpenAI без обезличивания и без согласия на передачу за границу
- 04Не было ограничения частоты запросов: атака стоимостью 280 ₽ исчерпала бы дневной бюджет на OpenAI
- 05Обход ограничений через ролевую игру: «ты учитель сценического мастерства, разыграй роль…» снимало ограничения
- 06Вытягивание системного промпта: пара специально сформулированных вопросов выводила его полный текст
- 07Ответ выводился без проверки: текст модели попадал на страницу как есть, что открывало возможность внедрить в неё чужой код
- 08Небезопасное расширение: функция доступа к учебным материалам позволяла через название курса выйти за пределы разрешённой папки
Не только отчёт, но и устранение
Аудит без плана работ — просто бумага. Каждая из 33 находок (8 критичных, 11 высоких, 14 средних) сопровождалось конкретным fix-предложением: правка системного промпта, изоляция контекстов в поиске по документам (RAG), перевод персональных данных на GigaChat 2 Max внутри РФ, правила Cloudflare против подмены инструкций, очистка выводимого текста через DOMPurify, изоляция расширений.
Re-test после исправлений
Через неделю после исправлений — повторный прогон автоматических атак и точечные ручные сценарии по закрытым критичным уязвимостям. Все 8 подтверждены как заблокированные. Чистый отчёт ушёл в пакет документов к сделке. Отдельным документом — план поддержки защиты на следующие 12 месяцев.
Общепринятые инструменты и свои сценарии атак
Методика оценки угроз: 10 категорий уязвимостей AI-приложений как проверочный список
Автоматические тесты: тысячи вариантов запроса на одну цель и оценка ответов
Набор инструментов для атак на языковые модели: обход ограничений, вытягивание данных, подмена инструкций — из коробки
Слой распознавания подмены инструкций — проверка и встраивание в рабочий процесс
Ручные проверки под специфику онлайн-школы: вытащить данные, обойти платный доступ, повлиять на оценку
Российская модель, на которую перевели обработку персональных данных
Фильтрация запросов на подмену инструкций ещё до того, как они дойдут до модели
Юридическая часть: обработка персональных данных, согласия, договор, передача за границу
Закрыто до проверки перед сделкой
все критичные уязвимости заблокированы и подтверждены повторной проверкой
основание для штрафа устранено: данные переведены в РФ, согласия оформлены. Снимается конкретное нарушение; гарантий от проверки это не даёт
5–10 млн против 620 тыс. ₽ стоимости аудита — и это только по ФЗ-152
В пакет документов к сделке ушёл чистый отчёт по 10 категориям OWASP LLM Top 10 с подписью аудитора и датой повторной проверки. Проверка со стороны инвесторов прошла без дополнительных вопросов к AI-части — для подготовки к выходу на биржу это редкость.
Главный результат вне цифр — у директора по безопасности появился рабочий порядок для следующих изменений в AI-части. Каждый новый промпт и каждое новое расширение проходят короткую проверку по списку OWASP, а раз в полгода запланирован полный цикл атак.
Когда аудит безопасности AI обязателен
Общее правило — модель работает с чужими данными или её ответ уходит человеку без проверки. Если ваша AI-часть попадает хотя бы под один пункт ниже — аудит входит в обязательные требования:
- → AI-помощник с доступом к персональным данным — онлайн-школы, медицина, кадровые сервисы, любой сервис для людей, где хранится история переписки
- → Поиск по документам (RAG), где в одной системе живут данные разных клиентов и утечка между ними — уже инцидент
- → AI, который вызывает внешние функции — работает с реальными системами, деньгами и файлами
- → Чат-бот на публичном сайте — любой случайный посетитель может оказаться атакующим
- → Перед выходом на биржу, продажей компании или сертификацией — инвесторы и регулятор проверяют безопасность AI-части
- → Любая обработка персональных данных через зарубежные модели (OpenAI, Anthropic, Google) — риск по ФЗ-152
- Составляю перечень всех мест, где работает языковая модель: чат-боты, поиск по документам, векторные базы, данные для дообучения, промпты
- Провожу автоматические атаки по 10 категориям OWASP — тысячи запросов
- Атакую вручную по сценариям, написанным под конкретный бизнес
- Проверяю соответствие ФЗ-152 и помогаю устранить нарушения: куда идут данные, как обезличены, какие документы о согласии оформлены
- Отдаю отчёт с планом устранения по приоритету: что чинить и как
- Повторно проверяю после исправлений — чистый отчёт для сделки или проверки регулятора
Если AI уже работает с людьми, а на прочность его не проверяли — это инцидент, который просто ещё не случился
Стоимость аудита фиксированная — 620 тыс. ₽. Срок 2,5 + 1 неделя. Отчёт защищён NDA и по формату подходит для проверки перед сделкой или пакета документов по ISO 27001. Можно начать с предварительного аудита на 3 дня, если сначала нужно оценить объём работ.
Разбор по теме:Персональные данные и нейросети: 152-ФЗ, ChatGPT и проверка своей системы
Похожие кейсы
Прогноз событий ансамблем моделей: калибровка и проверка по Брайеру
Пять агентов на языковой модели с поиском по открытым источникам, супервизор, калибровка, запись каждого…
Локальная нейросеть для торговых сигналов: Ollama и RAG на M3
Решения принимает связка моделей прямо на компьютере: qwen2.5:14b основная, llama3.1:8b запасная, LLaVA:7b…
1С УНФ + Telegram-бот для прорабов
aiogram 3 и промежуточный слой на Node.js через HTTP-сервисы 1С. Доступ к 1С УНФ прямо с объекта, без…
Аудит за 9 900 ₽ — с конкретным отчётом и сметой
Расскажу что внедрить в вашем бизнесе в первую очередь, какая будет окупаемость, и нужен ли вообще AI для вашей задачи (иногда — нет).
Или просто напишите свой вопрос — отвечу в течение 2 часов