Персональные данные и нейросети: что нельзя отправлять в чужую модель и как проверить свою систему
Для собственника, у которого бот уже отвечает клиентам: что проверить руками, что там обычно находится и сколько стоит это починить.
Для собственника, у которого бот уже отвечает клиентам: что проверить руками, что там обычно находится и сколько стоит это починить.
Короткий ответ: вы, скорее всего, нарушаете закон о персональных данных — 152-ФЗ, он же ФЗ-152. Причина почти всегда одна: никто в компании не может назвать, какие данные уходят наружу и куда. Ниже — как выяснить это за вечер, без юриста и подрядчика.
Проверяющий не будет читать вашу архитектуру. Он задаст три вопроса, и по скорости ответа станет понятно всё остальное.
Ответы нашлись за минуту — дальше можно читать спокойно. Не нашлись — вы не знаете, что происходит с вашими данными, и это отдельная проблема, независимо от закона.
Здесь ошибаются почти все. В голове у руководителя персональные данные — это паспорт, фамилия и телефон. В законе шире: любая информация, относящаяся к прямо или косвенно определённому человеку. Именно «косвенно» и делает всю разницу. Что попадает под это в переписке с ботом:
В аудите AI-репетитора онлайн-школы модель обрабатывала прогресс ученика, историю его сообщений и данные из заполненных форм. Внутри компании это называли «учебным контекстом» — пока не разобрали построчно, что именно уезжает во внешний сервис.
Самая частая самоуспокоительная мера: имя клиента заменили на условный номер — значит, «данные обезличены». По закону обезличивание — это действия, после которых без дополнительной информации нельзя понять, кому данные принадлежат. Если у вас же лежит таблица соответствия и вы обращаетесь к ней каждый день, связь восстановима, а значит, обезличивания не произошло.
Как выглядит правильный вариант. В архитектуре голосового робота для стоматологии в модель уходят только возрастная группа, пол и описание симптомов. Фамилия, телефон и медицинские сведения остаются в базе в России, связка номера разговора с пациентом хранится локально. Модель физически не видит того, по чему пациента можно опознать.
Проверка занимает минуту: возьмите то, что реально ушло в модель, и дайте сотруднику поддержки. Если он назовёт клиента — данные не обезличены, как бы ни назывался столбец в базе.
Когда персональные данные не пересекают границу, исчезает целый пласт работы: не нужно обосновывать законность передачи, собирать под неё отдельные согласия и объяснять проверяющему, что происходит с данными на чужой стороне.
Практически российский контур — это три вещи: база с данными клиентов на площадке в России (в проекте для стоматологии — PostgreSQL на Selectel), российская модель для всего, что касается живых людей, и зарубежная модель только там, где персональных данных нет вовсе: тексты для сайта, разбор технической документации, черновики описаний товаров.
Назову вещи своими именами, потому что вопрос почти всегда звучит именно так: «можно ли отправлять данные клиентов в ChatGPT». ChatGPT, Claude и Gemini — зарубежные сервисы. Отправка туда фамилии, телефона, адреса или медицинских сведений гражданина России без отдельного основания и согласия на передачу за границу — формальное нарушение; ровно так это записано и на странице моей услуги по защитной диагностике. Для задач, где живых людей нет, — описания товаров, черновики писем, разбор документации — эти же сервисы остаются нормальным рабочим инструментом.
В аудите онлайн-школы обработку персональных данных перевели на российскую модель, и риск по ФЗ-152, который до этого оценивали в 5–10 млн ₽, снизили до остаточного: основание для претензии по трансграничной передаче исчезло. Полного нуля здесь не бывает ни у кого, и подрядчик, который обещает «сняли полностью», обещает больше, чем может. Задача здесь — провести границу и знать, где она проходит.
Языковая модель не отличает ваши правила от текста, который прислал посетитель. Для неё это один поток слов. Отсюда целый класс атак — по-английски prompt injection, по-русски точнее всего подмена инструкций: посетитель пишет боту команду, и бот выполняет её вместо вашей.
Обычная проверка информационной безопасности этого не находит: её инструменты смотрят на сетевые запросы, заголовки и уязвимости библиотек, а здесь атака написана на человеческом языке и неотличима от сообщения клиента.
За 2,5 недели проверки на прочность в онлайн-школе нашлось 33 проблемы: 8 критичных, 11 высоких и 14 средних. Три критичные — прямо про персональные данные:
Ни одну из них внутренняя разработка не заметила. При повторном чтении каждая кажется очевидной — и это ничего не говорит о квалификации команды: чтобы увидеть такое, на систему надо смотреть как на мишень.
Другой проект. Помощник по внутренней базе знаний: бот отвечает на вопросы по рабочим чатам, письмам и голосовым сообщениям. В тех же источниках лежала личная переписка руководства — то, что команде видеть нельзя.
Правильный вопрос звучал так: «сколько закрытых фрагментов видит уровень доступа команды». Замер на живом индексе дал неприятный ответ: 1327. После правки — 0, объём доступного этому уровню сжался с 6139 до 4560 фрагментов, рабочих данных не потеряли. Журнал обращений подтвердил: реального доступа к этим фрагментам никто не успел получить.
Мораль простая. Пока права доступа обсуждают словами, они всегда «вроде настроены». Как только просишь число, оно почти никогда не оказывается нулём с первого раза.
Проверка, после которой систему можно спокойно показывать регулятору или инвестору, выглядит так: 2,5 недели атак на изолированной копии рабочей системы, десять категорий общепринятого перечня рисков для языковых моделей OWASP LLM Top 10, отчёт с планом устранения по каждой находке, неделя на исправления и повторная проверка тем же набором атак. В том проекте все 8 критичных находок подтверждены как закрытые, а проверку со стороны инвесторов AI-часть прошла без замечаний.
Отчёт без плана работ — просто бумага.
Цифры. Полный аудит в том проекте стоил 620 тыс. ₽ при риске, который оценивали в 5–10 млн ₽, — отношение от 8 до 16 к 1, и это только по одному основанию. Но начинать с полного формата почти никогда не нужно. Экспресс-диагностика за 45 000 ₽ — один рабочий день, сокращённый перечень проверок, одна атака вживую и отчёт на 4–6 страниц. Этого хватит, чтобы понять, нужен ли полный формат от 400 000 ₽.
Восемь пунктов, которые собственник проходит сам. Нужен разработчик рядом и двадцать минут его времени.
Если хотя бы на три пункта ответа нет — это обычное состояние системы, которую запускали быстро. В той онлайн-школе нашли 33 проблемы за 2,5 недели и закрыли все критичные за неделю после отчёта. Чинится это заметно быстрее, чем строилось.
Если в чек-листе больше трёх пробелов — берите экспресс-диагностику за 45 000 ₽. Непонятно, нужна ли она вообще — начните с бесплатного разговора на 15 минут. Форматы и методика — на странице услуги «Защитная диагностика AI-систем», вопросы про ФЗ-152 и юридическую форму работы — в разделе вопросов на странице цен.
Нужен разбор шире безопасности — что вообще автоматизировать и в каком порядке? Это отдельный аудит за 9 900 ₽.
— Вячеслав Чухалдин, Калининград, 2026-08-06
Нормы сверены по официальному опубликованию и справочным правовым системам на дату публикации. Законодательство о персональных данных меняется — перед решением сверьтесь с действующей редакцией по ссылкам выше.
Расскажу что внедрить в вашем бизнесе в первую очередь, какая будет окупаемость, и нужен ли вообще AI для вашей задачи (иногда — нет).
Или просто напишите свой вопрос — отвечу в течение 2 часов