Нейроэнтузиаст, CEO и сооснователь «Зерокодера» Кирилл Пшинник рассказывает, что убрать из договора, резюме или таблицы перед загрузкой в нейросеть и как проверить файл за 10 минут.
В сентябре математик Нью-Йоркского университета Тристан Бакмастер публично спросил OpenAI, могли ли черновики, которые он загружал в Codex, повлиять на систему, с помощью которой компания объявила о решении задачи Навье–Стокса. В первой версии заявления OpenAI допускала, что обезличенные данные из работы исследователей с её продуктами могли помочь улучшить модели. Через два дня, после внутреннего расследования, компания сообщила, что запросы Бакмастера к Codex за два месяца до анонса повлиять на систему не могли, в том числе через обучение.
Получается, двое суток даже сама OpenAI не могла уверенно ответить, что стало с материалами пользователя. У сотрудника, который отправляет в чат-бот договор с клиентом, возможностей это проверить ещё меньше.
В «Зерокодер» мы обучаем работе с ИИ компании из разных сегментов и регулярно сопровождаем внедрение нейросетей в бизнес-процессы. И вот что показательно: почти каждая вторая компания, которая приходит с запросом на внедрение, начинает разговор не с возможностей, а с вопросов о безопасности. И это верная последовательность. В статье разберем, какие могут быть риски у бесконтрольной отправки файлов в нейросеть, как грамотно удалить из файла чувствительные данные и какие решения уже существуют для автоматизации этого процесса.
Перед загрузкой рабочего документа в нейросеть стоит проверить три разных типа риска. Они часто встречаются в одном файле, но требуют разных решений.
По файлу можно идентифицировать человека. ФИО, телефон, паспорт, а иногда просто должность и дата назначения. Это зона Федерального закона 152, который определяет персональные данные довольно широко: как любую информацию, относящуюся к прямо или косвенно определённому или определяемому человеку. Такие сведения из файла убирают или заменяют метками.
В файле чужая тайна. Условия сделки, внутренние цены, исходный код, документ контрагента под NDA. Закон о персональных данных здесь ни при чём, и замена имён ничего не даёт, потому что ценность документа заключена в самом содержании. Решают договор с клиентом и правила компании.
В файле лишние данные. Двадцать страниц договора, когда нужен один пункт, или вся выгрузка из CRM ради итоговой строки. Здесь лишние данные не нанесут большой урон, но рекомендуем помнить: Чем больше лишней информации остаётся в файле, тем выше риск вместе с ней передать персональные или конфиденциальные данные.
Отдельно про галочку «не использовать мои данные для обучения». Во многих ИИ-сервисах есть настройка, которая запрещает использовать ваши запросы и загруженные материалы для дальнейшего обучения модели. Может показаться, что после её включения рабочие документы можно загружать безопасно, но это не так. Она закрывает один вопрос: попадут ли ваши запросы в следующую версию модели. Файл при этом всё равно обрабатывается и хранится на серверах поставщика, поэтому отключение обучения не снимает риски, связанные с персональными данными, коммерческой тайной и другой закрытой информацией.
К тому же с 1 июля 2025 года часть 5 статьи 18 152-ФЗ, за рядом исключений, запрещает при сборе персональных данных россиян записывать, накапливать и хранить их в базах за пределами России. Настройкой в профиле зарубежного сервиса этот вопрос не решается. Как ИИ-сервисы становятся каналом утечек внутри компаний, мы подробно разбирали в материале «Утечки данных через ИИ выросли в 30 раз».
Прежде чем чистить файл, я отвечаю на один вопрос: какая информация нужна нейросети, чтобы выполнить именно эту задачу. Для проверки структуры отчёта ей не нужны фамилии сотрудников и названия клиентов, а чтобы отредактировать коммерческое письмо, хватает самого текста без внутренних комментариев и истории согласования. Всё, что не влияет на результат, я убираю ещё до того, как начинаю проверять файл на наличие чувствительной информации.
Тот же принцип заложен в 152-ФЗ: обрабатываемые персональные данные не должны быть избыточными по отношению к цели обработки. Закон адресован компаниям, которые обрабатывают данные, но как рабочее правило для сотрудника перед окном чат-бота он подходит так же хорошо.
Для типового договора, отчёта или таблицы этого времени хватает. Проверка ловит риски в конкретном файле и не заменяет юридическую оценку того, как компания в целом работает с данными.
Сначала я смотрю, чей это документ и что о нём сказано в договорах. Если файл получен от клиента под NDA или целиком состоит из коммерческой тайны, дальше проверять нечего: чистка не спасёт документ, ценность которого в закрытом содержании. Такой файл во внешнюю нейросеть не отправляется ни в каком виде.
Оригинал я не трогаю. Создаю копию специально для нейросети и сразу удаляю из неё страницы, листы, колонки и приложения, которые не нужны для запроса. Шаг кажется формальностью, но именно он отсекает третью категорию риска: лишнее перестаёт попадать в нейросеть только потому, что лежало в том же файле.
Дальше очевидное: ФИО, телефоны, электронная почта, адреса, паспортные данные, ИНН, СНИЛС, банковские реквизиты. Если значение нужно для понимания текста, я заменяю его условной меткой вроде [ФИО] или [ТЕЛЕФОН]: смысл фразы сохраняется, а реальных данных в ней больше нет. В длинном документе такие вещи легко пропустить глазами, и этот шаг удобно отдать сервису автоматической замены.
Возьмём фразу «директор единственного филиала компании в городе N, назначенный 12 марта 2026 года». Фамилии в ней нет, но человека по ней найдёт любой, кто знает компанию. Именно поэтому закон говорит и о косвенно определяемом лице. Особенно внимательно я читаю резюме, жалобы клиентов, кадровые документы, протоколы встреч и отчёты по небольшим командам: должность, место работы, дата события и описание редкой ситуации выдают человека не хуже паспорта.
Word, Excel и PDF хранят больше, чем показывают. На видимом листе таблицы может лежать обезличенная аналитика, а на скрытом рядом с ней осталась исходная клиентская база. Вот семь мест, где данные остаются после «обезличивания»:
Допустим, нейросеть должна найти в договоре слишком сложные формулировки. Исходный фрагмент:
Заказчик: Иванов Иван Петрович, паспорт 45 12 345678, телефон +7 900 123-45-67. Стоимость услуг составляет 120 000 рублей. Исполнитель обязан завершить работы до 30 сентября.
Для редактуры текста паспорт и телефон не нужны, и в рабочей версии их заменяют метки:
Заказчик: [ФИО], паспорт [ПАСПОРТ], телефон [ТЕЛЕФОН]. Стоимость услуг составляет 120 000 рублей. Исполнитель обязан завершить работы до 30 сентября.
Чтобы вернуть ответ в рабочий вид, нужны три действия. Таблицу соответствий между метками и реальными значениями держите у себя и в нейросеть не отправляйте, иначе обезличивание теряет смысл. В самом запросе попросите модель сохранить метки без изменений. Готовый ответ верните к исходным значениям по той же таблице.
Мы в «Зерокодере» постоянно отслеживаем, как меняются запросы к ИИ: через обучение студентов и корпоративных команд быстро становится понятно, где технология уже вошла в рабочие процессы, а где у пользователей появляются новые ограничения и риски. Поэтому часть таких запросов мы превращаем не только в учебные модули, но и в отдельные технические решения. Некоторые из них наша внутренняя команда разработки выкладывает в свободный доступ.
Одно из таких решений — бесплатный сервис «фз152ок», который разработал управляющий партнёр «Зерокодера» Сергей Бражник. Он автоматизирует проверку документа на персональные данные перед работой с нейросетью: находит ФИО, телефоны, паспортные данные, ИНН, СНИЛС и ещё 22 типа данных и маскирует их. Сервис работает с DOCX, PDF, XLSX и текстовыми файлами.
При этом исходный документ не нужно отправлять ещё в один внешний сервис: обработка происходит локально в браузере, файл не покидает компьютер пользователя. Это особенно важно именно в задаче обезличивания — иначе инструмент для защиты данных сам становился бы дополнительной точкой их передачи.
Но обезличивание решает только часть задачи. «фз152ок» помогает удалить прямые идентификаторы, но не определяет, можно ли передавать во внешний сервис само содержание документа.
Если нейросети достаточно структуры, формулировки, обезличенной статистики или отдельного фрагмента, можно подготовить специальную копию и убрать из неё всё лишнее. Если же для задачи необходимы закрытые данные — например, коммерческая тайна, неопубликованные финансовые показатели, полный внутренний отчёт или персональные данные конкретного клиента, — внешний сервис может не подходить в принципе. Тогда вопрос уже не в подготовке файла, а в выборе инструмента, которому такие данные можно передавать.
Для наиболее чувствительных материалов компания может использовать локальные модели или корпоративные решения, согласованные с юристами и службой информационной безопасности. При корректной настройке локальная модель без внешних соединений позволяет оставить внутри инфраструктуры компании исходные данные, обработку и полученный результат.
Можно ли загрузить скриншот вместо файла? Можно, но риск от этого не меняется: нейросети распознают текст на изображениях, и к снимку применимы те же пять шагов. Проще подготовить копию файла и сделать снимок уже с неё.
Можно ли загружать резюме кандидата? Если задача касается опыта и навыков, можно, убрав ФИО, контакты, фото, дату рождения и редкие места работы, по которым человека легко найти. Если нужно оценить именно этого кандидата по исходному резюме, внешний сервис не подходит, нужен корпоративный инструмент.
Как найти скрытые листы в Excel? Щёлкните правой кнопкой по ярлыку любого листа и выберите «Показать». «Очень скрытые» листы в этом списке не появятся, их видно в редакторе Visual Basic (Alt+F11). Если разбираться некогда, скопируйте нужный диапазон в новый файл как значения.
Сколько занимает проверка большого файла? Десять минут рассчитаны на типовой договор или таблицу. В выгрузке на тысячи строк основное время уходит на пятый шаг, и быстрее собрать новый файл только с нужными столбцами, чем чистить старый.
Документ можно отправлять, если он прошёл все пять шагов и в итоговом файле нет ни прямых, ни косвенных сведений о людях, ни чужой тайны, ни лишнего для задачи. При таком подходе исходник и файл для нейросети становятся двумя разными документами, и в чат попадает только второй. Если сомневаетесь, узнаётся ли в тексте человек, подготовьте копию заново.
А уже потом нажимайте «загрузить».