Время чтения: около 8 мин
Что вы узнаете:
Да, программы для обезличивания есть: открытые библиотеки и собственные решения под конкретные задачи. Технически они работают одним из трёх способов: ищут данные по правилам и шаблонам, находят их обученной моделью NER - распознаванием именованных сущностей - или дают человеку размечать текст вручную. На практике для договоров и писем обычно сочетают первые два подхода и добавляют проверку человеком.
Важная оговорка: не стоит рассчитывать, что программа найдёт всё. Разработчики Presidio прямо предупреждают, что автоматические механизмы не гарантируют обнаружение всех данных и требуют дополнительных мер защиты. Поэтому стоит подбирать сочетание подходов и проверки под цену ошибки, а не искать «лучшую программу».
Материал не заменяет консультацию юриста. Ссылки на нормы сверены 22 сентября 2026 года по справочным правовым системам; полный текст приложений приказа автором не изучался. Перед применением сверьте их с актуальным текстом и проконсультируйтесь со своим юристом.
По 152-ФЗ (ст. 3) обезличивание - это действия, после которых без дополнительной информации нельзя определить, кому принадлежат персональные данные. Подробнее о связи этого вопроса со схемами работы с нейросетью мы рассказали в статье «Работа с нейросетью и 152-ФЗ». Здесь не повторяем эти абзацы.
Для выбора программы важно различать две вещи.
Многие программы для документов ориентированы именно на вторую задачу. Считать ли результат обезличиванием в юридическом смысле, нужно решать отдельно. Таблицу соответствия следует хранить отдельно от текста и ограничивать доступ к ней - это практическая рекомендация, а не вывод о выполнении требований закона.
Ниже - практический ориентир, а не универсальное описание возможностей каждой программы.
| Подход | Как работает | Что обычно находит хорошо | Что может пропустить | Как меняется цена ошибки |
|---|---|---|---|---|
| Правила и шаблоны (регулярные выражения, контрольные суммы) | Ищет строки заданного вида | ИНН, ОГРН, телефоны, e-mail | Имена, названия организаций, адреса в свободной форме | Формат известен, правило можно дополнить |
| Модель NER | Модель размечает имена, места и организации по контексту | ФИО, названия компаний, топонимы в связном тексте | Редкие имена, склонения и опечатки, косвенные признаки человека | Ошибку можно не заметить без проверки |
| Ручная разметка | Человек выделяет и заменяет данные в редакторе | То, что человек заметил, включая контекст | Ошибки внимания на больших объёмах | Зависит от объёма и исполнителя |
Разберём каждый подход.
Правило описывает формат: например, ИНН - это цифры заданной длины, а e-mail содержит «@». Плюсы - предсказуемость, скорость и понятное объяснение для аудита. Минусы - правило не понимает контекст, поэтому «Иванов» без дополнительных признаков оно не найдёт. Шаблон может быть и слишком широким: тогда программа замаскирует безобидное число.
У Presidio среди заявленных методов есть регулярные выражения, правила и проверка контрольных сумм - это как раз класс правил. Поддержку русского языка и нужных типов документов проверьте отдельно в текущей документации.
NER ищет имена людей, организации и места по контексту. Для русского языка есть открытая библиотека Natasha с лицензией MIT. Она выполняет токенизацию, морфологический анализ, извлечение фактов и NER-разметку персон, мест и организаций. Библиотека рассчитана прежде всего на новостные тексты и работает на центральном процессоре, поэтому качество на договорах и внутренних письмах нужно измерять на своих данных.
Из перечня типов, которые размечает Natasha, следует, что паспорта, ИНН и телефоны она не ищет. Это вывод из перечня возможностей, а не результат проверки на ваших документах. Поэтому NER обычно используют вместе с правилами.
Ручная разметка подходит для единичных документов и для контрольной проверки после автоматической обработки. Как единственный метод для потока документов она неудобна: на длинном документе человек может пропустить данные из-за усталости и невнимательности.
Выбор зависит от четырёх вопросов.
Готовое решение или своя сборка? Открытые библиотеки дают детали конструктора, но подключать их, дописывать правила и измерять качество придётся вам. Готовое решение под ваш процесс может сэкономить эту работу, но его всё равно нужно проверять.
Перед выбором спросите разработчика или поставщика:
Ответ «находит всё» - повод усомниться.
В проекте по проверке договоров с контрагентами слой анонимизации убирает из текста названия организаций, ФИО, ИНН, ОГРН, КПП, адреса, e-mail, телефоны и банковские реквизиты. Используются регулярные выражения и локальная NER-модель - то есть сочетание первых двух подходов. Во внешний контур уходит текст с условными метками, а результат восстанавливается на стороне заказчика.
По данным проекта, конвейер из 9 ИИ-агентов проверяет договор аренды по чек-листу на 100+ страниц: время сократилось с 4-5 часов до примерно 10 минут, а персональных данных во внешний ИИ передано 0 (метрика проекта, а не общая гарантия). На странице обезличивания документов для ИИ указано, что метки существуют в памяти на время запроса и не сохраняются на диск.
Это результат конкретного проекта на конкретных договорах. Для ваших документов качество нужно измерять заново.
Проверка нужна до запуска и периодически после него. Практическая схема:
Целевые значения полноты вы задаёте сами с учётом цены ошибки. Единого числа, после которого результат можно считать достаточным, нет.
Если нужно встроить обезличивание в процесс проверки документов, оставьте заявку: обсудим задачу.
Расскажите о задаче в свободной форме — ответим в течение рабочего дня и предложим варианты автоматизации.
Написать в Telegramhello@llaim.ru · +7 (993) 920-44-68
или оставьте заявку — перезвоним сами