Анонимизация персональных данных

Добрый день, дорогие читатели! 

Теплого вам августовского дня и приятного отпуска тем, кто отдыхает.

Вот и я в отпуске прочла новость от 3 августа про то, что участники Ассоциации Больших данных (АБД), куда входят крупные отечественные компании, разрабатывающие системы ИИ, попросили Минцифры обрабатывать большие персональные данные без согласия граждан для разработки, обучения и использования ИИ.

Мотивация АБД следующая: «Сейчас такие данные продолжают считаться персональными даже после обезличивания, что может тормозить развитие ИИ в РФ. Участники рынка считают, что сейчас рынок данных в России развит слабо, а большинство датасетов остается внутри крупных экосистем». 

Защиту данных АБД обещает обеспечить через так называемые «технологии повышения приватности». Я задумалась, насколько такой подход опасен с точки зрения защиты информации и существуют ли действительно методы гарантированной деперсонализации данных? 

Технологии повышения приватности (Privacy Enhancing Technologies — PETs) — это набор математических и программных методов защиты личных данных, позволяющих обрабатывать, передавать и хранить информацию без риска ее утечки или раскрытия. В российском законодательстве понятие PETs отсутствует.

РЕТs включают в себя несколько способов деперсонализации данных. Интересующихся первоисточниками отсылаю сюда и сюда

Коротко говоря, существует 6 основных способов деперсонализации, которые я приведу ниже, и прокомментирую. 

1. «Замыливание» персональных данных путём добавления к ним статистического шума и разных нерелевантных данных. В принципе, работающий инструмент, но он требует аккуратного подбора соответствующего «шума», чтобы его было сложно снять программным способом и вычленить-таки исходные данные. 

2. Государственный обмен данными — это когда некоторая группа исследовательских или медицинских учреждений обменивается данными (например, о болезнях и симптомах), не разглашая персональных данных. В целом, этот метод рабочий и уже широко используется в нашей стране. Хотя, строго говоря, анамнез пациента за несколько лет абсолютно уникален — то есть отстоит далеко от других анамнезов в пространстве данных. Его практически нельзя эффективно обезличить. Стоит участнику «обмена данными» добавить к анамнезу обогащение имеющимися у него данными — например, сведениями о поездках на такси в клиники за последние 10 лет, или данными о заказах в аптеках, или запросами о лекарствах в поисковиках, или данными о страховых возмещениях по ОМС — как тут же сличением векторов однозначно восстанавливается ФИО пациента. Изнутри системы риск утечки данных существует и безо всякого обмена, просто через сотрудников этих самых учреждений.

3. Безопасные многосторонние вычисления — когда университеты, например, обмениваются уже между собой вычисленными данными (сигнатурами, «векторами», «хэшами») об объектах исследования, не передавая персональную информацию вообще. Но для этого способы вычисление «хэшей» и знания об их структуре должны быть общими, что снижает надёжность обезличивания.

4. Гомоморфное шифрование — это сложный математический алгоритм, который даёт возможность делать произвольные вычисления на зашифрованных данных без их расшифровки. Лет 10 назад это стало прорывом в области шифрования. Примеры использования — осуществление поиска по запросу без знания самого запроса; фильтрация спама без чтения содержимого писем; подсчёт голосов без вскрытия конвертов; тесты ДНК без чтения самих ДНК, и многое другое. Это, наверное, самый надёжный способ деперсонализации данных. Правда, я не уверена, что шифрованные данные можно применять для обучения нейросетей. 

5. Псевдоанонимизация — когда каждому лицу присваивается идентификатор вместо имени, а потом эти идентификаторы ещё и шифруются. Это довольно дешёвый способ, но не очень надёжный. Потому что идентификацию человека можно провести не по его идентификатору, а по набору его уникальных признаков, например, по лицу или географии перемещений (по «четырём точкам» в городе). 

6. Есть ещё метод синтетических данных, который, например, используем мы в ИнфоВотч для тестирования своих продуктов. Он означает генерацию реалистично выглядящих персональных данных в большом количестве. Способ стопроцентно гарантирует безопасность личных данных реальных людей, поскольку не использует их вообще. Но, к сожалению, он практически непригоден для обучения ИИ-моделей, так как последним нужны именно реальные данные. 

Резюмирую вышесказанное: методы обезличивания действительно существуют и вроде как даже довольно эффективные, по заверениям разработчиков. 

Но, во-первых, даже на первый взгляд перечисленные методы плохо подходят для обучения нейросетей. 

Во-вторых, чем надёжнее скрыты (зашумлены, зашифрованы) данные, тем сложнее и дороже их использование для обучения ИИ. А если же компании получат право самостоятельно обезличивать данные, то какой метод они выберут — самый надёжный или самый дешёвый? 

В-третьих, проверка и сертификация анонимизации — это технически довольно сложная задача. Кто будет этим заниматься? Или дело ограничится собственными добровольными декларациями компаний в духе «мамой клянусь, что надёжно»?

Ну, и наконец, есть виды данных, обезличивание на которых вообще не работает. Например, распознавание лиц. Обезличивай – не обезличивай, а лицо всё равно привязано к конкретному человеку. 

Ну и основной вопрос: а зачем вообще АБД нужны персональные данные? Чему на самом деле можно обучать ИИ-модели на личных данных граждан и зачем? Показу ещё более таргетированной рекламы для стимуляции ещё большего числа импульсных покупок? Построению индивидуальных образовательных траекторий, ценность которых не просто сомнительная, а прямо нарушает право на личную жизнь и судьбу? Построению социального рейтинга?

Точно ли стоит ради этих сомнительных или прямо вредных целей отменять или ослаблять ФЗ-152 о защите персональных данных, который в ноябре 2024 года был усилен законодателями при активном сопротивлении цифрового бизнеса и АБД (помните — были введены оборотные штрафы, уголовная ответственность руководства компаний и госорганов за утечку ПДн)?

Роскомнадзор, кстати, внимательно следит за выполнением этого закона, защищая права граждан на частную жизнь. Поэтому я всё-таки надеюсь, что данная антиконституционная и антиобщественная инициатива АБД реализована не будет.

Блог Натальи Касперской

Подпишитесь на рассылку
Получайте новости, дайджесты и анонсы от InfoWatch каждый день
Подписаться на рассылку
l.12-.057c.834-.407 1.663-.812 2.53-1.211a42.414 42.414 0 0 1 3.345-1.374c2.478-.867 5.078-1.427 7.788-1.427 2.715 0 5.318.56 7.786 1.427z" transform="translate(-128 -243)"/>