COMRAD404 / GLOSSARY

Приватность данных (Data Privacy)

Data Privacy

Приватность данных — это не только защита от утечек, а правила и методы, которые делают использование данных о человеке понятным, управляемым и менее связываемым с его личностью.

TL;DR

Состояние обработки данных, которое защищает автономию и достоинство человека через конфиденциальность, предсказуемость, управляемость и ограничение повторной идентификации.

Приватность данных (data privacy) — это состояние обработки данных, которое защищает автономию и достоинство человека через конфиденциальность, предсказуемость, управляемость и возможность не связывать запись обратно с конкретным человеком, как это определяет NIST. Для практики это означает: важно не только спрятать данные от посторонних, но и сделать их использование понятным, контролируемым и ограничить риск повторной идентификации.

Английский термин: data privacy. Также встречается: privacy. В правовом контексте рядом стоит понятие personal data: GDPR и OECD связывают его с любой информацией об идентифицированном или идентифицируемом физическом лице.

Простыми словами

Грубо говоря, приватность данных — это не вопрос «секретны ли данные вообще», а вопрос «что именно о вас знают, кто это использует, насколько это предсказуемо и можно ли снова привязать запись к вам». Можно представить это как анкету на мероприятии: организатору может быть нужен ваш e-mail для билета, но это не означает, что ваши ответы автоматически должны стать доступными всем подряд или использоваться для других задач.

Поэтому приватность данных шире, чем просто «никому не показывать базу». Она касается всего жизненного цикла данных: определения, относятся ли они к человеку, правил обращения, снижения связуемости записей и контроля над тем, что попадает в аналитику, отчёты и ИИ-системы.

Как это работает

На уровне организации NIST рассматривает эту тему как задачу управления privacy-риском. Публичная страница NIST Privacy Framework, доступная на 2026-08-16, показывает Version 1.0 (January 2020) и прямо отмечает, что документ добровольный и не имеет силы закона. Упрощённая схема выглядит так:

[Сбор или получение данных]
          |
          v
[Проверка: относятся ли данные
 к идентифицированному или
 идентифицируемому человеку?]
          |
          v
[Правила использования:
 predictability + manageability]
          |
          v
[Снижение связуемости записи
 с человеком: de-identification]
          |
          v
[Аналитика, обмен, публикация]
          |
          v
[Если нужны формальные гарантии
 для агрегатов — оценка privacy loss,
 например в рамках differential privacy]
  1. Сначала определяют границу. Если информация относится к идентифицированному или идентифицируемому человеку, она попадает в зону privacy-риска в смысле GDPR и OECD.
  2. Потом задают предсказуемость и управляемость. Это практическое чтение компонентов NIST: должно быть понятно, как данные используются и как этим использованием управляют.
  3. Дальше уменьшают возможность обратной связи записи с человеком. NIST SP 800-188 посвящён де-идентификации датасетов и отдельно указывает на ограничения подходов, где всё сводится только к маскированию.
  4. Если данные нужно публиковать как агрегаты или метрики, может использоваться differential privacy. NIST SP 800-226 описывает её как математическую рамку для количественной оценки потерь приватности в датасетах.
  5. Наконец, процесс закрепляют организационно. NIST SP 800-50 Rev. 1 описывает, как строить жизненный цикл программы обучения по кибербезопасности и приватности, потому что privacy ломается не только на алгоритмах, но и на повседневной практике.

Где применяется

  • Разметка датасетов для ML. Если вы отдаёте тексты, изображения или аудио аннотаторам, нужно заранее понять, есть ли там данные об идентифицируемом человеке и можно ли уменьшить связуемость записей до передачи.
  • RAG и поиск по внутренним документам. В базу знаний могут попасть заявки поддержки, договоры, резюме, медицинские или HR-документы. Здесь privacy определяет не только безопасность хранения, но и то, какие поля вообще допустимо индексировать и показывать в ответе модели.
  • Память и логи агентных систем. Если агент хранит историю действий и переписки, приватность данных быстро превращается в вопрос: что именно сохраняется, как долго и можно ли восстановить профиль конкретного пользователя.
  • Публикация аналитики и исследовательских наборов. Когда организация делится статистикой или выпускает датасет наружу, приватность данных требует оценивать не только прямые идентификаторы, но и риск повторной идентификации по косвенным признакам.

Практический пример

Представим, что вы делаете внутреннего ИИ-ассистента по базе обращений в поддержку. В тикетах есть текст проблемы, e-mail, телефон, номер заказа и иногда свободные комментарии клиентов.

  1. Шаг 1: определите, где персональные данные. По логике GDPR и OECD это не только имя, но любая информация, относящаяся к идентифицированному или идентифицируемому человеку.
  2. Шаг 2: отделите цель системы от лишних атрибутов. Если ассистент должен отвечать на продуктовые вопросы, ему не обязательно видеть прямые идентификаторы в поисковом индексе.
  3. Шаг 3: примените де-идентификацию там, где это возможно. Но не считайте простую маскировку финальной гарантией: NIST SP 800-188 отдельно предупреждает о пределах masking-only подходов.
  4. Шаг 4: продумайте, что модель возвращает пользователю. Даже если исходный датасет хранится внутри, вывод модели не должен заново раскрывать лишние данные о конкретном человеке.
  5. Шаг 5: если вы публикуете метрики по обращениям, не путайте агрегирование с полной privacy-гарантией. Когда нужна формальная оценка потерь приватности, смотрят в сторону differential privacy и её оценки по NIST SP 800-226.
  6. Шаг 6: обучите команду. NIST SP 800-50 Rev. 1 полезен здесь как организационная основа: приватность должна быть не разовой задачей, а частью регулярной практики.
if data relates to an identified or identifiable person:
    define predictable use
    make handling manageable
    reduce linkability where possible
    review outputs before sharing
    evaluate privacy loss for released aggregates when needed
else:
    process under general data governance

Этот сценарий особенно типичен для AI-приложений поверх своих данных: внешне проект выглядит как обычный поиск или чат-ассистент, но privacy-риск часто возникает не на хранении, а на этапе индексации, извлечения и ответа пользователю.

Чем отличается от…

Термин Что означает Чем отличается от приватности данных
Конфиденциальность Сохранение данных от несанкционированного раскрытия. По определению NIST это только один из компонентов privacy. Приватность данных шире: в неё также входят предсказуемость, управляемость и возможность разорвать связь записи с человеком.
Де-идентификация Методы и governance-подходы для работы с датасетами так, чтобы уменьшить идентифицируемость записей. Это инструмент внутри privacy-практики, а не полный синоним. NIST SP 800-188 отдельно показывает, что одних масок и замен может быть недостаточно.
Дифференциальная приватность Математическая рамка для количественной оценки потерь приватности в датасетах. Это более узкий технический подход. Он не заменяет общие правила обращения с данными и не описывает всю тему privacy целиком.

Ограничения и заблуждения

  • Заблуждение: «приватность данных = секретность». На практике NIST определяет privacy шире, чем просто confidentiality.
  • Заблуждение: «удалили имя — вопрос закрыт». NIST SP 800-188 специально разбирает пределы подходов, где защита сводится только к маскированию.
  • Заблуждение: «differential privacy — это и есть вся приватность данных». Нет: это частная математическая рамка для оценки privacy loss, а не полный организационный или правовой режим.
  • Заблуждение: «NIST Privacy Framework обязателен сам по себе». Нет: публичная страница NIST прямо указывает, что framework добровольный и не имеет силы закона.
  • Ограничение правового контекста. GDPR — это официальный правовой текст ЕС/ЕЭЗ, а OECD Privacy Guidelines — международные, но не обязательные принципы. Для конкретной юрисдикции и отрасли этого обзора недостаточно.

Редакционное ограничение: эта статья объясняет термин по официальным материалам NIST, GDPR и OECD, доступным на 2026-08-16. Она не заменяет юридический анализ, отраслевые требования и оценку конкретной архитектуры данных.

Практический вердикт: если вы работаете с AI-системой на пользовательских данных, минимальный набор вопросов такой: можно ли идентифицировать человека, понятно ли использование данных, можно ли уменьшить связуемость записи и как вы оцениваете остаточный privacy-риск при публикации результатов.

Связанные термины и инструменты

Источники

Вопросы и ответы

Приватность данных и конфиденциальность — это одно и то же?

Нет. В определении NIST конфиденциальность — только одна часть privacy наряду с предсказуемостью, управляемостью и возможностью не связывать запись с человеком.

Достаточно ли удалить имя из таблицы?

Не всегда. NIST SP 800-188 прямо рассматривает ограничения подходов, где защита сводится только к маскированию отдельных полей.

Что считается персональными данными?

GDPR и OECD связывают персональные данные с любой информацией об идентифицированном или идентифицируемом физическом лице. Ключевой вопрос здесь не только в имени, а в возможности установить личность.

Дифференциальная приватность — это то же самое, что приватность данных?

Нет. NIST SP 800-226 описывает differential privacy как математическую рамку для количественной оценки privacy loss; это более узкий технический инструмент.

Обязателен ли NIST Privacy Framework?

Нет. По публичной странице NIST это добровольный framework, который не имеет силы закона, хотя его удобно использовать как основу для управления privacy-риском.

Источники

SOURCES

Вопросы и ответы

FAQ
Приватность данных и конфиденциальность — это одно и то же?

Нет. В определении NIST конфиденциальность — только одна часть privacy наряду с предсказуемостью, управляемостью и возможностью не связывать запись с человеком.

Достаточно ли удалить имя из таблицы?

Не всегда. NIST SP 800-188 прямо рассматривает ограничения подходов, где защита сводится только к маскированию отдельных полей.

Что считается персональными данными?

GDPR и OECD связывают персональные данные с любой информацией об идентифицированном или идентифицируемом физическом лице. Ключевой вопрос здесь не только в имени, а в возможности установить личность.

Дифференциальная приватность — это то же самое, что приватность данных?

Нет. NIST SP 800-226 описывает differential privacy как математическую рамку для количественной оценки privacy loss; это более узкий технический инструмент.

Обязателен ли NIST Privacy Framework?

Нет. По публичной странице NIST это добровольный framework, который не имеет силы закона, хотя его удобно использовать как основу для управления privacy-риском.

Читайте также

LINKS