Запись архива

Новая техника PAC-приватности для автогенерации: меньше шума при стабильных предсказаниях

Исследователи представили метод PAC-Private Autoregressive Generation, который калибрует шум на основе разброса мнений ансамбля моделей, адаптированных на приватных данных. Это позволяет сохранять конфиденциальность при генерации текста без существенного ущерба для качества.

Схема работы PAC-приватной автогенерации с ансамблем адаптеров
Схема работы PAC-приватной автогенерации с ансамблем адаптеров
Teachers on the public sector strike march through Norwich city centre | by Roger Blackwell | openverse | by

На arXiv опубликована работа «PAC-Private Autoregressive Generation: Calibrating Noise to Ensemble Disagreement», предлагающая новый подход к обеспечению приватности при генерации текста языковыми моделями. В отличие от традиционных методов, таких как PMixED, новая техника использует концепцию PAC-приватности (Probably Approximately Correct privacy), которая адаптирует уровень шума к степени стабильности предсказаний модели.

Как это работает

Авторы строят m=128 пересекающихся миров из приватного корпуса, где каждая запись появляется ровно в m/2 мирах. Для каждого мира обучается отдельный адаптер поверх замороженной публичной модели. При генерации каждого токена публичная модель формирует кандидатное множество, миры «голосуют», а разногласие между ними, взвешенное по апостериорной вероятности, определяет необходимый уровень PAC-шума. Если все миры единогласны, шум не добавляется.

Технические детали

Исследователи доказывают, что взаимная информация между секретом S и сгенерированной последовательностью Y_{1:T} ограничена: I(S;Y_{1:T}) ≤ I(S;H_T) ≤ bT. Ключевые вклады работы включают:
— Расширение PAC-приватности на автогрессивную генерацию
— Обработку адаптивных самогенерируемых контекстов
— Введение техники coupled decoding, которая сохраняет учёт приватности и избегает жадной деградации

Результаты экспериментов

На датасете WikiText-103 с моделью GPT-2-small метод сохраняет 74% выигрыша от тонкой настройки при бюджете на токен 2^{-32}. Успешность атак на членство (membership inference) ограничена 51.08% после 10^6 токенов. Оценки энтропии апостериорного распределения показывают утечку примерно 17% от заряженного бюджета.

Сравнение с PMixED

Параметр PAC-Private PMixED
Сохранение не-приватного headroom (10^2-10^6 токенов) 98% ≤56%
Зависимость от публичной модели Минимальная Растёт со временем
Контроль шума Адаптивный (по разногласию) Фиксированный

Важные ограничения

Авторы подчёркивают, что приватность вывода (inference privacy) не эквивалентна защите контента. Даже когда преимущество атаки на членство для запомненной «канарейки» неотличимо от нуля, «канарейка» эмитируется с той же частотой. Это означает, что метод защищает факт использования данных для обучения, но не предотвращает генерацию конфиденциального контента, если он был включён в обучающую выборку.

Практическое значение

Метод особенно актуален для API-сервисов, где модели, адаптированные на приватных данных, предоставляются через интерфейс генерации текста. PAC-приватность позволяет существенно снизить издержки конфиденциальности при сохранении качества, особенно в сценариях, где предсказания модели стабильны.

Источники
— arXiv:2609.05676: https://arxiv.org/abs/2609.05676
— arXivLabs: https://arxiv.org