
На arXiv опубликована работа «PAC-Private Autoregressive Generation: Calibrating Noise to Ensemble Disagreement», предлагающая новый подход к обеспечению приватности при генерации текста языковыми моделями. В отличие от традиционных методов, таких как PMixED, новая техника использует концепцию PAC-приватности (Probably Approximately Correct privacy), которая адаптирует уровень шума к степени стабильности предсказаний модели.
Как это работает
Авторы строят m=128 пересекающихся миров из приватного корпуса, где каждая запись появляется ровно в m/2 мирах. Для каждого мира обучается отдельный адаптер поверх замороженной публичной модели. При генерации каждого токена публичная модель формирует кандидатное множество, миры «голосуют», а разногласие между ними, взвешенное по апостериорной вероятности, определяет необходимый уровень PAC-шума. Если все миры единогласны, шум не добавляется.
Технические детали
Исследователи доказывают, что взаимная информация между секретом S и сгенерированной последовательностью Y_{1:T} ограничена: I(S;Y_{1:T}) ≤ I(S;H_T) ≤ bT. Ключевые вклады работы включают:
— Расширение PAC-приватности на автогрессивную генерацию
— Обработку адаптивных самогенерируемых контекстов
— Введение техники coupled decoding, которая сохраняет учёт приватности и избегает жадной деградации
Результаты экспериментов
На датасете WikiText-103 с моделью GPT-2-small метод сохраняет 74% выигрыша от тонкой настройки при бюджете на токен 2^{-32}. Успешность атак на членство (membership inference) ограничена 51.08% после 10^6 токенов. Оценки энтропии апостериорного распределения показывают утечку примерно 17% от заряженного бюджета.
Сравнение с PMixED
| Параметр | PAC-Private | PMixED |
|---|---|---|
| Сохранение не-приватного headroom (10^2-10^6 токенов) | 98% | ≤56% |
| Зависимость от публичной модели | Минимальная | Растёт со временем |
| Контроль шума | Адаптивный (по разногласию) | Фиксированный |
Важные ограничения
Авторы подчёркивают, что приватность вывода (inference privacy) не эквивалентна защите контента. Даже когда преимущество атаки на членство для запомненной «канарейки» неотличимо от нуля, «канарейка» эмитируется с той же частотой. Это означает, что метод защищает факт использования данных для обучения, но не предотвращает генерацию конфиденциального контента, если он был включён в обучающую выборку.
Практическое значение
Метод особенно актуален для API-сервисов, где модели, адаптированные на приватных данных, предоставляются через интерфейс генерации текста. PAC-приватность позволяет существенно снизить издержки конфиденциальности при сохранении качества, особенно в сценариях, где предсказания модели стабильны.
Источники
— arXiv:2609.05676: https://arxiv.org/abs/2609.05676
— arXivLabs: https://arxiv.org