
Суть
В arXiv-препринте 2608.06526 представлен GRASP — метод обучения локального анонимизатора текста c помощью Group Relative Policy Optimization (GRPO). Одна небольшая модель на устройстве переписывает текст так, чтобы скрыть чувствительные атрибуты (возраст, локация, профессия), сохраняя при этом смысл. Авторы утверждают, что DPO-дистилляция с большого учителя лишь копирует его готовые решения, тогда как GRASP оптимизирует целевую функцию приватности и полезности онлайн, с защитой от reward hacking.
Почему это обсуждают
Современные LLM извлекают персональные признаки из обычного текста, что создаёт риск приватности. Классическая защита — анонимизация через фронт-модель (например, Gemini 2.5 Flash или Claude) — требует отправки приватного текста третьей стороне. GRASP предлагает альтернативу: обученная модель работает полностью локально на базе Llama-3.1-8B, при этом удаляет больше приватной информации при сопоставимом или лучшем балансе приватность/полезность.
Что подтверждено
| Punkt | Detail |
|---|---|
| Метод | GRASP: GRPO + саморефайнмент, одна модель = анонимизатор, атакующий, судья |
| Базовая модель | Llama-3.1-8B |
| Сравнение | Лучше DPO-дистилляции по privacy-utility у трёх независимых LLM-судей |
| Стоимость | ~1% от стоимости GPT-4o teacher, полностью on-device |
На что смотреть дальше
Препринт опубликован как v1, результаты не прошли полноценное рецензирование. Стоит проверить: воспроизводимость на других языках (русский в аннотации не упомянут), устойчивость к reward hacking в длительных сессиях, поведение против сильных атакующих моделей вне авторских бенчмарков. Также полезно следить за публикациями Anthropic по безопасности, где тема локальной приватности пересекается с политикой развёртывания.
Источники: оригинал на arXiv — https://arxiv.org/abs/2608.06526; дополнительный контекст — https://www.anthropic.com/news.
