Запись архива

GRASP: локальный анонимизатор текста на Llama-3.1-8B и GRPO

Новый arXiv-препринт предлагает GRASP — метод онлайн-дообучения небольшой модели для анонимизации текста на устройстве, который обходит ограничения DPO-дистилляции и работает при ~1% стоимости учителя GPT-4o.

Схема работы локального анонимизатора текста на основе GRPO
Схема работы локального анонимизатора текста на основе GRPO
Annual catalogue of Williamsport Dickinson Seminary for the academic year (1912) (14784526215).jpg | by Internet Archive Book Images | wikimedia_commons | No restrictions

Суть

В arXiv-препринте 2608.06526 представлен GRASP — метод обучения локального анонимизатора текста c помощью Group Relative Policy Optimization (GRPO). Одна небольшая модель на устройстве переписывает текст так, чтобы скрыть чувствительные атрибуты (возраст, локация, профессия), сохраняя при этом смысл. Авторы утверждают, что DPO-дистилляция с большого учителя лишь копирует его готовые решения, тогда как GRASP оптимизирует целевую функцию приватности и полезности онлайн, с защитой от reward hacking.

Почему это обсуждают

Современные LLM извлекают персональные признаки из обычного текста, что создаёт риск приватности. Классическая защита — анонимизация через фронт-модель (например, Gemini 2.5 Flash или Claude) — требует отправки приватного текста третьей стороне. GRASP предлагает альтернативу: обученная модель работает полностью локально на базе Llama-3.1-8B, при этом удаляет больше приватной информации при сопоставимом или лучшем балансе приватность/полезность.

Что подтверждено

Punkt Detail
Метод GRASP: GRPO + саморефайнмент, одна модель = анонимизатор, атакующий, судья
Базовая модель Llama-3.1-8B
Сравнение Лучше DPO-дистилляции по privacy-utility у трёх независимых LLM-судей
Стоимость ~1% от стоимости GPT-4o teacher, полностью on-device

На что смотреть дальше

Препринт опубликован как v1, результаты не прошли полноценное рецензирование. Стоит проверить: воспроизводимость на других языках (русский в аннотации не упомянут), устойчивость к reward hacking в длительных сессиях, поведение против сильных атакующих моделей вне авторских бенчмарков. Также полезно следить за публикациями Anthropic по безопасности, где тема локальной приватности пересекается с политикой развёртывания.

Источники: оригинал на arXiv — https://arxiv.org/abs/2608.06526; дополнительный контекст — https://www.anthropic.com/news.