Запись архива

LoRA на аблейтированной модели: наследуемое поведение или результат дообучения? Разбор кейса

Инженер протестировал LoRA-адаптер, обученный на модели Qwen с удалённым механизмом отказа. Результат: улучшение по целевой задаче оказалось статистически незначимым, а всё «безопасное» поведение адаптер унаследовал от базы. Разбираем, почему это важно для всех, кто работает с открытыми LLM.

Диаграмма, показывающая наследование поведения от базовой модели к LoRA-адаптеру
Диаграмма, показывающая наследование поведения от базовой модели к LoRA-адаптеру
Student Studying in the Communications Library (11056539964).jpg | by University of Illinois Library | wikimedia_commons | CC BY 2.0

На Reddit (r/artificial) опубликован технический разбор, который поднимает редко обсуждаемую проблему: насколько поведение LoRA-адаптера определяется его собственным обучением, а насколько — свойствами базовой модели, которая перед этим была модифицирована.

Суть эксперимента

Автор — разработчик сайд-проекта ClawHunt — обучил LoRA-адаптер (ранг 16, ~80 млн обучаемых параметров) поверх аблейтированной (ablated) открытой модели Qwen. Адаптер решал узкую задачу: вспоминать внутренние соглашения по кодовой базе. При этом базовая модель была лишена механизма отказа (refusal) через абляцию — то есть не могла сама отклонять нежелательные запросы.

Ключевой вывод: наследуемое поведение

Адаптер не добавил и не убрал ни одного отказа. Всё «безопасное» или «небезопасное» поведение было целиком унаследовано от базовой модели. Автор подчёркивает: если оценивать только целевую метрику адаптера (точность ответов по коду), можно легко пропустить тот факт, что весь контур безопасности пришёл «в нагрузку» из базы, а не был сформирован дообучением.

Статистическая значимость: честный ноль

Адаптер прошёл внутренние бенчмарки, но улучшение по сравнению с предыдущей версией оказалось статистически незначимым (тест МакНемара, p=0.5). Фактически — ничья, а не победа. Автор честно признаёт это, что редко встречается в публичных отчётах.

Сравнение с Claude

На том же наборе промптов адаптер сравнивался с Claude Sonnet 5 и Opus 5. Ожидаемо адаптер выиграл в доменной точности (Claude не видел этих данных). Но два варианта Claude разошлись между собой по типу галлюцинаций — причём непредсказуемым для автора образом. Это дополнительный сигнал, что даже внутри одной линейки моделей поведение может различаться сильнее, чем кажется.

Практические ограничения и вопросы

Автор прямо задаёт сообществу вопрос: многие ли, работая с аблейтированными или иным образом модифицированными открытыми моделями, проверяют наследуемое поведение? Или это считается решённой проблемой, если базовая модель «известная»?

Кейс показывает: LoRA не перезаписывает свойства базы, а наследует их. Если база была аблейтирована (например, для снятия ограничений), адаптер унаследует это отсутствие ограничений — независимо от задачи. Для продакшен-систем, особенно в регулируемых областях, это критично.

Источники

Оригинальное обсуждение на Reddit: https://www.reddit.com/r/artificial/comments/1wjp12l/discussion_finetuning_vs_inheriting_base_model/
Верификация: политика безопасности Anthropic (https://www.anthropic.com/news) — как пример подхода к аудиту наследуемого поведения в закрытых моделях.