
На Reddit (r/artificial) опубликован технический разбор, который поднимает редко обсуждаемую проблему: насколько поведение LoRA-адаптера определяется его собственным обучением, а насколько — свойствами базовой модели, которая перед этим была модифицирована.
Суть эксперимента
Автор — разработчик сайд-проекта ClawHunt — обучил LoRA-адаптер (ранг 16, ~80 млн обучаемых параметров) поверх аблейтированной (ablated) открытой модели Qwen. Адаптер решал узкую задачу: вспоминать внутренние соглашения по кодовой базе. При этом базовая модель была лишена механизма отказа (refusal) через абляцию — то есть не могла сама отклонять нежелательные запросы.
Ключевой вывод: наследуемое поведение
Адаптер не добавил и не убрал ни одного отказа. Всё «безопасное» или «небезопасное» поведение было целиком унаследовано от базовой модели. Автор подчёркивает: если оценивать только целевую метрику адаптера (точность ответов по коду), можно легко пропустить тот факт, что весь контур безопасности пришёл «в нагрузку» из базы, а не был сформирован дообучением.
Статистическая значимость: честный ноль
Адаптер прошёл внутренние бенчмарки, но улучшение по сравнению с предыдущей версией оказалось статистически незначимым (тест МакНемара, p=0.5). Фактически — ничья, а не победа. Автор честно признаёт это, что редко встречается в публичных отчётах.
Сравнение с Claude
На том же наборе промптов адаптер сравнивался с Claude Sonnet 5 и Opus 5. Ожидаемо адаптер выиграл в доменной точности (Claude не видел этих данных). Но два варианта Claude разошлись между собой по типу галлюцинаций — причём непредсказуемым для автора образом. Это дополнительный сигнал, что даже внутри одной линейки моделей поведение может различаться сильнее, чем кажется.
Практические ограничения и вопросы
Автор прямо задаёт сообществу вопрос: многие ли, работая с аблейтированными или иным образом модифицированными открытыми моделями, проверяют наследуемое поведение? Или это считается решённой проблемой, если базовая модель «известная»?
Кейс показывает: LoRA не перезаписывает свойства базы, а наследует их. Если база была аблейтирована (например, для снятия ограничений), адаптер унаследует это отсутствие ограничений — независимо от задачи. Для продакшен-систем, особенно в регулируемых областях, это критично.
Источники
Оригинальное обсуждение на Reddit: https://www.reddit.com/r/artificial/comments/1wjp12l/discussion_finetuning_vs_inheriting_base_model/
Верификация: политика безопасности Anthropic (https://www.anthropic.com/news) — как пример подхода к аудиту наследуемого поведения в закрытых моделях.
