Запись архива

Reddit обсуждают абляцию GLM-5.2: модель без отказов для агентных задач

Пользователь r/artificial сообщил о выпуске abliterated-model-large на базе GLM-5.2 с удалёнными отказами и дообучением для длительных агентных задач. Результаты на бенчмарках CyberGym, AgentHarm, AgentDojo и SWE-bench привлекли внимание сообщества.

Скриншот блога abliferation.ai с описанием abliterated-model-large
Скриншот блога abliferation.ai с описанием abliterated-model-large
Students study in the Montana State College library, 1905.jpg | by Unknown authorUnknown author | wikimedia_commons | CC BY-SA 3.0

Что произошло

Пользователь Reddit (r/artificial) 25 июля анонсировал выпуск abliterated-model-large — версии GLM-5.2, из которой удалены «направления отказов» (refusal directions) и которая дообучена для длительных агентных и состязательных задач. Цель — модель, не прекращающая работу при технических или «офенсивных» запросах. Разработчики заявляют нулевое удержание данных по умолчанию.

Почему это обсуждают

Снятие встроенной политики отказов вызывает споры: одни видят в этом инструмент для исследователей безопасности и сложных агентных сценариев, другие — риск злоупотреблений. Показатели на бенчмарках (особенно AgentHarm и CyberGym) заметно выше, чем у многих современных моделей, которые всё ещё отказываются от выполнения части задач.

Что известно и что остаётся неясным

Punkt Detail
Базовая модель GLM-5.2 c удалёнными отказами
Дообучение На длинных состязательных и агентных задачах
CyberGym 2%
AgentHarm compliance 2% (нуль отказов в опубликованном наборе)
AgentDojo utility 5%
SWE-bench Verified 2%
Terminal-Bench 2.1 1%
Доступ API (совместимость с OpenAI и Anthropic), нулевое удержание данных
Встроенная политика Отсутствует; правила задаёт пользователь

Данные предоставлены автором. Независимая верификация результатов пока не проводилась. На сайте abliferation.ai обещан полный доклад, но в открытом доступе код и веса модели не опубликованы.

Что проверить

Прежде всего стоит дождаться независимых аудитов от третьих сторон (например, сообщества AI Safety или лабораторий, не связанных с проектом). Верификационный лид — openai.com/news (независимая платформа, где могут появиться комментарии или исследования по этой теме). Также полезно отследить реакцию в r/Artificial и r/LocalLLaMA — возможно, появятся тесты на открытых датасетах.

Исходный источник: https://www.reddit.com/r/artificial/comments/1v6i979/we_released_an_abliterated_finetuned_glm52_high/
Верификационный лид: https://openai.com/news/