
Что произошло
Пользователь Reddit (r/artificial) 25 июля анонсировал выпуск abliterated-model-large — версии GLM-5.2, из которой удалены «направления отказов» (refusal directions) и которая дообучена для длительных агентных и состязательных задач. Цель — модель, не прекращающая работу при технических или «офенсивных» запросах. Разработчики заявляют нулевое удержание данных по умолчанию.
Почему это обсуждают
Снятие встроенной политики отказов вызывает споры: одни видят в этом инструмент для исследователей безопасности и сложных агентных сценариев, другие — риск злоупотреблений. Показатели на бенчмарках (особенно AgentHarm и CyberGym) заметно выше, чем у многих современных моделей, которые всё ещё отказываются от выполнения части задач.
Что известно и что остаётся неясным
| Punkt | Detail |
|---|---|
| Базовая модель | GLM-5.2 c удалёнными отказами |
| Дообучение | На длинных состязательных и агентных задачах |
| CyberGym | 2% |
| AgentHarm compliance | 2% (нуль отказов в опубликованном наборе) |
| AgentDojo utility | 5% |
| SWE-bench Verified | 2% |
| Terminal-Bench 2.1 | 1% |
| Доступ | API (совместимость с OpenAI и Anthropic), нулевое удержание данных |
| Встроенная политика | Отсутствует; правила задаёт пользователь |
Данные предоставлены автором. Независимая верификация результатов пока не проводилась. На сайте abliferation.ai обещан полный доклад, но в открытом доступе код и веса модели не опубликованы.
Что проверить
Прежде всего стоит дождаться независимых аудитов от третьих сторон (например, сообщества AI Safety или лабораторий, не связанных с проектом). Верификационный лид — openai.com/news (независимая платформа, где могут появиться комментарии или исследования по этой теме). Также полезно отследить реакцию в r/Artificial и r/LocalLLaMA — возможно, появятся тесты на открытых датасетах.
Исходный источник: https://www.reddit.com/r/artificial/comments/1v6i979/we_released_an_abliterated_finetuned_glm52_high/
Верификационный лид: https://openai.com/news/