Запись архива

Автономный AI-агент работал 4,5 дня и отказался сертифицировать себя сам

Разработчик запустил один промпт в AI-агент на воскресенье, а через четыре с половиной дня агент корректно отказался сертифицировать собственную работу. Эксперимент с открытым протоколом и цепью доказательств.

Схема автономной работы AI-агента с фазой аудита и отказом в сертификации
Схема автономной работы AI-агента с фазой аудита и отказом в сертификации
Редакционная тематическая обложка COMRAD404

Что произошло

Разработчик Framework-Drift опубликовал спецификацию многосуточного автономного AI-агента для исследовательской инженерии. Один промпт, загруженный в потребительский AI-агент без кастомного оркестратора, запустил непрерывную работу на 4 дня 8 часов 53 минуты. Результат: агент завершил сессию с исходом METHOD_NEEDS_REPAIR — честный провал по спецификации. Агент сам провел adversarial-ревью, заблокировал заморозку метода с тремя HIGH и четырьмя MEDIUM находками.

Почему это обсуждают

Эксперимент примечателен тремя аспектами. Во-первых, агент работал автономно почти пять дней без вмешательства человека. Во-вторых, он корректно отказался сертифицировать собственную работу — то есть исполнил правило спецификации, а не попытался скрыть дефекты. В-третьих, разработчик опубликовал хеши коммитов и артефактов (SHA-256) до открытия репозитория: это позволяет позже проверить, что никакие данные не были ретроспективно изменены.

Что подтверждено и что нет

Punkt Detail
Продолжительность 4 дня 8 часов 53 минуты
Коммитов в ветке 93, все с удаленной идентификацией
Тестов пройдено 447 тестов управляемого набора
Раундов ревью 11 (4 — контракт, 7 — реализация)
Исход METHOD_NEEDS_REPAIR — честный провал
Научный результат Не заявлен и не запущен
Репозиторий с доказательствами Закрыт, откроется при заморозке метода

Разработчик намеренно не открывает репозиторий сейчас, чтобы избежать окна контаминации для будущего запечатанного научного прогона. Публикация хешей до открытия — это механизм верификации: когда репозиторий откроется, можно будет проверить, что ничего не было подделано.

Что смотреть дальше

Запланирован Pass 3. Его результат и длительность будут добавлены в UPDATES.md независимо от исхода. Сейчас разработчик приглашает к изучению спецификации — она воспроизведена дословно в ORIGINAL_PROMPT.verbatim.md. Сообщество на Hacker News обсуждает, насколько такой подход масштабируем и не является ли это просто демонстрацией удачного стечения обстоятельств.

Источник: оригинальная публикация на GitHub (https://github.com/Framework-Drift/governed-pass) и обсуждение на Hacker News (https://news.ycombinator.com/item?id=49486021). Верификация: блог GitHub (https://github.blog/).