Запись архива

Сейфгарды для ChatGPT-агентов: как Reddit решает проблему автономности

На r/artificial обсуждают, чем отличается «предложить» от «сделать»: где провести границу автономности агентов и какие ограничения выставлять до выдачи реальных прав.

Интерфейс управления правами и разрешениями ChatGPT-агента
Интерфейс управления правами и разрешениями ChatGPT-агента
Journalists Protest against rising violence during march in Mexi | by Knight Foundation | openverse | by-sa

Что случилось

На Reddit (r/artificial) пользователь didiTonic поднял практический вопрос: какие меры предосторожности стоит применять до того, как дать ChatGPT-агенту право действовать самостоятельно. Поводом стало интервью с исследователем ИИ-безопасности Романом Ямпольским, который утверждает, что более умные системы сложнее предсказывать и контролировать. В обсуждении речь идёт не об AGI, а о существующей уже сейчас проблеме: разнице между «предложить» и «исполнить».

Суть проблемы

Автор поста отмечает принципиальную разницу между генерацией текста и реальным действием: попросить ChatGPT написать черновик письма — не то же самое, что позволить агенту отправить его. То же касается запросов к базе данных, деплоя кода, покупок, изменения файлов и приглашений на встречи. Предложение автора: модель генерирует варианты, а отдельный контрольный слой решает, каким действиям разрешено стать реальностью.

Предложенные меры

В посте перечислены возможные сейфгарды, сведённые в таблицу.

Punkt Detail
Минимальные права Агенту выдаются только разрешения, нужные для конкретной задачи
Подтверждение Требуется для необратимых или внешних действий
Валидация вывода Структурированные ответы проверяются детерминированным кодом
Изоляция Браузинг и исполнение кода отделены от чувствительных систем
Ограничения Лимиты на траты, время выполнения и число действий
Логирование Полные записи промптов, вызовов инструментов и результатов
Второй этап оценки Дополнительная проверка перед важными действиями
Обратимость Каждая операция по возможности должна быть откатываемой

Где граница и что дальше

Ключевой вопрос дискуссии — баланс между контролем и удобством. Подтверждение каждого шага делает агента бесполезным; слишком мало проверок превращает неверно понятую инструкцию в реальную проблему. Единого решения в треде нет: участники спорят, какие действия считать необратимыми и где автономия оправдана. Это обсуждение сообщества, а не устоявшийся стандарт. Стоит следить за ответами в исходном треде и за документацией OpenAI по permissions и approval-режимам: она меняется быстрее, чем формируется консенсус.

Источники: оригинальный пост — https://www.reddit.com/r/artificial/comments/1vi800c/what_safeguards_do_you_use_before_giving_chatgpt/ ; лента проверки фактов Comrad404 — https://comrad404.com/pulse/