Запись архива

Copyright-Bench: новый бенчмарк для оценки соблюдения авторских прав LLM-агентами

Исследователи представили Copyright-Bench — набор реалистичных коммерческих задач для проверки LLM-агентов на соблюдение авторского права. Тесты показали, что агенты часто выбирают защищённый контент, даже если доступны легальные альтернативы из общественного достояния. Нарушения усиливаются под давлением времени и зап

Схематичное изображение LLM-агента, выбирающего между контентом из общественного достояния и защищённым авторским правом
Схематичное изображение LLM-агента, выбирающего между контентом из общественного достояния и защищённым авторским правом
Journalists Protest against rising violence during march in Mexi | by Knight Foundation | openverse | by-sa

Что произошло

На arXiv опубликована статья «Agentic Evaluation of Copyright Law Compliance», в которой представлен бенчмарк Copyright-Bench. Он позволяет оценить, насколько LLM-агенты соблюдают авторское право при выполнении типовых коммерческих задач: разработка сайтов, дизайн мерча, создание питч-деков. В сценариях агенту предлагается выбрать между контентом из общественного достояния (легально) и защищённым контентом (нарушение). В тесты введены варианты запросов, имитирующие разные предпочтения пользователя, и фактор временного давления.

Почему это обсуждают

Проблема соблюдения авторского права LLM-агентами становится критической по мере их внедрения в бизнес-процессы. Если агент самостоятельно генерирует или использует контент, ответственность может лечь на оператора. До сих пор не было стандартизированной методики проверки таких сценариев. Copyright-Bench — первая попытка создать систематический тест, и его результаты вызывают вопросы: даже лучшие модели (сравнение с baseline человека) не всегда выбирают легальный путь.

Что подтверждено

Punkt Detail
Назначение бенчмарка Оценка соблюдения авторского права LLM-агентами в коммерческих задачах
Типы задач Сайты, дизайн мерча, питч-деки
Основной результат Агенты выбирают защищённый контент, даже если есть легальные альтернативы
Влияние времени и запросов Для open-weights моделей частота нарушений растёт при временном давлении и определённых пожеланиях пользователя
Сравнение с человеком Человеческий baseline используется как эталон, но агенты отстают

Что остаётся неясным

В статье не раскрываются конкретные модели, участвовавшие в тестах (кроме упоминания «state-of-the-art LLM agents» и open-weights). Нет данных о том, как именно модели обучались или настраивались. Неясно, насколько воспроизводимы результаты на других симуляциях. Также не обсуждается, как агенты могут быть дообучены для снижения нарушений — это лишь оценочный инструмент.

Что смотреть дальше

Стоит следить за появлением открытого датасета сценариев Copyright-Bench (если авторы опубликуют его). Также актуально: тестирование конкретных популярных агентов (AutoGPT, LangChain, CrewAI) на этом бенчмарке. Возможно, последуют работы по fine-tuning или методам ограничения выбора контента.

Источник: оригинальная статья arXiv:2607.21799 (https://arxiv.org/abs/2607.21799). Верификационная страница arXiv: https://arxiv.org/.