Запись архива

OpenAI обновила Moderation API: модель на базе GPT-4o проверяет текст и изображения

OpenAI представила модель модерации на базе GPT-4o для проверки текста и изображений. Компания заявляет о более точном выявлении вредоносного контента, но доступные сведения не позволяют оценить выигрыш для конкретного сервиса.

Иллюстрация проверки текста и изображения в системе модерации контента
Иллюстрация проверки текста и изображения в системе модерации контента
Visit of Ursula von der Leyen, President of the European Commission, to India (P-065755-00-36).jpg | by Europäische Kommission — Audiovisueller Dienst, CE — Service audiovisuel, EC — Audiovisual Service, Dati Bendo | wikimedia_commons | CC BY 4.0

OpenAI 26 сентября 2024 года объявила об обновлении Moderation API. Новая модель построена на базе GPT-4o и предназначена для выявления вредоносного контента в тексте и изображениях. Компания утверждает, что она точнее прежних решений, однако одного анонса недостаточно, чтобы определить, насколько улучшится модерация на конкретной платформе.

Для разработчиков главное изменение — возможность проверять изображения средствами Moderation API. Это касается приложений, где пользователи публикуют фотографии, иллюстрации или скриншоты наряду с текстом. Прежде чем менять рабочий процесс модерации, команде нужно проверить поддерживаемые входные данные и ответы API, а затем сравнить результаты на собственных примерах нарушений.

Модерация выходит за пределы текста

Из исходного сообщения OpenAI следует, что новая модель работает с двумя типами содержимого: текстом и изображениями. Это расширяет применение API для сервисов с пользовательскими публикациями. Например, площадка, которая раньше автоматически проверяла подпись к посту, может рассмотреть проверку прикреплённого изображения через тот же продукт OpenAI.

При этом способность модели анализировать изображения не означает, что она безошибочно установит смысл любого мема, скриншота или материала со сложным культурным контекстом. В анонсе говорится о повышении точности обнаружения вредоносного контента, но приведённой информации недостаточно, чтобы обещать одинаковый результат для всех языков, категорий нарушений и типов изображений.

По той же причине формулировка «точнее» требует аккуратного прочтения. Это заявление разработчика модели, а не результат независимого испытания на данных конкретного форума, образовательного сервиса или социальной платформы. Решение о внедрении зависит от того, какие ошибки для площадки опаснее: пропущенные нарушения или блокировка допустимых материалов.

Что разработчику проверить в документации

Сам анонс не стоит использовать как инструкцию по миграции. Актуальные способы передачи данных и ограничения перечисляются в руководстве OpenAI по модерации, а формат запросов и ответов — в справочнике Moderation API. Перед интеграцией следует сверить эти страницы с используемой версией приложения.

В частности, из имеющихся сведений нельзя делать вывод, что переход сводится к замене имени модели или что обработка ответа останется полностью прежней. В текущем черновике такие утверждения были, но исходный сигнал их не подтверждает. Не подтверждены им и конкретный формат передачи изображений, сроки расширения доступа, цена запросов и скорость обработки. Эти параметры нужно проверять в документации и условиях использования API, а не закладывать в план разработки по предположению.

Практичный первый тест — собрать небольшой набор уже разобранных командой случаев: допустимые публикации, явные нарушения и спорные материалы с изображениями. Затем сравнить ответы новой модели с действующими правилами и решениями модераторов. Отдельно полезно посмотреть, сколько допустимых публикаций попало на дополнительную проверку и какие нарушения система пропустила. Такой тест не заменит полноценной оценки, но покажет, помогает ли обновление с наиболее частыми задачами конкретного сервиса.

Автоматическая оценка не заменяет правила площадки

Moderation API сообщает результат классификации, а решение о действии принимает сервис, который его использует. Для одного продукта спорное изображение может означать отправку на ручную проверку, для другого — ограничение показа до уточнения контекста. Поэтому команде нужны собственные правила обработки ошибок и возможность пересмотреть решение там, где цена ошибочной блокировки высока.

Следующий шаг для разработчиков, заинтересованных в обновлении, — сверить возможности модели с актуальной документацией OpenAI и испытать её на материалах своей площадки. Анонс подтверждает расширение модерации на изображения и заявленное повышение точности; он не доказывает, что новая модель сократит число ошибок или затраты в каждом отдельном сервисе.

Источники