Запись архива

Учебный проект: как собрать AI-детектор с нуля и зачем это нужно

Себастьян Рашка показал, как построить детектор ИИ-текста: от датасета до локального API и интерфейса, и как использовать такой детектор в качестве верификатора для обучения модели.

Интерфейс детектора ИИ-текста с оценкой по частям текста из проекта Себастьяна Рашки
Интерфейс детектора ИИ-текста с оценкой по частям текста из проекта Себастьяна Рашки
Imagen destacada del articulo fuente

Себастьян Рашка, автор рассылки Ahead of AI, опубликовал 15 августа 2026 года платный пост, в котором показывает, как с нуля собрать собственный детектор ИИ-текста. Это не обзор готовых сервисов, а сквозной проект: от подготовки датасета и дообучения модели до локального API и браузерного интерфейса.

Пост вышел на фоне того, что Substack добавил в интерфейс собственную функцию определения ИИ-текста. Отдельно Рашка пишет, что ему часто задают вопросы о локальных DIY-проектах на небольших языковых моделях. Он решил объединить эти темы и показать, как можно реализовать детектор и одновременно использовать его как верификатор для обучения языковой модели писать так, чтобы её текст не распознавался как ИИ-сгенерированный.

Параметр Данные
Автор и площадка Себастьян Рашка, рассылка Ahead of AI на Substack
Дата публикации 15 августа 2026
Тема Создание AI-детектора с нуля: датасет, дообучение DistilBERT, локальный API и UI
Упомянутые подходы Классификаторы, пертурбационные тесты, perplexity, водяные знаки
Заявленное ограничение Детекторы — игра в кошки-мышки, возможны ложные срабатывания

Зачем Рашка собрал детектор

Автор называет проект учебным. Его цель — объяснить, как работают AI-чекеры на практике, и показать, что даже небольшая модель может использоваться не только для генерации текста, но и как скоринговая или проверяющая система. По его словам, это пример верификатор-ориентированного сценария, который выходит за рамки обычных reasoning-моделей, натренированных на математике и коде.

В аннотации к посту значится RLVR — обучение с подкреплением на проверяемых вознаграждениях. В данном случае детектор выступает таким проверяющим: модель должна генерировать текст, который не получает метку «создано ИИ». Рашка подчёркивает, что речь идёт не о промышленном фильтре, а о способе изучить ограничения AI-детекторов.

Что внутри проекта

Итогом работы Рашка называет AI-детектор API, который могут использовать и люди, и агенты, а также удобный локальный UI. Интерфейс возвращает общий балл AI-вероятности для всего текста и может подсвечивать оценки отдельных фрагментов.

Технически проект строится на дообучении DistilBERT-классификатора. Модель возвращает оценку от 0 до 100. Точнее, это оценка вероятности того, что текст принадлежит классу «сгенерировано ИИ», по мнению классификатора. Сам автор предупреждает: эту цифру нельзя трактовать как универсальную вероятность того, что текст написан ИИ, — она опирается на обучающее распределение конкретной модели.

Рашка указывает, что его подход похож на модели Pangram, которые, насколько ему известно, стоят за функцией детекции на Substack. При этом он не утверждает, что это официально подтверждённая информация.

Как автор объясняет ограничения

Рашка прямо пишет, что AI-чекеры — это «игра в кошки-мышки». Сначала детектор учится находить паттерны, характерные для одной модели. Затем другая или обновлённая модель перестаёт проявлять эти паттерны и избегает обнаружения. Детектор приходится обновлять, и так продолжается дальше.

Кроме того, детекторы могут давать ложные срабатывания: человеческий текст иногда помечается как ИИ-сгенерированный. Этот риск автор называет ожидаемым и призывает учитывать его при использовании любых подобных инструментов.

Что пока не подтверждено

В открытой части поста нет готовых метрик точности, сравнения с другими детекторами и явной ссылки на открытый код или датасет. Подробности реализации доступны в платной версии рассылки. Связь между Pangram и встроенным детектором Substack также остаётся предположением автора, а не официальной информацией.

Пока нельзя сказать, насколько хорошо такой детектор работает на русскоязычных текстах. Исходный пример ориентирован на англоязычные данные и стандартный пайплайн дообучения трансформеров.

Вывод для разработчиков

Проект полезен как учебный пример локального скоринга текста: он показывает, что детектор можно собрать из доступных компонентов и развернуть у себя, а не только обращаться к внешним API. Отдельного внимания заслуживает схема, при которой детектор становится верификатором для другого LLM.

Вместе с тем к результатам любого подобного детектора стоит относиться осторожно. Перед использованием в реальных публикациях разумно проверить модель на собственных текстах и учитывать, что нулевой или низкий балл не гарантирует «человеческое» происхождение материала.

Источник: https://magazine.sebastianraschka.com/p/ai-detector-from-scratch