Запись архива

Semalith v1.4: 184M-параметровый классификатор безопасности обходит Llama-Guard-3-8B по обнаружению инъекций промптов

Новая модель от arXiv: Semalith v1.4 (184M параметров) превосходит Llama-Guard-3-8B в 7 из 7 тестов на инъекции промптов, при 44-кратном уменьшении размера, но уступает в общем вреде.

Архитектура модели Semalith v1.4 — 184M-параметровый классификатор безопасности на основе DeBERTa-v3
Архитектура модели Semalith v1.4 — 184M-параметровый классификатор безопасности на основе DeBERTa-v3
Journalists Protest against rising violence during march in Mexi | by Knight Foundation | openverse | by-sa

Что произошло

На arXiv опубликован препринт Semalith v1.4 — компактный классификатор безопасности для LLM, построенный на основе DeBERTa-v3-base (184M параметров). Модель выполняет одновременную классификацию по трём осям: обнаружение инъекций промптов, общий вред и соответствие нормативным требованиям финансового сектора (BFSI). Выходной слой — 22 класса (BENIGN, 9 подтипов инъекций, общий вред, 11 меток BFSI) плюс вспомогательная головка из 4 суперкатегорий. Обучалась на 76 204 строках из 49 публичных источников с дедупликацией через SHA-1 от всех оценочных наборов (21 из 22 — нулевое загрязнение, максимум 0,22%).

Почему обсуждают

Semalith v1.4 привлекает внимание из-за сочетания экстремально малого размера (44x меньше Llama-Guard-3-8B) и высокой точности на специфических задачах. В 7 из 7 тестов на инъекции промптов модель обходит Llama-Guard-3-8B, а на 208 бенчмарках с безопасными агентными промптами показывает FPR = 0,000 против 0,063 у конкурента. При этом на общих тестах вреда (WildGuardMix, HEx-PHI, HarmBench) лидирует Llama-Guard-3 — авторы честно фиксируют это как комплементарный разрыв.

Что подтверждено

Авторы предоставляют результаты по 22 открытым бенчмаркам, включая SyntheticPromptInject, BIPIA, MultiPI, WildGuardMix, HarmBench, ToxicChat. В 11 из 18 общих бенчмарков (кроме инъекций) Semalith v1.4 выигрывает. Шесть слабых мест задокументированы в разделе 6. Для диалоговых сценариев рекомендуется версия v1.3 (ToxicChat F1 0.624), а v1.4 — когда важны BFSI-метки или нулевой FPR на безопасных агентных промптах.

Что остаётся неясным

Не раскрыты детали архитектуры DeBERTa-v3-base, использованной для обучения — не указаны гиперпараметры, размер пакета, количество эпох. Также неясна практическая применимость в реальных системах: заявленная точность может не воспроизводиться на других наборах данных, отличных от использованных бенчмарков. Пока не опубликована модель на Hugging Face или сопутствующий код для воспроизведения.

Punkt Detail
Модель Semalith v1.4, 184M параметров, DeBERTa-v3-base
Задачи Инъекции промптов, общий вред, финансовое регулирование (BFSI)
Размер относительно Llama-Guard-3-8B 44x меньше
Результаты на инъекциях 7/7 побед, FPR = 0,000 на 208 безопасных агентных промптах
Результаты на общем вреде Уступает Llama-Guard-3 (WildGuardMix, HEx-PHI, HarmBench)
Слабые места 6 задокументированы в разделе 6
Рекомендация v1.3 для диалогов, v1.4 для BFSI и нулевого FPR

Что проверять

Стоит следить за публикацией модели и кода, а также за независимыми тестами на других доменах (например, в здравоохранении или юридическом контексте). Особый интерес — воспроизводимость заявленного нулевого FPR на агентных промптах. Полезно сравнить с другими лёгкими классификаторами, такими как ShieldGemma или HolisticSafety.

Источник: оригинальная статья arXiv:2607.22545v1 (https://arxiv.org/abs/2607.22545). Проверка: https://arxiv.org/.