
Что произошло
На arXiv опубликован препринт Semalith v1.4 — компактный классификатор безопасности для LLM, построенный на основе DeBERTa-v3-base (184M параметров). Модель выполняет одновременную классификацию по трём осям: обнаружение инъекций промптов, общий вред и соответствие нормативным требованиям финансового сектора (BFSI). Выходной слой — 22 класса (BENIGN, 9 подтипов инъекций, общий вред, 11 меток BFSI) плюс вспомогательная головка из 4 суперкатегорий. Обучалась на 76 204 строках из 49 публичных источников с дедупликацией через SHA-1 от всех оценочных наборов (21 из 22 — нулевое загрязнение, максимум 0,22%).
Почему обсуждают
Semalith v1.4 привлекает внимание из-за сочетания экстремально малого размера (44x меньше Llama-Guard-3-8B) и высокой точности на специфических задачах. В 7 из 7 тестов на инъекции промптов модель обходит Llama-Guard-3-8B, а на 208 бенчмарках с безопасными агентными промптами показывает FPR = 0,000 против 0,063 у конкурента. При этом на общих тестах вреда (WildGuardMix, HEx-PHI, HarmBench) лидирует Llama-Guard-3 — авторы честно фиксируют это как комплементарный разрыв.
Что подтверждено
Авторы предоставляют результаты по 22 открытым бенчмаркам, включая SyntheticPromptInject, BIPIA, MultiPI, WildGuardMix, HarmBench, ToxicChat. В 11 из 18 общих бенчмарков (кроме инъекций) Semalith v1.4 выигрывает. Шесть слабых мест задокументированы в разделе 6. Для диалоговых сценариев рекомендуется версия v1.3 (ToxicChat F1 0.624), а v1.4 — когда важны BFSI-метки или нулевой FPR на безопасных агентных промптах.
Что остаётся неясным
Не раскрыты детали архитектуры DeBERTa-v3-base, использованной для обучения — не указаны гиперпараметры, размер пакета, количество эпох. Также неясна практическая применимость в реальных системах: заявленная точность может не воспроизводиться на других наборах данных, отличных от использованных бенчмарков. Пока не опубликована модель на Hugging Face или сопутствующий код для воспроизведения.
| Punkt | Detail |
|---|---|
| Модель | Semalith v1.4, 184M параметров, DeBERTa-v3-base |
| Задачи | Инъекции промптов, общий вред, финансовое регулирование (BFSI) |
| Размер относительно Llama-Guard-3-8B | 44x меньше |
| Результаты на инъекциях | 7/7 побед, FPR = 0,000 на 208 безопасных агентных промптах |
| Результаты на общем вреде | Уступает Llama-Guard-3 (WildGuardMix, HEx-PHI, HarmBench) |
| Слабые места | 6 задокументированы в разделе 6 |
| Рекомендация | v1.3 для диалогов, v1.4 для BFSI и нулевого FPR |
Что проверять
Стоит следить за публикацией модели и кода, а также за независимыми тестами на других доменах (например, в здравоохранении или юридическом контексте). Особый интерес — воспроизводимость заявленного нулевого FPR на агентных промптах. Полезно сравнить с другими лёгкими классификаторами, такими как ShieldGemma или HolisticSafety.
Источник: оригинальная статья arXiv:2607.22545v1 (https://arxiv.org/abs/2607.22545). Проверка: https://arxiv.org/.