Оперативная лента ИИ-сигналов

214 материалов

Короткие проверки популярных AI-сигналов из Telegram, Reddit, X и YouTube: что произошло, чему верить и почему это важно.

Редакционная обложка COMRAD404: Нейтральный текст без инструкций способен обходить защиту LLM — наблюдение с Reddit

Нейтральный текст без инструкций способен обходить защиту LLM — наблюдение с Reddit

Пользователь r/artificial описывает устойчивый сдвиг активаций в средних и поздних слоях LLM при подаче длинного безобидного текста без инструкций, который будто бы отключает RLHF-ограничения....

Открыть материал →
Редакционная обложка COMRAD404: WebFetch в Claude выдаёт модели саммари вместо источников: разбор PSA с Reddit

WebFetch в Claude выдаёт модели саммари вместо источников: разбор PSA с Reddit

Пользователь Reddit обнаружил, что WebFetch в Claude Opus 5 отдаёт модели не исходный текст, а саммари малой модели. Из-за этого в исследовании появились выдуманные...

Открыть материал →
Редакционная обложка COMRAD404: Сейфгарды для ChatGPT-агентов: как Reddit решает проблему автономности

Сейфгарды для ChatGPT-агентов: как Reddit решает проблему автономности

На r/artificial обсуждают, чем отличается «предложить» от «сделать»: где провести границу автономности агентов и какие ограничения выставлять до выдачи реальных прав.

Открыть материал →
Редакционная обложка COMRAD404: SearchAuditor: как находить и исправлять сбои длинных поисковых агентов

SearchAuditor: как находить и исправлять сбои длинных поисковых агентов

На arXiv вышел препринт SearchAuditor: авторы представили бенчмарк SearchAuditBench и фреймворк для локализации, атрибуции и исправления ошибок в длинных поисковых агентах.

Открыть материал →
Редакционная обложка COMRAD404: PRISM: как научить мультимодальные модели исполнять приоритизированные инструкции

PRISM: как научить мультимодальные модели исполнять приоритизированные инструкции

PRISM — четырёхэтапный синтез данных для обучения мультимодальных LLM следовать многошаговым рубрикам. На 10K примерах Qwen3-VL-4B вырос с 9,5% до 30,1% по строгой метрике...

Открыть материал →
Редакционная обложка COMRAD404: DiSR: разделение 3D-восприятия и пространственных рассуждений

DiSR: разделение 3D-восприятия и пространственных рассуждений

Новый препринт arXiv предлагает DiSR — фреймворк, который разделяет 3D-восприятие и пространственные рассуждения: готовые модели восприятия строят структурированные 3D-данные, а LLM с LoRA рассуждает...

Открыть материал →