Оперативная лента

Короткие русскоязычные разборы популярных AI-сигналов из Telegram, Reddit, X и YouTube. Соцсети здесь работают как радар тем, а факты проверяются по первичным источникам.

214 сигналов

Как читать эту ленту

Каждый пост отвечает на четыре вопроса: что произошло, почему это обсуждают, что подтверждено и что пока не ясно. Если тема пришла из соцсетей без сильного подтверждения, она маркируется как обсуждение, а не как факт.

Схема работы фреймворка персонализации ИИ-ассистента преподавателя на основе промпт-инжиниринга

Персонализация ИИ-ассистента преподавателя: промпт-инжиниринг вместо дообучения

Исследователи представили фреймворк на основе промпт-инжиниринга для персонализации ответов ИИ-ассистента преподавателя. Система учитывает шесть параметров обучаемого, формируя 96 профилей, и анализирует когнитивную сложность запроса...

Открыть сигнал →
Иллюстрация тестирования голосовых агентов на следование неявным инструкциям через персону

Новый бенчмарк DSB-IFEval: как голосовые агенты следуют неявным инструкциям

Исследователи представили DuplexSpeechBench-IFEval — набор из 1038 тестов для оценки того, как full-duplex голосовые агенты следуют инструкциям, заданным через роль или персону, а не...

Открыть сигнал →
Схема HARNESSEVO — декомпозиция текстовой обвязки LLM-агента на четыре оптимизируемых слота

Локализованный выигрыш и ловушка равномерного деления бюджета: что показывает HARNESSEVO о самоэволюции LLM-агентов

Исследователи разложили обвязку LLM-агента на четыре слота и обнаружили, что почти вся польза от оптимизации сосредоточена в слоте рефлексии, а равномерное распределение вычислительного бюджета...

Открыть сигнал →
Иллюстрация тестирования LLM API с помощью мок-сервера

Почему у LLM-API до сих пор нет нормального тестового режима — вопрос, который задали на Hacker News

Разработчики жалуются, что для нагрузочного тестирования чат-ботов приходится тратить реальные токены или писать собственные моки. На Hacker News предлагают взять пример со Stripe и...

Открыть сигнал →
Схема работы Mireye: AI-агент отправляет запрос через API/MCP, получает структурированные данные, инструменты и сигналы о физическом объекте

Mireye (YC S26) строит «физический слой» для ИИ-агентов: 366 полей данных о каждом объекте в США

Стартап Ansh Chokshi превращает разрозненные данные о недвижимости, инфраструктуре и зонировании в единый API и MCP-сервер для агентов. В основе — не просто датасет,...

Открыть сигнал →
Лидерборд языковых моделей для игры Redactle

Redactle запустил лидерборд LLM: модели сравнивают по игре в угадывание статей

Redactle опубликовал лидерборд для языковых моделей: они угадывают скрытые заголовки статей, а результат считается по числу лишних ходов и стоимости.

Открыть сигнал →
Схема ускорения инференса LLM с помощью speculative decoding

NVIDIA разобрала co-design LLM для ускорения инференса через speculative decoding

NVIDIA опубликовала разбор speculative decoding как части совместного проектирования LLM: малый draft-модель предлагает токены, большая модель проверяет их параллельно, а ускорение зависит от длины...

Открыть сигнал →
Схема управления состоянием долгоживущего AI-агента с использованием Redis

Как удержать долгоживущего агента от потери нити: опыт сообщества Reddit

Пользователи Reddit обсуждают главный bottleneck долгоживущих агентов — управление памятью и состоянием. Вместо бесконечного расширения контекстного окна предлагается использовать stateful трекинг с Redis и...

Открыть сигнал →
Схема: демо ИИ превращается в производственную систему с проблемами данных и eval

Почему ИИ-демо часто не становятся рабочими системами: главные заблуждения 2025 года

Reddit-сообщество r/artificial обсуждает фундаментальные заблуждения вокруг ИИ. Опытные инженеры сходятся: главные проблемы — не в архитектуре, а в данных, метриках и отсутствии владельца результата.

Открыть сигнал →
Абстрактное изображение кибербезопасности и кода

Исследователи взломали ИИ-агентов Fortune 500 через файл llms.txt

Эксперты по безопасности выяснили, что файл llms.txt, предназначенный для инструктажа ИИ-агентов, стал вектором для атак на цепочку поставок и выполнения произвольного кода.

Открыть сигнал →
Скриншот отчёта Flawd с результатами мутационного тестирования

Flawd: мутационное тестирование для эпохи AI-агентов — локально и без утечки кода

Инструмент мутационного тестирования Flawd запущен как единый бинарник, работающий локально. Поддерживает Python, JS, TS, Go и Rust, не отправляет код на внешние серверы и...

Открыть сигнал →