Оперативная лента ИИ-сигналов

214 материалов

Короткие проверки популярных AI-сигналов из Telegram, Reddit, X и YouTube: что произошло, чему верить и почему это важно.

Схема работы фреймворка персонализации ИИ-ассистента преподавателя на основе промпт-инжиниринга

Персонализация ИИ-ассистента преподавателя: промпт-инжиниринг вместо дообучения

Исследователи представили фреймворк на основе промпт-инжиниринга для персонализации ответов ИИ-ассистента преподавателя. Система учитывает шесть параметров обучаемого, формируя 96 профилей, и анализирует когнитивную сложность запроса...

Открыть материал →
Иллюстрация тестирования голосовых агентов на следование неявным инструкциям через персону

Новый бенчмарк DSB-IFEval: как голосовые агенты следуют неявным инструкциям

Исследователи представили DuplexSpeechBench-IFEval — набор из 1038 тестов для оценки того, как full-duplex голосовые агенты следуют инструкциям, заданным через роль или персону, а не...

Открыть материал →
Схема HARNESSEVO — декомпозиция текстовой обвязки LLM-агента на четыре оптимизируемых слота

Локализованный выигрыш и ловушка равномерного деления бюджета: что показывает HARNESSEVO о самоэволюции LLM-агентов

Исследователи разложили обвязку LLM-агента на четыре слота и обнаружили, что почти вся польза от оптимизации сосредоточена в слоте рефлексии, а равномерное распределение вычислительного бюджета...

Открыть материал →
Иллюстрация тестирования LLM API с помощью мок-сервера

Почему у LLM-API до сих пор нет нормального тестового режима — вопрос, который задали на Hacker News

Разработчики жалуются, что для нагрузочного тестирования чат-ботов приходится тратить реальные токены или писать собственные моки. На Hacker News предлагают взять пример со Stripe и...

Открыть материал →
Схема работы Mireye: AI-агент отправляет запрос через API/MCP, получает структурированные данные, инструменты и сигналы о физическом объекте

Mireye (YC S26) строит «физический слой» для ИИ-агентов: 366 полей данных о каждом объекте в США

Стартап Ansh Chokshi превращает разрозненные данные о недвижимости, инфраструктуре и зонировании в единый API и MCP-сервер для агентов. В основе — не просто датасет,...

Открыть материал →
Лидерборд языковых моделей для игры Redactle

Redactle запустил лидерборд LLM: модели сравнивают по игре в угадывание статей

Redactle опубликовал лидерборд для языковых моделей: они угадывают скрытые заголовки статей, а результат считается по числу лишних ходов и стоимости.

Открыть материал →
Схема ускорения инференса LLM с помощью speculative decoding

NVIDIA разобрала co-design LLM для ускорения инференса через speculative decoding

NVIDIA опубликовала разбор speculative decoding как части совместного проектирования LLM: малый draft-модель предлагает токены, большая модель проверяет их параллельно, а ускорение зависит от длины...

Открыть материал →
Схема управления состоянием долгоживущего AI-агента с использованием Redis

Как удержать долгоживущего агента от потери нити: опыт сообщества Reddit

Пользователи Reddit обсуждают главный bottleneck долгоживущих агентов — управление памятью и состоянием. Вместо бесконечного расширения контекстного окна предлагается использовать stateful трекинг с Redis и...

Открыть материал →
Схема: демо ИИ превращается в производственную систему с проблемами данных и eval

Почему ИИ-демо часто не становятся рабочими системами: главные заблуждения 2025 года

Reddit-сообщество r/artificial обсуждает фундаментальные заблуждения вокруг ИИ. Опытные инженеры сходятся: главные проблемы — не в архитектуре, а в данных, метриках и отсутствии владельца результата.

Открыть материал →