Тема

operativnaya-lenta: статьи, новости и разборы

Статьи, новости и разборы по теме «operativnaya-lenta»: ключевые события, понятные объяснения, практические материалы и проверенные источники COMRAD404.

В архиве 209 материалов

Материалы по теме

209 материалов
Схема работы фреймворка персонализации ИИ-ассистента преподавателя на основе промпт-инжиниринга

Персонализация ИИ-ассистента преподавателя: промпт-инжиниринг вместо дообучения

Исследователи представили фреймворк на основе промпт-инжиниринга для персонализации ответов ИИ-ассистента преподавателя. Система учитывает шесть параметров обучаемого, формируя 96 профилей, и анализирует когнитивную сложность запроса по таксономии Блума — всё без дообучения модели.

Открыть материал →
Иллюстрация тестирования голосовых агентов на следование неявным инструкциям через персону

Новый бенчмарк DSB-IFEval: как голосовые агенты следуют неявным инструкциям

Исследователи представили DuplexSpeechBench-IFEval — набор из 1038 тестов для оценки того, как full-duplex голосовые агенты следуют инструкциям, заданным через роль или персону, а не...

Открыть материал →
Схема HARNESSEVO — декомпозиция текстовой обвязки LLM-агента на четыре оптимизируемых слота

Локализованный выигрыш и ловушка равномерного деления бюджета: что показывает HARNESSEVO о самоэволюции LLM-агентов

Исследователи разложили обвязку LLM-агента на четыре слота и обнаружили, что почти вся польза от оптимизации сосредоточена в слоте рефлексии, а равномерное распределение вычислительного бюджета...

Открыть материал →
Иллюстрация тестирования LLM API с помощью мок-сервера

Почему у LLM-API до сих пор нет нормального тестового режима — вопрос, который задали на Hacker News

Разработчики жалуются, что для нагрузочного тестирования чат-ботов приходится тратить реальные токены или писать собственные моки. На Hacker News предлагают взять пример со Stripe и...

Открыть материал →
Схема работы Mireye: AI-агент отправляет запрос через API/MCP, получает структурированные данные, инструменты и сигналы о физическом объекте

Mireye (YC S26) строит «физический слой» для ИИ-агентов: 366 полей данных о каждом объекте в США

Стартап Ansh Chokshi превращает разрозненные данные о недвижимости, инфраструктуре и зонировании в единый API и MCP-сервер для агентов. В основе — не просто датасет,...

Открыть материал →
Лидерборд языковых моделей для игры Redactle

Redactle запустил лидерборд LLM: модели сравнивают по игре в угадывание статей

Redactle опубликовал лидерборд для языковых моделей: они угадывают скрытые заголовки статей, а результат считается по числу лишних ходов и стоимости.

Открыть материал →
Схема ускорения инференса LLM с помощью speculative decoding

NVIDIA разобрала co-design LLM для ускорения инференса через speculative decoding

NVIDIA опубликовала разбор speculative decoding как части совместного проектирования LLM: малый draft-модель предлагает токены, большая модель проверяет их параллельно, а ускорение зависит от длины...

Открыть материал →
Схема управления состоянием долгоживущего AI-агента с использованием Redis

Как удержать долгоживущего агента от потери нити: опыт сообщества Reddit

Пользователи Reddit обсуждают главный bottleneck долгоживущих агентов — управление памятью и состоянием. Вместо бесконечного расширения контекстного окна предлагается использовать stateful трекинг с Redis и...

Открыть материал →
Схема: демо ИИ превращается в производственную систему с проблемами данных и eval

Почему ИИ-демо часто не становятся рабочими системами: главные заблуждения 2025 года

Reddit-сообщество r/artificial обсуждает фундаментальные заблуждения вокруг ИИ. Опытные инженеры сходятся: главные проблемы — не в архитектуре, а в данных, метриках и отсутствии владельца результата.

Открыть материал →