COMRAD404

Лента

Новости, инструменты и практика ИИ

Локализованный выигрыш и ловушка равномерного деления бюджета: что показывает HARNESSEVO о самоэволюции LLM-агентов

Исследователи разложили обвязку LLM-агента на четыре слота и обнаружили, что почти вся польза от оптимизации сосредоточена в слоте рефлексии, а равномерное распределение вычислительного бюджета между...

Разобраться в теме

За чем вы следите?

Новый бенчмарк DSB-IFEval: как голосовые агенты следуют неявным инструкциям

Исследователи представили DuplexSpeechBench-IFEval — набор из 1038 тестов для оценки того, как full-duplex голосовые агенты следуют инструкциям, заданным через роль или персону, а не явно....

R²Adapter: адаптер для гибридного RAG без лишних затрат

На arXiv появилась статья, в которой описывается R²Adapter — легковесный адаптер, динамически распределяющий запросы между vanilla RAG и graph-based RAG. Результат: до 59% меньше обращений...

Персонализация ИИ-ассистента преподавателя: промпт-инжиниринг вместо дообучения

Исследователи представили фреймворк на основе промпт-инжиниринга для персонализации ответов ИИ-ассистента преподавателя. Система учитывает шесть параметров обучаемого, формируя 96 профилей, и анализирует когнитивную сложность запроса по...

Рейтинг COMRAD404

Какая модель подходит для вашей задачи?

Топ-100 моделей: качество, код, скорость и стоимость. С фильтрами и описанием методологии.

Открыть рейтинг

Автономные ИИ-агенты в разработке: архитектура, изоляция и реальные пределы автономности

Разбираем архитектуру современных ИИ-агентов для разработки, способы изоляции окружения, ограничения моделей при работе с большими кодовыми базами и практические шаги для безопасного внедрения автоматизации.

Автоматизация разработки с Cursor и Claude 3.5 Sonnet: настройка агентов и правил проекта

Практическое руководство по настройке Cursor и Claude 3.5 Sonnet: конфигурация .cursorrules, работа с Composer, Chat, ограничения модели и проверка результатов для автономной разработки кода.

Почему у LLM-API до сих пор нет нормального тестового режима — вопрос, который задали на Hacker News

Разработчики жалуются, что для нагрузочного тестирования чат-ботов приходится тратить реальные токены или писать собственные моки. На Hacker News предлагают взять пример со Stripe и внедрить...

GitHub Actions обновляет контроль над раннерами, токенами и переиспользуемыми рабочими процессами

В начале сентября GitHub Actions получил три обновления: REST API для отслеживания устаревания версий раннеров, разрешение vulnerability-alerts для GITHUB_TOKEN и новые свойства job context для...