COMRAD404

Лента

Новости, инструменты и практика ИИ

Wolof и арабский: новый параллельный корпус MudawanSn для машинного перевода

Исследователи представили MudawanSn — золотой стандарт параллельного корпуса для пары языков волоф — современный стандартный арабский. 1271 предложение из новостного дискурса Сенегала, четыре бенчмарка моделей...

LLM под микроскопом: как OCR-шум убивает точность извлечения данных из документов

Новый бенчмарк наглядно демонстрирует, что даже лучшие open-source LLM (Gemma, Qwen2.5, DeepSeek) резко теряют качество при работе с реальным OCR. Исследователи выявили типовые ошибки: галлюцинации,...

Эволюция навыков на лету: EvoSkill-GUI учит GUI-агентов исправлять ошибки без дообучения

Исследователи из Чжэцзянского университета представили EvoSkill-GUI — фреймворк, позволяющий GUI-агентам пересматривать и улучшать свои навыки в процессе выполнения задач, без дополнительного обучения. Система показала прирост...

Разобраться в теме

За чем вы следите?

MCPJam представила платформу для тестирования MCP-серверов в AI-клиентах

MCPJam запустила на Product Hunt платформу для проверки MCP-серверов — от симуляции пользовательских сценариев до повторяемых eval-тестов в CI/CD. Проект ориентирован на команды, чьи продукты...

Рефлексивное когнитивное выравнивание: новый фреймворк для LLM-агентов когнитивной стимуляции пожилых

Исследователи представили фреймворк RCA, который сочетает синтез диалогов (STaR-CS) и рефлексивное когнитивное выравнивание для LLM-агентов, проводящих когнитивную стимуляционную терапию (CST) для пожилых людей с когнитивными...

ИИ-агенты обогнали людей по бронированию авиабилетов: владелец travel-платформы делится данными

Владелец travel-платформы сообщил, что AI-агенты совершили больше бронирований и оплат, чем люди. Ключевой фактор — внедрение протокола MCP и изолированных платёжных шлюзов.

Рейтинг COMRAD404

Какая модель подходит для вашей задачи?

Топ-100 моделей: качество, код, скорость и стоимость. С фильтрами и описанием методологии.

Открыть рейтинг

GitHub добавил атрибут profileUrl в ответы SCIM

GitHub сообщил о добавлении стандартного атрибута profileUrl в ответы SCIM. Он содержит абсолютный URL аккаунта GitHub, связанного с внешней идентификацией, и упрощает автоматизацию доступа для...

OpenAI выпустила системное дополнение GPT-5-Codex для автономного агентного программирования

Компания OpenAI представила официальное дополнение к системной карте GPT-5, посвященное специализированной модели GPT-5-Codex с динамическим распределением вычислительных ресурсов для задач автономной разработки.

Автоматизация code review в GitHub Actions: как внедрить статический анализ LLM без перегрузки разработчиков

Разбираем, как настроить автоматический анализ PR через языковые модели в GitHub Actions, защитить пайплайн от лимитов токенов и фильтровать шумные предупреждения.

GitHub Enterprise Cloud: автоматизация SSO-авторизации для классических PAT и SSH-ключей

GitHub представил функциональность для Enterprise Cloud, позволяющую автоматизировать SSO-авторизацию классических персональных токенов доступа (PAT) и SSH-ключей для множества организаций с помощью нового API.

Twigg — stateful API для LLM, которая работает поверх любых провайдеров и сама управляет контекстом

Разработчики представили Twigg — API, который берёт на себя хранение и сборку контекста диалога, позволяя переключать модели между OpenAI, Anthropic, Google, xAI и другими без...