COMRAD404

Лента

Новости, инструменты и практика ИИ

Математики требуют от OpenAI доказать происхождение новых результатов

Подтверждений кражи неопубликованных идей пока нет. Но ответы OpenAI не исключают, что обезличенные диалоги исследователей могли повлиять на модели, а значит, компании нужен проверяемый аудит...

Новая техника PAC-приватности для автогенерации: меньше шума при стабильных предсказаниях

Исследователи представили метод PAC-Private Autoregressive Generation, который калибрует шум на основе разброса мнений ансамбля моделей, адаптированных на приватных данных. Это позволяет сохранять конфиденциальность при генерации...

Разобраться в теме

За чем вы следите?

Вышел Python 3.15.0 RC2: что нужно знать разработчикам AI-инструментов

Финальный кандидат Python 3.15 доступен для тестирования. Релиз-менеджер Хьюго ван Кеменад призывает мейнтейнеров готовить колёса к октябрьскому релизу. Саймон Уиллисон проверил совместимость своих AI-проектов —...

Память LLM-агентам нужна, но не любая: MERIT оценивает цену и пользу

Исследователи представили MERIT — бенчмарк для измерения предельной полезности долговременной памяти у LLM-агентов, выполняющих инструментальные задачи. Результаты показывают, что память повышает успешность с 0 до...

Рейтинг COMRAD404

Какая модель подходит для вашей задачи?

Топ-100 моделей: качество, код, скорость и стоимость. С фильтрами и описанием методологии.

Открыть рейтинг

Вышла llm 0.34: в логах появилось время выполнения запросов и новые исправления

Саймон Уиллисон выпустил обновление инструмента командной строки для работы с LLM. Главное новшество — отображение длительности выполнения запросов в логах. Также в версии исправлены ошибки...

AhaBench: новый бенчмарк проверяет, учатся ли AI-агенты на собственном опыте

Исследователи представили AhaBench — набор тестов для оценки способности языковых моделей учиться на предыдущем опыте в долгосрочных сценариях. Бенчмарк включает три компонента и показывает, что...

Google Research представила Personal Health Agent и новые результаты клинических ИИ-систем на The Check Up 2026

На мероприятии The Check Up Google Research показала Personal Health Agent — мультиагентную систему на базе больших мультимодальных моделей для носимых устройств, а также обнародовала...

Новый бенчмарк HybridDeepResearch: LLM-агенты проваливают гибридные SQL-запросы и веб-поиск

Команда Snowflake AI Research представила HybridDeepResearch — первый бенчмарк, проверяющий способность LLM-агентов одновременно работать с веб-поиском и SQL-запросами. Даже флагманские модели (GLM-5.2, Claude-Sonnet-4.6, GPT-5) набирают...

GitHub Copilot: корпоративное управление агентными операциями стало обязательным

GitHub ввёл централизованные управляемые разрешения для агентных операций Copilot — shell-команд, чтения и редактирования файлов, сетевых доменов. Настройки блокировки, ручного одобрения или автоматического выполнения теперь...

ColliePWA: мобильный интерфейс для AI-агентов в терминальных мультиплексорах

Вышел ColliePWA — прогрессивное веб-приложение для управления AI-агентами и терминальными сессиями со смартфона. Поддерживает herdr, tmux и zellij, передаёт байт-точный ANSI-вывод и работает через Tailscale.