COMRAD404

Лента

Новости, инструменты и практика ИИ

MaruCheck: open-source верификатор для кода, написанного ИИ, не даёт агенту подкрутить тесты

Показан на Hacker News проект MaruCheck — локальный инструмент верификации, который сверяет код, сгенерированный ИИ, с отдельным человеческим контрактом. Если агент одновременно меняет реализацию и...

GitHub перевёл runner-образ Xcode 27 на macOS 27

GitHub обновил образ Xcode 27 для облачных macOS-раннеров: теперь он работает на macOS 27 и доступен в публичной превью. Образ предназначен для arm64-раннеров, а способ...

Автоматизация контекста в LangGraph: как настроить персистентную память и checkpoints на практике

Разбираем, как работают персистентные checkpoints и управление историей сообщений в LangGraph. Настраиваем сохранение состояний через SQLiteSaver, контролируем размер памяти и защищаем агентные пайплайны от потери...

Разобраться в теме

За чем вы следите?

GitHub ввёл cache-mode для Actions: разграничение прав на кеш на уровне джобов и защита от cache poisoning

GitHub запустил cache-mode — параметр, позволяющий задавать права на чтение и запись кеша для каждого воркфлоу или отдельного задания. Это снижает риски cache poisoning в...

Как настроить локальное кеширование контекста в Ollama для LLM-агентов: архитектура, память и реальная экономия

Разбираем внутреннюю архитектуру кеширования контекста в Ollama, настраиваем параметры KV-cache для автономных агентов и замеряем реальное ускорение генерации при многошаговых вызовах.

OpenAI представила фреймворк для оценки наблюдаемости цепочек рассуждений ИИ-моделей

Исследователи OpenAI опубликовали набор из 13 тестов для оценки того, насколько внутренние рассуждения языковых моделей поддаются мониторингу. Результаты показывают, что анализ цепочек мыслей значительно эффективнее...

Рейтинг COMRAD404

Какая модель подходит для вашей задачи?

Топ-100 моделей: качество, код, скорость и стоимость. С фильтрами и описанием методологии.

Открыть рейтинг

OpenAI представила методику оценки вклада ИИ в биологические исследования: тест на ускорение wet-lab

OpenAI опубликовала фреймворк для измерения того, насколько ИИ способен ускорять реальные лабораторные исследования. В тесте GPT-5 оптимизировала протокол молекулярного клонирования. Разбираем, что это меняет для...

Как настроить MCP-сервер для Claude Desktop: пошаговое руководство с реальными инструментами

MCP (Model Context Protocol) — открытый стандарт, который позволяет Claude Desktop подключать внешние инструменты: файловую систему, базы данных, API и веб-поиск. Разбираем архитектуру, установку, настройку...

Emirati Arabic LLM-бенчмарк Alyah: оценка диалектов выявила слабость даже у лучших моделей

Исследователи из TII представили бенчмарк Alyah для оценки понимания эмиратского диалекта арабского языка. Тестирование 53 моделей показало, что даже лучшие LLM значительно уступают носителям в...

Google Quantum AI: взлом ECDLP-256 потребует менее 500 000 физических кубитов — новые оценки криптоустойчивости

Исследователи Google Quantum AI представили новый вайтпейпер с пересмотренными оценками ресурсов для взлома эллиптической криптографии. Алгоритм Шора для ECDLP-256 может быть выполнен на системе с...