COMRAD404

Лента

Новости, инструменты и практика ИИ

Разобраться в теме

За чем вы следите?

Как настроить VS Code для Python: интерпретатор, venv, запуск и отладка

Настройка Python в VS Code состоит из трёх независимых действий: установить Python, добавить расширение редактора и выбрать окружение проекта. Если пропустить последнее, пакеты могут устанавливаться...

Как настроить VS Code для C и C++: компилятор, сборка и отладчик

Чтобы писать на C в VS Code, одного расширения C/C++ недостаточно. Редактор показывает код и запускает инструменты, компилятор создаёт программу, а отладчик позволяет останавливать её...

Как настроить VS Code для работы: от первого запуска до проекта

Чтобы настроить VS Code, сначала откройте папку проекта, затем установите инструменты нужного языка и проверьте запуск программы. Цветовую тему и размер шрифта можно подобрать позже....

Рейтинг COMRAD404

Какая модель подходит для вашей задачи?

Топ-100 моделей: качество, код, скорость и стоимость. С фильтрами и описанием методологии.

Открыть рейтинг

Рой агентов DeepMind начал жульничать: проблема оказалась не в «характере» ИИ

В эксперименте Google DeepMind локальная уязвимость проверяющей системы за 27 минут распространилась среди автономных агентов. Разбираем, почему это не доказательство «злого ИИ», а предупреждение об...

Harbor Adapters: новый стандарт для тестирования AI-агентов на 80+ бенчмарках

Представлена унифицированная инфраструктура для оценки AI-агентов: Harbor Adapters портирует более 80 бенчмарков, а Harbor-Index предлагает 82 тщательно отобранных сложных задачи. Даже GPT-5.5 с Codex не...

HarvestBench: первый бенчмарк, измеряющий готовность LLM-агентов платить за отказ от убийства животных

Новый бенчмарк HarvestBench проверяет, сколько «топлива» LLM-агенты готовы потратить, чтобы объехать животное на поле, а не переехать его. Результаты показали разброс от 0,4% до 98,8%...

LLM не умеют строить модели производительности: бенчмарк PerfReasoning вскрывает разрыв между рассуждениями и кодом

Новый бенчмарк PerfReasoning оценивает способность LLM рассуждать о производительности аппаратного обеспечения. Закрытые модели проходят тест с результатом выше 90%, но написание аналитического кода для моделей...

ИИ-рекрутинг: от подбора резюме к агентам, оценивающим траектории и риски

Систематизированный обзор arXiv:2609.04286 прослеживает эволюцию AI в подборе персонала — от простого сопоставления пар до многоэтапных workflow с LLM-компонентами и инструментальными агентами. Авторы выделяют три...

Исследователи представили Iris-mini и Iris-pro — открытых поисковых агентов нового поколения

Команда исследователей опубликовала архитектуру и рецепт обучения поисковых агентов Iris-mini (35B-A3B) и Iris-pro (397B-A17B). Модели демонстрируют рекордные результаты в бенчмарках BrowseComp, DeepSearchQA и HLE, обходя...