Nemotron 3 Ultra взял золото на IMO 2026: NVIDIA открыла рецепт олимпиадного ИИ
NVIDIA выпустила открытый пайплайн для решения олимпиадных задач по математике на естественном языке. Три чекпоинта Nemotron 3 Ultra набрали 30 из 42 баллов на IMO...
COMRAD404
Новости, инструменты и практика ИИ
NVIDIA выпустила открытый пайплайн для решения олимпиадных задач по математике на естественном языке. Три чекпоинта Nemotron 3 Ultra набрали 30 из 42 баллов на IMO...
В блоге Hugging Face опубликована методика оценки стоимости и производительности энкодерных моделей при более чем миллиарде запросов в сутки. Автор предлагает подбирать конфигурацию GPU, размер...
Исследователи формализовали задачу предварительной подготовки среды без знания целевых заданий. Мета-агент с архивом превзошёл фиксированные методы на пяти из шести бенчмарков, но увеличение бюджета «изучения»...
Разобраться в теме
Вышел GoatCode v2.1.10 — open-source терминальный AI-агент, который умеет переключать LLM-провайдера прямо во время сессии при падении квоты, не теряя контекст. Поддержка 180+ провайдеров, параллельные...
Создатель Datasette и LLM комментирует экзистенциальный кризис разработчиков, столкнувшихся с кодинг-агентами. Уиллисон призывает сместить фокус с написания кода на инженерию более высокого уровня.
Глава Y Combinator Гэрри Тан считает, что американским разработчикам стоит разрешить открыто дистиллировать закрытые frontier-модели. Его аргумент: передовые системы сами обучались на общедоступном человеческом знании....
Рейтинг COMRAD404
Топ-100 моделей: качество, код, скорость и стоимость. С фильтрами и описанием методологии.
Открыть рейтингarXiv:2609.10724. Исследователи предлагают оценивать ИИ-агентов не только по успешности выполнения задач, но и по двум новым параметрам: операционная устойчивость и деликатное участие. В симуляции 120...
GitHub добавил в repository rulesets правило, которое блокирует слияние pull request, пока обнаруженные secret scanning alerts не будут разрешены. Функция доступна в публичной превью для...
GitHub объявил о доступности метрик активности в окне VS Code Agents. Данные появились в агрегированных и пользовательских отчётах Copilot за периоды в один и 28...
По данным TechCrunch со ссылкой на Bloomberg, китайская AI-лаборатория Moonshot AI рассчитывает выйти на $2 млрд годового темпа выручки к концу года. Рост связывают с...
OpenAI связывает галлюцинации языковых моделей не только с архитектурой LLM, но и с тем, как индустрия измеряет качество ответов: тесты часто поощряют угадывание вместо честного...
Структурированный вывод LLM нужен там, где ответ модели сразу попадает в код: тикеты, CRM, пайплайны агентов, RAG и проверки безопасности. Разбираем, чем отличаются JSON mode,...