Merge: оценка инженеров по ревью PR вместо Leetcode и ручного кода
На Hacker News показали Merge — платформу, где кандидаты вместо алгоритмических задач ревьюят PR, а AI-агент отвечает на комментарии и вносит правки. На момент...
Открыть сигнал →Короткие русскоязычные разборы популярных AI-сигналов из Telegram, Reddit, X и YouTube. Соцсети здесь работают как радар тем, а факты проверяются по первичным источникам.
Каждый пост отвечает на четыре вопроса: что произошло, почему это обсуждают, что подтверждено и что пока не ясно. Если тема пришла из соцсетей без сильного подтверждения, она маркируется как обсуждение, а не как факт.

На Hacker News показали Merge — платформу, где кандидаты вместо алгоритмических задач ревьюят PR, а AI-агент отвечает на комментарии и вносит правки. На момент...
Открыть сигнал →
На arXiv вышел препринт SearchAuditor: авторы представили бенчмарк SearchAuditBench и фреймворк для локализации, атрибуции и исправления ошибок в длинных поисковых агентах.
Открыть сигнал →
PRISM — четырёхэтапный синтез данных для обучения мультимодальных LLM следовать многошаговым рубрикам. На 10K примерах Qwen3-VL-4B вырос с 9,5% до 30,1% по строгой метрике...
Открыть сигнал →
Новый препринт arXiv предлагает DiSR — фреймворк, который разделяет 3D-восприятие и пространственные рассуждения: готовые модели восприятия строят структурированные 3D-данные, а LLM с LoRA рассуждает...
Открыть сигнал →
На HN опубликован Show HN проекта Kifly — сервис, который делает товары интернет-магазинов доступными для ИИ-агентов через MCP. Разбираем, что известно и что осталось...
Открыть сигнал →
Соло-разработчик представил Fius — агрегатор AI-моделей с единым токеном и общим биллингом. Разбираем, что заявлено в посте на r/artificial и что стоит проверить.
Открыть сигнал →
Препринт FinProBench предлагает строить рубрики оценки для финансовых ИИ-агентов на основе реальных профессиональных deliverables. Для узких ролей это заметно эффективнее обычных промптов.
Открыть сигнал →
Исследование Artificial Analysis сравнило стоимость инференса ведущих LLM. DeepSeek V4-Flash — ~$0.03 за тест, Kimi K3 — $0.86, GPT-5.6 Sol — $1.86, Claude Fable...
Открыть сигнал →
На Hacker News обсуждают, почему инференс-платформа Fireworks не добавляет открытые голосовые модели. Автор считает, что инференс надо оптимизировать под сценарий, а спрос на Kokoro,...
Открыть сигнал →
Пользователь r/artificial рассказывает, как LLM переходят от ответов к действиям, и спрашивает сообщество: это реальный сдвиг или хайп?
Открыть сигнал →
Новый препринт arXiv (cs.CL): LLM верно отвечают на вопросы тайваньского бар-экзамена, но спонтанно ссылаются не на те нормы. Авторы предлагают оценивать ответ и правовое...
Открыть сигнал →
Препринт JudgeArena объединяет AlpacaEval, Arena-Hard, MT-Bench и m-Arena-Hard под единым интерфейсом со сменными судьями и логированием метаданных. Разбираем, что подтверждено, а что пока заявлено...
Открыть сигнал →