Эра AI-агентов: сигнал с Reddit о переходе от «промптов» к «системам»
Пользователь r/artificial рассказывает, как LLM переходят от ответов к действиям, и спрашивает сообщество: это реальный сдвиг или хайп?
Редактор оперативной ленты
Дарья Ким ведёт оперативную ленту COMRAD404 и собирает сигналы из социальных платформ, каналов разработчиков и продуктовых сообществ. Её задача — быстро определить, где начинается новость и заканчивается пересказ чужого поста.
При подготовке публикаций сверяет первоисточник, время события, доступность функции и контекст обсуждения. Неподтверждённые детали в материалы не попадают.
Пользователь r/artificial рассказывает, как LLM переходят от ответов к действиям, и спрашивает сообщество: это реальный сдвиг или хайп?
Новый препринт arXiv (cs.CL): LLM верно отвечают на вопросы тайваньского бар-экзамена, но спонтанно ссылаются не на те нормы. Авторы предлагают...
Препринт JudgeArena объединяет AlpacaEval, Arena-Hard, MT-Bench и m-Arena-Hard под единым интерфейсом со сменными судьями и логированием метаданных. Разбираем, что подтверждено,...
Show HN: Clai превращает языковую модель в UNIX-фильтр stdin → stdout. Разбираем, что подтверждено, что нет и кому это может...
На arXiv вышел препринт Obshazard-bench — бенчмарка для проверки мультимодальных LLM на сырых спутниковых потоках в задачах оперативного реагирования на...
Новый препринт AgentMemBench сравнивает пять стратегий долгосрочной памяти для разговорных агентов на едином харнесе. Внешнее хранилище (EKV) лидирует по всем...
Новая работа на arXiv предлагает training-free фреймворк для генерации математических моделей операционных задач с помощью LLM. Метод использует короткие симуляции...
На Reddit обсуждают, как Китай догоняет США в AI за счёт открытых моделей, патентов и публикаций. Разбираем, что подтверждено, а...
Новый arXiv-препринт TAPR: отдельная модель на базе Phi-4-mini переписывает пользовательские промпты под задачу через GRPO и LLM-as-judge. Заявлен стабильный прирост...
Noisegate — шлюз с дифференциальной приватностью, который математически гарантирует защиту отдельных записей при запросах AI-агентов к чувствительным данным. Реализация на...
Новый метод V-Steer позволяет на этапе инференса восстанавливать приоритет системных промптов над пользовательскими, редактируя кэшированные векторы значений. Точность соблюдения первичных...
Исследователи сравнили локальные LLM в задачах перевода, тестируя single-target и family-scope промпты, а также разные стратегии few-shot обучения. Результаты: dedicated...