Оперативная лента ИИ-сигналов

214 материалов

Короткие проверки популярных AI-сигналов из Telegram, Reddit, X и YouTube: что произошло, чему верить и почему это важно.

Редакционная обложка COMRAD404: AgentMemBench: бенчмарк долгосрочной памяти агентов — внешнее хранилище обходит конкурентов

AgentMemBench: бенчмарк долгосрочной памяти агентов — внешнее хранилище обходит конкурентов

Новый препринт AgentMemBench сравнивает пять стратегий долгосрочной памяти для разговорных агентов на едином харнесе. Внешнее хранилище (EKV) лидирует по всем метрикам качества, но требует...

Открыть материал →
Редакционная обложка COMRAD404: Моделирование операционных задач с LLM: неопределённость и симуляция

Моделирование операционных задач с LLM: неопределённость и симуляция

Новая работа на arXiv предлагает training-free фреймворк для генерации математических моделей операционных задач с помощью LLM. Метод использует короткие симуляции для оценки промежуточных шагов...

Открыть материал →
Редакционная обложка COMRAD404: Китай использует открытую модель против закрытых систем OpenAI — что говорят данные

Китай использует открытую модель против закрытых систем OpenAI — что говорят данные

На Reddit обсуждают, как Китай догоняет США в AI за счёт открытых моделей, патентов и публикаций. Разбираем, что подтверждено, а что остаётся гипотезой.

Открыть материал →
Редакционная обложка COMRAD404: TAPR: RL-переписчик промптов для LLM заявляет рост на Natural Questions и GSM8K

TAPR: RL-переписчик промптов для LLM заявляет рост на Natural Questions и GSM8K

Новый arXiv-препринт TAPR: отдельная модель на базе Phi-4-mini переписывает пользовательские промпты под задачу через GRPO и LLM-as-judge. Заявлен стабильный прирост точности, код открыт.

Открыть материал →
Редакционная обложка COMRAD404: Noisegate: дифференциальная приватность для недоверенных AI-агентов

Noisegate: дифференциальная приватность для недоверенных AI-агентов

Noisegate — шлюз с дифференциальной приватностью, который математически гарантирует защиту отдельных записей при запросах AI-агентов к чувствительным данным. Реализация на GitHub.

Открыть материал →
Редакционная обложка COMRAD404: V-Steer: редактирование кэшированных значений для соблюдения иерархии инструкций в LLM

V-Steer: редактирование кэшированных значений для соблюдения иерархии инструкций в LLM

Новый метод V-Steer позволяет на этапе инференса восстанавливать приоритет системных промптов над пользовательскими, редактируя кэшированные векторы значений. Точность соблюдения первичных ограничений вырастает с 18%...

Открыть материал →
Редакционная обложка COMRAD404: Оценка влияния промптов и демонстраций на перевод локальными LLM (arXiv)

Оценка влияния промптов и демонстраций на перевод локальными LLM (arXiv)

Исследователи сравнили локальные LLM в задачах перевода, тестируя single-target и family-scope промпты, а также разные стратегии few-shot обучения. Результаты: dedicated MT системы остаются сильнее,...

Открыть материал →
Редакционная обложка COMRAD404: Weak-to-Strong On-Policy Distillation: слабые модели как учителя для сильных LLM

Weak-to-Strong On-Policy Distillation: слабые модели как учителя для сильных LLM

Новая работа с arXiv предлагает метод дистилляции, при котором несколько слабых моделей (меньшего размера) могут улучшить сильную модель-студента без необходимости в более крупном учителе....

Открыть материал →
Редакционная обложка COMRAD404: SARA: последовательное адаптивное выделение бюджетов для RLVR

SARA: последовательное адаптивное выделение бюджетов для RLVR

Исследователи предложили метод SARA, который сокращает расход роллаутов в RLVR за счёт раннего определения насыщенных групп и перераспределения бюджета. На моделях 1.5B и 3B...

Открыть материал →
Редакционная обложка COMRAD404: FAR.AI запустили лидерборд безопасности AI-моделей: тест на 1500 джейлбрейков

FAR.AI запустили лидерборд безопасности AI-моделей: тест на 1500 джейлбрейков

FAR.AI представили автоматизированный тест безопасности для AI-моделей. Лидерборд оценивает устойчивость к джейлбрейкам: Fable 5 и GPT-5.6 Sol показали лучшие результаты, Gemini 3.1 Pro и...

Открыть материал →