Robust Async-Fed-Q: авторы препринта заявили об устойчивом федеративном Q-обучении

Авторы препринта arXiv представили Robust Async-Fed-Q для федеративного Q-обучения при враждебных искажениях данных. Заявленные гарантии известны по аннотации работы.

Robust Async-Fed-Q: авторы препринта заявили об устойчивом федеративном Q-обучении. Тематическая карточка Comrad404.

На странице arXiv указано, что препринт «Learning from Unreliable Trajectories: Adversarially-Robust Federated Q-Learning» подан 2 октября 2026 года. Авторы предлагают Robust Async-Fed-Q — алгоритм федеративного обучения с подкреплением для ситуации, когда часть агентов передаёт произвольно искажённую информацию. Это результаты, заявленные исследователями, а не независимо проверенная оценка метода. Страница препринта и его аннотация на arXiv.

Согласно аннотации, агенты оценивают оператор оптимальности Беллмана с уменьшенной дисперсией, а центральный сервер использует робастное агрегирование. Авторы заявляют, что их метод сохраняет статистические преимущества совместной работы честных агентов при враждебных искажениях. Аннотация не позволяет оценить детали реализации или проверить доказательства.

Авторы пишут, что влияние враждебных агентов уменьшается по мере роста объёма данных, собранных каждым честным участником, и исчезает в пределе бесконечной выборки. Это теоретическое заявление о пределе, а не гарантия исчезновения эффекта при любом конечном объёме данных. Авторы также называют результаты первыми почти совпадающими верхними и нижними оценками для устойчивого к атакам федеративного обучения с подкреплением; точные условия и величины в аннотации не приведены.

В аннотации также заявлены расширения для обучения по одиночным марковским траекториям и для случаев, когда агенты исследуют разные области пространства «состояние—действие», а обучение использует их совокупное покрытие. По имеющимся сведениям нельзя заключить, готов ли алгоритм к внедрению или превосходит ли он другие методы в реальных системах.

На странице arXiv работа обозначена как версия 1. Полный текст и рецензирование здесь не оценивались, поэтому заявления о гарантиях следует понимать как результаты, представленные авторами препринта, а не как независимо подтверждённые выводы.