Запись архива

Sakana AI представила PC-ALM — метод локального обучения, который тренирует сети до 1000 слоёв

Метод Augmented Lagrangian Predictive Coding от Sakana AI обходит ограничения классического обратного распространения, сохраняя послойные локальные обновления и достигая точности BP на глубоких архитектурах.

Схема работы Augmented Lagrangian Predictive Coding от исследователей Sakana AI
Схема работы Augmented Lagrangian Predictive Coding от исследователей Sakana AI
Students study in the Montana State College library, 1905.jpg | by Unknown authorUnknown author | wikimedia_commons | CC BY-SA 3.0

Исследователи Sakana AI Джеффри Сили и Джулиан Гоулд опубликовали метод Augmented Lagrangian Predictive Coding (PC-ALM) — альтернативу обратному распространению ошибки, которая сохраняет локальность обновлений и позволяет обучать сети глубиной до 1000 слоёв. Код на JAX под лицензией MIT уже доступен в репозитории проекта.

Почему это важно для разработчиков

Классический Backpropagation (BP) остаётся стандартом обучения нейросетей, но его глобальная природа создаёт фундаментальные ограничения. Алгоритм требует последовательного выполнения трёх фаз: прямой проход, обратный проход и обновление весов. Каждая фаза блокирует последующую, что затрудняет распараллеливание и не соответствует известным механизмам биологических нейронных сетей.

Локальные методы обучения, такие как Predictive Coding (PC), решают эту проблему, позволяя каждому слою обновляться независимо на основе локальной информации. Однако на практике PC показывает существенное отставание от BP на глубоких и узких архитектурах — сигнал ошибки затухает, не достигая первых слоёв.

Как работает PC-ALM

Сили и Гоулд переформулировали задачу обучения как оптимизацию с ограничениями: минимизировать функцию потерь при условии, что каждый скрытый слой является функцией предыдущего. В классическом PC это решается квадратичным штрафом за несоответствие между активацией слоя и прогнозом снизу.

PC-ALM добавляет к каждому ограничению множитель Лагранжа λ_i, размерность которого совпадает с размерностью скрытого слоя. Процесс обучения чередует два шага: градиентный спуск по активациям и обновление множителя, которое накапливает ошибку прогноза. Авторы описывают это как ПИ-регулятор на каждом слое: ошибка прогноза — пропорциональная составляющая, множитель Лагранжа — интегральная.

Ключевое преимущество: при обнулении множителей PC-ALM превращается в обычный PC. В линейных сетях при выполнении условия спектральной устойчивости метод сходится к точке, где множители Лагранжа в точности равны градиентам обратного распространения.

Результаты экспериментов

Исследователи протестировали метод на residual MLP с шириной и глубиной от 8 до 128 слоёв на датасетах MNIST и Fashion-MNIST. При бюджете вычислений T = 2L (два прохода на слой) PC-ALM показал следующие результаты:

  • В эталонной конфигурации (ширина 32, глубина 32, ReLU, Fashion-MNIST) точность BP составила 78,66%, PC — 68,13%, PC-ALM — 77,75%.
  • Косинусное сходство градиентов с BP выросло с 0,604 до 0,909.
  • На 1000-слойных residual MLP (ширина 32, ReLU, 5 эпох на MNIST) PC-ALM отстал от BP всего на 2 процентных пункта.
  • Метод стабильно превосходил PC на всех протестированных архитектурах, включая ResNet-18 на CIFAR-10 и Tiny ImageNet.

Что остаётся неясным

Несмотря на впечатляющие результаты на небольших бенчмарках, PC-ALM остаётся исследовательским методом. Его эффективность на больших языковых моделях, распределённых кластерах или в задачах за пределами компьютерного зрения пока не подтверждена. Авторы не приводят данных о времени обучения по сравнению с BP на промышленных конфигурациях.

Как это проверить

Разработчики могут воспроизвести результаты с помощью официального репозитория на JAX. Код работает на CPU и GPU, позволяет запустить сетку экспериментов ширина-глубина из статьи. Для интеграции в существующие пайплайны потребуется адаптация — метод требует настройки гиперпараметров (скорость обучения множителей α и штраф ρ), которые влияют на сходимость.

Источники

Оригинальная публикация на MarkTechPost: https://www.marktechpost.com/2026/09/14/sakana-ai-researchers-introduce-pc-alm-a-layer-local-alternative-to-backpropagation-that-trains-1000-layer-networks/

Репозиторий с кодом на GitHub: https://github.com/SakanaAI/PC-ALM (ссылка гипотетическая, в источнике не указана прямая ссылка, только упоминание)

Блог Sakana AI: https://sakana.ai/pc-alm/ (ссылка гипотетическая, в источнике не указана прямая ссылка, только упоминание)

Примечание редакции: На момент публикации у нас нет возможности независимо проверить все заявленные результаты. Статья основана на пресс-релизе и препринте исследователей. Рекомендуем разработчикам самостоятельно протестировать метод на своих задачах перед принятием решений о внедрении.

Источники