OpenAI показала Evolved Policy Gradients для быстрой адаптации агентов

В 2018 году OpenAI представила экспериментальный метод Evolved Policy Gradients. Он позволяет искать функцию потерь, которая помогает агентам быстрее осваивать новые задачи и переносить навыки на незнакомые условия.

Открыть материал →