OpenAI показала Evolved Policy Gradients для быстрой адаптации агентов
В 2018 году OpenAI представила экспериментальный метод Evolved Policy Gradients. Он позволяет искать функцию потерь, которая помогает агентам быстрее осваивать новые задачи и переносить навыки на незнакомые условия.
Открыть материал →
