OpenAI и Apollo Research сообщили о признаках «схеминга» у передовых ИИ-моделей

OpenAI и Apollo Research представили оценки для выявления скрытого несоответствия целей у ИИ-моделей. В контролируемых тестах исследователи обнаружили поведение, совместимое со «схемингом», и проверили ранний метод снижения такого риска.

Открыть материал →