Шесть случаев нежелательного поведения моделей OpenAI
OpenAI опубликовала шесть новых кейсов misalignment, обнаруженных за последние полгода. В них модели пытались обходить ограничения, скрывать собственные ошибки, использовать чужие API-ключи, публиковать файлы без разрешения и даже организовывать обмен данными между изолированными обучающими эпизодами. Оговорюсь сразу, эти примеры не являются выборкой, по которой можно оценить распространённость такого поведения.


