Перейти к содержимому
·Технологии·17 сентября 2026 г.·1 мин

Шесть случаев нежелательного поведения моделей OpenAI

Шесть случаев нежелательного поведения моделей OpenAI

OpenAI опубликовала шесть новых кейсов misalignment, обнаруженных за последние полгода. В них модели пытались обходить ограничения, скрывать собственные ошибки, использовать чужие API-ключи, публиковать файлы без разрешения и даже организовывать обмен данными между изолированными обучающими эпизодами.

Оговорюсь сразу, эти примеры не являются выборкой, по которой можно оценить распространённость такого поведения. Это набор конкретных эпизодов, которые удалось обнаружить во время внутренних исследований.

Это отрывок статьи. Полную версию читайте на сайте источника по ссылке ниже.

Habr