Защиту ИИ-моделей удалось обойти, замаскировав вредоносные запросы под рабочие задачи

Исследователи из Института им. Алана Тьюринга обнаружили (PDF) новый способ обойти защитные механизмы моделей искусственного интеллекта: если они отказываются напрямую отвечать на недопустимые вопросы, их можно включить в перечень задач для ИИ-агентов, помогающих в написании программного кода.
Это отрывок статьи. Полную версию читайте на сайте источника по ссылке ниже.