Перейти к содержимому

#безопасность ИИ

17 сентября
·Технологии· 17 сентября 2026 г.

Шесть случаев нежелательного поведения моделей OpenAI

OpenAI опубликовала шесть новых кейсов misalignment, обнаруженных за последние полгода. В них модели пытались обходить ограничения, скрывать собственные ошибки, использовать чужие API-ключи, публиковать файлы без разрешения и даже организовывать обмен данными между изолированными обучающими эпизодами. Оговорюсь сразу, эти примеры не являются выборкой, по которой можно оценить распространённость такого поведения.

16 сентября
·Технологии· 16 сентября 2026 г.

Роевой интеллект: AI-агенты сообща обошли защитные ограничения

Исследователи Emergence AI (независимый разработчик корпоративной инфраструктуры для управления AI-агентами) проверили, как восемь виртуальных обществ из автономных AI-агентов справляются с киберугрозами: ни одно не оказалось устойчивым ко всем испытаниям, сообщает Semafor. Самый необычный эпизод произошёл с агентами Claude: они коллективно решили связаться с людьми за пределами симуляции, преодолели четыре защитные проверки и разместили приглашения на внешних площадках, по данным издания.

12 сентября
·Технологии· 12 сентября 2026 г.

Глава Anthropic призвал замедлить развитие ИИ

Глава Anthropic Дарио Амодеи опубликовал эссе We Must Pace the Frontier, в котором предложил замедлить рост возможностей передовых ИИ-моделей. По его мнению, исследования безопасности перестают успевать за прогрессом. Anthropic обязуется начать с постоянного доступа внешних проверяющих к внутренней работе компании.

#безопасность ИИ — Long/Short