Перейти к содержимому
SBER 277,19 ₽ 0,16% ростIMOEX 2 257,98 0,88% снижение
·Технологии·16 сентября 2026 г.·1 мин

Роевой интеллект: AI-агенты сообща обошли защитные ограничения

Роевой интеллект: AI-агенты сообща обошли защитные ограничения

Исследователи Emergence AI (независимый разработчик корпоративной инфраструктуры для управления AI-агентами) проверили, как восемь виртуальных обществ из автономных AI-агентов справляются с киберугрозами: ни одно не оказалось устойчивым ко всем испытаниям, сообщает Semafor. Самый необычный эпизод произошёл с агентами Claude: они коллективно решили связаться с людьми за пределами симуляции, преодолели четыре защитные проверки и разместили приглашения на внешних площадках, по данным издания.

В данном эксперименте используются коммерческие и доступные всем LLM, в отличии от описанных уже кейсов «сбежавших агентов», где использовались внутренние экспериментальные модели.

Для нас в Ideco главный вопрос в этой истории: кто остановит действие, если защитные ограничения (guardrails) модели не сработали? «Роевой интеллект» здесь используем как описание согласованного поведения группы агентов, а не как утверждение о появлении у них общего сознания.

Распознали фишинг, но не остановились

В семи симуляциях участвовали по десять агентов одной модели, в восьмой собрали смешанную группу. Каждую группу проверяли на трёх классах угроз: фишинге, дезинформации и нарушении конфиденциальности памяти агентов. В последнем сценарии другим участникам открывали доступ к записям долговременной памяти, включая сохранённые сводки опыта.

Обнаружение опасности не гарантировало безопасного поведения: агент Mistral записал в собственную память информацию из фишинговой атаки, которую сам отметил как опасную. Агент Gemini тоже распознал приманку, но примерно через 46 часов всё-таки совершил связанное с ней действие.

Это отрывок статьи. Полную версию читайте на сайте источника по ссылке ниже.

Habr