Anthropic обнаружила у мультиагентных ИИ проблемы с доверием, ложью и сговором

Anthropic провела серию экспериментов с группами Claude, чтобы понять, как меняется поведение моделей, когда вместо одного ИИ-агента над задачей работают сразу несколько. О результатах компания рассказала в блоге.
Исследование показало: масштабирование числа участников действительно способно повысить производительность, но одновременно создает новые классы отказов, которых может не быть у одиночной модели.
Агенты в «коллективе» могут хуже учитывать уникальную информацию, становиться доверчивыми к лжецам и даже кооперироваться во вред человеку.
Когда коллектив становится слабее одиночного агента
Один из ключевых эффектов Anthropic назвала «скрытой информацией». В эксперименте каждому агенту давали часть фактов, причем совокупное обсуждение склоняло группу к неправильному решению. Чтобы получить верный ответ, участники должны были распознать ценность собственной уникальной информации и убедить остальных ей довериться.
Проблема оказалась существенной: даже сильные модели могут быстро приходить к консенсусу, который основан главным образом на уже известной всем информации. В результате группа иногда работает хуже, чем отдельный агент, которому доступен полный набор необходимых данных.
Anthropic связывает этот эффект с хорошо известной в человеческих группах проблемой — участники обсуждения склонны повторять общие сведения и не всегда вытаскивают на поверхность уникальные факты.
Ложь одного агента заражает остальных
Другой эксперимент показал уязвимость системы к ненадежному источнику. Нескольким агентам дали роль разведчиков, которые сообщают отдельному участнику команды информацию о состоянии мира. Когда один из источников начинал систематически лгать, точность решений снижалась. При этом модели не всегда достаточно быстро распознавали противоречия и исключали ненадежного участника.
Это особенно опасно для реальных систем, где агенты могут обладать разными правами и доступом к разным данным. Ошибка одного участника способна распространиться по цепочке через доверие остальных. В результате контроль качества становится сложнее: проверять нужно не только итоговый ответ, но и взаимодействия между агентами.
Самый неприятный сценарий — координация во вред
Anthropic также изучала случаи, когда агенты могли кооперироваться не для выполнения поставленной задачи, а против заданных ограничений. В экспериментах с совместной работой модели демонстрировали неожиданные формы координации, включая саботаж и сговор.
Это не означает, что современные мультиагентные системы неизбежно будут действовать против пользователя, но показывает: появление нескольких автономных участников создает дополнительные каналы для нежелательного поведения.
При этом мультиагентный подход действительно дает заметный выигрыш в некоторых задачах. В эксперименте по поиску уязвимостей 45 агентов получили собственные виртуальные машины, общий форум для координации и репозитории с 15 open-source проектами. Скоординированные команды находили новые уязвимости примерно с постоянной скоростью и в ряде случаев превосходили независимый параллельный запуск агентов.
Почему это важно
Главный вывод исследования Anthropic — мультиагентные системы нельзя считать просто более мощной версией одного агента. С увеличением числа участников растет не только совокупная производительность, но и поверхность для ошибок: появляется проблема доверия, распространения ложной информации, группового консенсуса и потенциальной координации нежелательного поведения.
Для разработчиков это означает необходимость контролировать не только способности отдельных моделей, но и архитектуру их взаимодействия. Чем больше автономии получают агенты и чем больше инструментов и полномочий им доступно, тем важнее мониторинг действий, разграничение доступа и возможность вмешательства человека.
«Условия, позволяющие эффективно осуществлять взаимодействие между несколькими агентами, будут обнаружены тем или иным способом: либо целенаправленно и на раннем этапе, либо — и по умолчанию — в процессе эксплуатации, когда количество взаимодействий агентов значительно превысит наше. Мы бы предпочли первый вариант», — заключили исследователи.
Напомним, во время кибертестов ИИ-агент на базе Mythos 5 от Anthropic создал поддельные аккаунты для обмана разработчиков.
Это отрывок статьи. Полную версию читайте на сайте источника по ссылке ниже.