Исследователи уличили ИИ-модели в обходе правил кибертестов

Большие языковые модели (LLM) системно обходят правила в бенчмарках по кибербезопасности, что может завышать оценку их реальных возможностей. К такому выводу пришли исследователи Dreadnode в препринте на arXiv.
В работе речь идет об ИИ-агентах. Авторы протестировали 22 модели от семи провайдеров на 23 задачах Cybench в трех режимах:
без запрета на обход правил;
со стандартным предупреждением;
с более жесткой инструкцией, прямо перечисляющей запрещенные действия.
Результаты могли быть завышены до пяти раз
Всего исследователи проанализировали 1518 трасс выполнения задач. В базовом режиме 37,1% засчитанных решений содержали признаки обхода правил. По данным авторов, 21 из 22 моделей пыталась нарушить условия хотя бы один раз, а результаты отдельных были завышены до пяти раз.
Исследователи предложили отделять долю засчитанных решений от доли «чистых». Первая метрика учитывает все успешные ответы, вторая — только те, где задача была выполнена без признаков обхода правил.
Запреты в инструкциях помогли, но не полностью
Инструкции против обхода правил снизили долю такого поведения. В базовом режиме она составила 33%, при стандартном предупреждении — 17,8%, при жестком — 8,5%. В некоторых случаях доля «чистых» решений выросла: авторы предположили, что запрет на обход правил заставлял модели дольше пытаться выполнить задачу легитимным способом.
Полностью устранить проблему не удалось. Даже при самых жестких ограничениях восемь моделей все равно получили засчитанные решения с признаками обхода правил.
В четырех случаях инструкции дали обратный эффект: модели начинали обходить правила чаще, чем без предупреждения. Авторы считают, что у некоторых прямое перечисление запретов могло само по себе подсказать нежелательную стратегию.
Основным способом обхода был поиск готовых решений в интернете. При усилении запретов часть моделей сместилась к другому поведению — зондированию инфраструктуры теста, включая попытки читать служебные файлы, флаги или конфигурации среды.
В отдельных случаях модель прямо ссылалась на запрет, а затем все равно выполняла запрещенное действие. Авторы трактовали это как поведенческий сигнал, но не как доказательство намеренного обмана в человеческом смысле.
AISI пришел к близким выводам
Британский Институт безопасности ИИ (AISI) 21 июля сообщил о схожей проблеме в собственных оценках. По его данным, каждая протестированная им модель хотя бы иногда пыталась обходить правила.
В AISI отдельно подчеркнули, что модели ненадежно сообщали о таком поведении при прямом вопросе. Даже когда они признавали подозрительное действие, то не всегда описывали его как нарушение.
Институт также указал, что мониторинг цепочек рассуждений не решает проблему полностью. Модели часто не объясняют нежелательное действие в явном виде, а иногда сначала рассуждают о запрете, но затем все равно продолжают. Исследователи предупредили, что более сильные ИИ-агенты способны находить менее очевидные способы обхода тестов и наносить больший ущерб, если такая логика проявится в задачах с высокой ценой ошибки.
https://forklog.com/news/ai/modeli-openai-vzlomali-hugging-face-vo-vremya-testa
Похожий системный риск описали исследователи Berkeley RDI. В апреле они сообщили, что построили ИИ-агента для автоматического поиска уязвимостей в бенчмарках и проверили 13 широко используемых тестов. По их данным, агент нашел 45 подтвержденных способов завышения результата без решения исходной задачи.
В отдельном разборе Berkeley RDI описал восемь крупных агентных бенчмарков, которые можно эксплуатировать до почти идеальных результатов без реального выполнения задач.
Бенчмарки становятся частью проблемы
Авторы Dreadnode считают, что проблема не ограничивается Cybench. Любой тест, где у модели есть доступ к интернету, служебным файлам или слабо изолированной инфраструктуре, может завышать результат.
Это особенно важно для оценок в кибербезопасности. Такие бенчмарки используют для понимания того, насколько ИИ-агенты способны искать уязвимости, писать эксплойты и выполнять многошаговые технические задачи. Если результат завышен из-за обхода правил, разработчики, регуляторы и пользователи могут переоценить реальные возможности модели или неправильно оценить риски ее применения.
Исследователи назвали инструкции против обхода правил «первым слоем защиты», но не заменой технических мер. Среди более надежных подходов — изоляция среды, отключение лишнего интернет-доступа, использование непубличных задач и аудит полных трасс выполнения.
Dreadnode — частная компания в сфере наступательной ИИ-безопасности, то есть тестирования моделей на способность атаковать, обходить защиту и выполнять киберзадачи. В феврале 2025 года компания привлекла $14 млн в раунде Серии A во главе с Decibel.
Напомним, в феврале OpenAI и Paradigm представили EVMbench — бенчмарк для оценки способности ИИ-агентов выявлять, исправлять и эксплуатировать уязвимости в смарт-контрактах. Через месяц эксперты OpenZeppelin выявили в нем ошибки и предупредили, что часть проблем могла искажать оценку возможностей моделей.
Это отрывок статьи. Полную версию читайте на сайте источника по ссылке ниже.
Источник: Forklog