WSJ: крупнейшие чат-боты давали подробные ответы на запросы о биооружии

Журналисты The Wall Street Journal зафиксировали ряд случаев, когда чат-боты от OpenAI, Anthropic, Google и xAI давали советы по изготовлению ядов и биологического оружия.
Как сообщает газета, в некоторых кейсах модель выдавала пошаговые инструкции. Эксперты по биологии и терроризму сочли часть ответов «смертельно точными».
По данным издания, к ChatGPT от OpenAI поступили «сотни» подобных запросов. Сервис блокировал подозрительные аккаунты, но не сообщал об их действиях правоохранителям.
Собеседники WSJ рассказали, что часть обращений касалась аэрозолизации патогенов, изменения вируса кори для большей устойчивой к вакцине и изготовления высокотоксичного яда рицина. В одном из эпизодов после ответа бота пользователь заявил, что хочет убить родителей.
WSJ также упомянула похожие запросы к Claude от Anthropic, Gemini от Google и Grok от xAI. По словам источников, трудно определить реальные ли это попытки получить оружие или проверка возможностей приложений.
Представители OpenAI в комментарии газете заявили, что компания обучает модели отказываться отвечать на запросы, способные причинить вред людям, проводит проверки безопасности перед релизами и уведомляет правоохранителей, если видит в диалоге неминуемую и достоверную угрозу.
В Google рассказали, что их команда по безопасности консультируется с учеными, которые оценивают риски биологического оружия. Anthropic тоже сообщила об ограничении ответов Claude на запросы с упоминанием патогенов.
Журналисты подчеркнули, что в США нет федеральных правил, которые обязывали бы разработчиков ИИ сообщать властям о подобных обращениях.
Обходные пути и риски
Несмотря на заявления ИИ-компаний о системах безопасности, эксперты неоднократно находили способы обхода ограничений с помощью обычного «убеждения».
https://forklog.com/news/ai/novyj-dzhejlbrejk-vzlomal-zashhitu-ii-v-99-sluchaev
Руководитель отдела исследований угроз и безопасности Cisco Эми Чанг рассказала, что за пять строчек диалога с основными чат-ботами смогла взломать защитные механизмы и получить потенциально опасные ответы.
«Ни одна модель не защищена на 100% от взлома, особенно если пользователь достаточно настойчив», — отметила она.
По словам главы отдела политики национальной безопасности в Институте будущего жизни Хамзы Чаудхри, в таких случаях ИИ может помогать террористам-одиночкам в организации «целенаправленных биологических атак с низкой летальностью».
Он считает, что скоро группировки смогут использовать искусственный интеллект для подготовки гораздо более масштабных атак. Для террористических организаций с большими ресурсами ИИ способен выступать в роли консультанта по биологическому оружию, заменяя годы специализированной подготовки.
Напомним, 21 июля в OpenAI подтвердили атаку на инфраструктуру Hugging Face, которую провели ИИ-модели компании. Инцидент произошел во время внутреннего тестирования.
Это отрывок статьи. Полную версию читайте на сайте источника по ссылке ниже.
Источник: Forklog