Перейти к содержимому
IMOEX 2191.18 2.1%
·Технологии·30 июля 2026 г.

Как защитить LLM-агентов от gradient-based adversarial attacks-атак: VRF + LoRA подход

Как защитить LLM-агентов от gradient-based adversarial attacks-атак: VRF + LoRA подход

Представьте LLM-агента, который читает торговые сигналы из публичных источников, анализирует их и принимает решение покупать/продавать токены. Каждый день он управляет миллионами долларов. Такие агенты встречаются везде: в Discord, Twitter, Telegram, на собственных серверах компаний.

Проблема? Как и большинство LLM-систем в production, они работают на открытых моделях - LLaMA, Mistral и т.д.

Открытая модель означает одно: атакующий может скачать её веса и локально оптимизировать адверсариальную атаку через градиентный спуск. И самое страшное - найденная атака будет работать на всех инстансах одновременно, независимо от платформы.

Это не персональный фишинг. Это архитектурная уязвимость класса adversarial attacks.

Это отрывок статьи. Полную версию читайте на сайте источника по ссылке ниже.

Источник: Habr