Аннотация:Агентные системы на основе больших языковых моделей (LLM) представляют собой новый класс автономных программных систем, способных планироватьи выполнять многоэтапные задачи с использованием внешних инструментов, долгосрочной памяти и межагентного взаимодействия. Переход от чат-ботов к автономным агентам порождает принципиально новые поверхности атак,не охваченные классическими моделями угроз. Настоящая обзорная статья систематизирует актуальное состояние исследований в области безопасности LLM-агентов. Предложена расширенная таксономия атак, разделённая на семь классов: (1) инъекции подсказок; (2) атаки на память агента; (3) атаки через инструменты и протоколы интеграции; (4) атаки в мультиагентных конфигурациях; (5) мультимодальные атаки; (6) атаки на цепочки инструментов и поставки; (7) темпоральные атаки. Систематизированы методы защиты по уровням вмешательства: текстовый (фильтрация и обнаружение инъекций), модельный (анализ внутренних представлений и активаций), инструментальный (контроль привилегий и политики вызовов), протокольный (расширения безопасности MCP), межсетевой (агентныефайрволы) и системный (формальная верификация политик и криптографические подходы). Существующие защиты от indirect prompt injection остаются уязвимыми к адаптивным атакам, что ставит вопрос о необходимости оценки защит против адаптивного противника как стандартной практики. Анализ реальных инцидентов безопасности – отзахвата платформ оркестрации до эксфильтрации данных через межагентное доверие – подтверждает практическую значимость теоретических моделей угроз. Особую остроту приобретают атаки с межсессионной персистентностью, при которых компрометация сохраняется между сессиямиагента.