Перейти к содержимому
Обзор исследований по безопасности ИИ: тематический анализ, ключевые пробелы и выводы для AI-агентов
9 мин чтения

Обзор исследований по безопасности ИИ: тематический анализ, ключевые пробелы и выводы для AI-агентов

ai-securityai-agentsragmulti-agent-systemsai-compliance

1. Краткое резюме

Если совсем по делу: отчёт, подготовленный по заказу Департамента по науке, инновациям и технологиям Великобритании, систематизирует рецензируемые исследования по безопасности ИИ за период с января 2021 по январь 2026 года. Работу выполнил Lancaster University. Задача была не декоративная, а вполне практическая: понять, что в AI security уже изучено прилично, а где — откровенно пустовато.

Для обзора использовали методологию PRISMA и поиск по двум крупным академическим базам: Scopus и Web of Science. После отбора, очистки и проверки в итоговый массив вошло 9 109 публикаций. Дальше исследователи применили data-driven-подходы, включая семантическое сопоставление, чтобы разложить статьи по тематическим кластерам и выявить пробелы в литературе.

В результате выделили 12 основных тем:

  • безопасность на этапе обучения;

  • риски данных и конфиденциальности;

  • выравнивание моделей и систем с человеческими намерениями (alignment);

  • уязвимости цепочки поставок;

  • безопасность на этапе вывода (inference);

  • риски завершения жизненного цикла и утилизации;

  • безопасность системной инфраструктуры;

  • риски из-за слабого учёта и отслеживания AI-активов;

  • безопасность автономных агентов;

  • риски, возникающие со стороны конечного пользователя;

  • безопасность проектирования моделей и систем;

  • управление безопасностью и регулирование.

Отдельно авторы выделили пять направлений, где исследований пока не хватает:

  • методы подтверждения и верификации целостности данных и весов моделей;

  • отслеживание происхождения и проверка сторонних AI-моделей;

  • связка между атаками на модель и атаками на инфраструктуру, особенно для генеративных и агентных систем;

  • понимание того, как действия пользователя сами по себе создают риски безопасности;

  • безопасный вывод моделей из эксплуатации и их утилизация, особенно для frontier AI.

И да, один вывод звучит особенно громко: в области безопасности agentic AI и автономных AI-агентов литературы пока заметно меньше, чем хотелось бы. Для компаний, которые занимаются разработкой AI-агентов и автоматизацией, это не просто академическая ремарка, а вполне прикладной сигнал.

Важно: отчёт отражает независимое исследование. Высказанные в нём выводы не являются официальной позицией правительства Великобритании.

2. Введение

Искусственный интеллект сегодня — не модная игрушка, а часть экономической и технологической стратегии государств и бизнеса. Но есть нюанс: если сами AI-системы уязвимы, весь этот рост может оказаться довольно хрупкой конструкцией. Красивой, дорогой и хрупкой.

Именно поэтому AI security за последние годы превратилась в самостоятельное и быстро растущее направление внутри кибербезопасности. Публикаций становится всё больше, но до сих пор было не так много попыток трезво, без лишнего пафоса, оценить весь ландшафт: какие темы изучены глубоко, какие — поверхностно, а где вообще зияют дыры.

Этот обзор как раз и пытается закрыть такую потребность. Он нужен не только исследователям. Он полезен и практикам: тем, кто проектирует AI-платформы, выстраивает архитектуру AI-агентов, отвечает за защиту моделей, внедряет RAG, агентную память, мультиагентные системы и процессы AI compliance.

3. Область охвата

В обзор включили широкий спектр AI-систем: machine learning, deep learning, reinforcement learning, computer vision, генеративный ИИ, LLM, foundation models и agentic AI. Рассматривались только англоязычные рецензируемые публикации, вышедшие с января 2021 по январь 2026 года.

Это важно. В выборку не включали корпоративные отчёты, материалы госорганов и прочие документы без формальной научной рецензии. С одной стороны, это сужает картину. С другой — повышает качество и сопоставимость источников.

На старте исследователи искали любые публикации по безопасности ИИ, чтобы не отсечь полезное слишком рано. Затем фокус сузили до кибербезопасности AI-систем. Под этим в отчёте понимаются риски и уязвимости самих моделей, поддерживающей инфраструктуры и сценариев использования, если они влияют на защищённость системы на этапах проектирования, разработки, развёртывания, сопровождения и вывода из эксплуатации.

Темы, относящиеся скорее к AI safety в широком смысле, а также злоупотребления ИИ вроде генерации дипфейков или использования ИИ для атак на сторонние цели, в область обзора не входили.

4. Методология

Исследование строилось в несколько шагов. Сначала определили источники поиска — Scopus и Web of Science. Затем сформировали набор ключевых слов и фраз, связанных с AI security, и выполнили поиск по заголовкам, аннотациям и авторским ключевым словам.

Дополнительно применили фильтр по площадкам публикации: в обзор включали статьи из ведущих журналов и конференций по ИИ, машинному обучению и кибербезопасности. Список формировали на основе H5-index, а потом вручную проверяли. Решение, может, и не идеальное, но понятное: иначе объём нерелевантных материалов был бы просто диким.

После удаления дублей и контроля качества осталось 9 196 статей. Затем исключили студенческие аннотации, вводные тексты к сборникам конференций и материалы вне области охвата. Финальная выборка составила 9 109 публикаций.

Рисунок 1: Обзор поиска литературы

Схема поиска литературы по безопасности ИИ

Для части exploratory data analysis использовали LLM. В частности, ChatGPT-5.4 mini применяли для разметки типа AI-системы по метаданным статьи и для классификации аффилиаций авторов по секторам. Это не заменяло ручную проверку полностью: выборки дополнительно просматривались людьми.

Чтобы распределить статьи по темам, исследователи использовали semantic matching. Проще говоря, система оценивала, насколько содержание статьи по смыслу совпадает с описанием каждой темы, и присваивала ей наиболее подходящую категорию. Такой подход оказался сильнее простого поиска по ключевым словам, потому что позволяет находить релевантные работы, даже если авторы не использовали «правильные» термины буквально.

Для организаций, которые строят безопасность AI-агентов или внедряют агентную память и RAG, сама методика интересна отдельно: она показывает, как можно системно картировать риски в быстро меняющемся AI-ландшафте.

4.1 Ограничения

Ограничения у отчёта есть, и авторы их не прячут. Основные связаны с тем, что поиск вёлся только по двум базам данных и только по отобранным площадкам публикации. Это сужает охват, но без такого фильтра массив был бы слишком большим и шумным.

Кроме того, часть обработки выполнялась с помощью data science-методов и LLM-разметки. Да, затем проводилась ручная проверка выборок, но стопроцентной безошибочности это, конечно, не гарантирует. Ну а где она вообще бывает?

Есть и ещё один момент: keyword gap analysis зависит от авторских ключевых слов. Если у статьи нет таких меток или они выбраны неудачно, часть смыслов может не попасть в анализ. Из-за этого 2 296 статей, хорошо совпавших с темами по семантике, но без авторских ключевых слов, были исключены из одного из поданализов.

5. Основные выводы

По итогам обзора исследователи выделили 12 тематических направлений. Они различаются по объёму литературы очень заметно: одни уже изучены основательно, другие пока остаются на периферии.

  • Безопасность на этапе обучения

  • Риски данных и конфиденциальности

  • Alignment

  • Уязвимости цепочки поставок

  • Безопасность на этапе inference

  • Риски завершения жизненного цикла и утилизации

  • Безопасность системной инфраструктуры

  • Риски из-за отсутствия отслеживания активов

  • Безопасность автономных агентов

  • Риски со стороны конечного пользователя

  • Безопасность проектирования моделей и систем

  • Управление безопасностью и регулирование

Эти темы соотносятся с международными стандартами, в частности с ETSI EN 304 223, что делает выводы отчёта полезными не только для академической среды, но и для прикладных задач: аудита, проектирования защищённых AI-систем, AI governance и соответствия требованиям.

Рисунок 2: Сопоставление тем со стандартом ETSI EN 304 223

Сопоставление тем безопасности ИИ со стандартом ETSI EN 304 223

Безопасность на этапе обучения. Это крупнейшая тема в массиве. Она охватывает атаки на процесс обучения модели: data poisoning, label flipping, внедрение backdoor-механизмов и другие способы исказить поведение системы ещё до развёртывания. Здесь найдено 2 101 релевантное исследование. Но при всей насыщенности литературы остаётся заметный пробел: формальные методы, которые позволяли бы проверять целостность обучающих данных и давать хоть какие-то строгие гарантии, представлены слабо.

Риски данных и конфиденциальности. В этой теме 1 313 статей. Речь идёт о том, как из AI-системы можно извлечь чувствительные данные, персональную информацию или сведения о самой модели — через model inversion, extraction, distillation, membership inference и смежные техники. Исследований много, но работ по верифицируемости и доказуемой целостности данных всё ещё маловато.

Alignment. Тема касается ситуаций, когда поведение системы перестаёт соответствовать человеческим целям и ожиданиям. Здесь 200 статей. Значительная часть рассматривает вредоносные взаимодействия, jailbreak-подобные сценарии и другие способы нарушить корректное поведение модели. А вот связь alignment с рисками данных и кибербезопасностью в более узком смысле исследована заметно слабее.

Уязвимости цепочки поставок. AI-системы всё чаще зависят от внешних моделей, библиотек и open-source-компонентов. Это создаёт новую поверхность атак: вредоносные модели, backdoor в артефактах, dependency confusion, небезопасная сериализация. В теме 198 статей. При этом происхождение сторонних моделей и проверка их доверенности — явный недоисследованный участок. Для компаний, внедряющих мультиагентные системы или сложные AI-конвейеры, это уже не теория, а ежедневная инженерная боль.

Безопасность на этапе inference. Здесь 212 статей. Тема включает атаки на уже развёрнутые модели: adversarial examples, prompt injection, jailbreak, model extraction и прочее. На первый взгляд область изучена неплохо. Но это обманчивое ощущение. По мере появления новых моделей и интерфейсов атаки тоже мутируют — быстро, местами неприятно быстро.

Риски завершения жизненного цикла и утилизации. В этой теме всего 76 статей. Рассматриваются machine unlearning, удаление чувствительных данных, безопасный вывод моделей из эксплуатации. Особенно слабо изучена именно утилизация frontier AI-систем. А ведь модель, которую «списали», не перестаёт быть носителем рисков автоматически. Было бы удобно, конечно. Но нет.

Безопасность системной инфраструктуры. Здесь 132 статьи. Речь о рисках в облачной среде, API, пайплайнах данных, средах развёртывания и прочей инфраструктуре, на которой живёт модель. Авторы подчёркивают: для генеративных и agentic AI-систем этот пласт исследований пока недостаточен. Особенно там, где пересекаются модельные атаки и классическая инфраструктурная кибербезопасность.

Риски из-за отсутствия отслеживания активов. Всего 24 статьи. Тема включает мониторинг model drift, concept drift, инвентаризацию моделей и проблему Shadow AI. Если организация не знает, какие модели у неё вообще используются, защищать их, мягко говоря, затруднительно. Это один из самых недоисследованных, но практически важных сегментов.

Безопасность автономных агентов. 91 статья. И вот тут начинается самое интересное. Или тревожное — кому как. Рассматриваются tool poisoning, memory poisoning, indirect prompt injection, межагентные взаимодействия и риски, связанные с автономным поведением. Для рынка AI-агентов это, пожалуй, один из ключевых выводов всего обзора: безопасность агентных систем пока явно отстаёт от темпов их внедрения.

Риски со стороны конечного пользователя. Тоже 91 статья. Сюда входят automation bias, чрезмерное доверие к ответам модели, запуск вредоносного AI-сгенерированного кода, действия на основе галлюцинаций модели и insider threat-сценарии. Исследований немного, а практическая значимость огромна. Потому что иногда слабое звено — не модель, не API и не векторная база. Иногда это человек, который нажал «запустить».

Безопасность проектирования моделей и систем. 55 статей. Тема охватывает secure-by-design, контроль доступа, моделирование угроз на этапе архитектуры. Для frontier AI, LLM и агентных систем работ пока немного. Это значит, что проектирование защищённых решений всё ещё опережает стандартизированную исследовательскую базу.

Управление безопасностью и регулирование. Самая малочисленная тема — 21 статья. Она посвящена governance frameworks, guidance, trust, explainability, публикации уязвимостей и регуляторным подходам. На фоне роста требований к AI compliance и соответствию требованиям это выглядит как серьёзный пробел.

5.1 Количественные выводы

За последние пять лет интерес к AI security вырос резко. В 2024 и 2025 годах публиковалось более 3 000 статей в год, тогда как в 2021 и 2022 годах — около 500. Рост, прямо скажем, не символический.

Рисунок 3: Результаты поиска по годам

Количество публикаций по безопасности ИИ по годам

Распределение по темам тоже показательно. Две крупнейшие области — безопасность на этапе обучения и риски данных/конфиденциальности — заметно доминируют. Затем идёт второй эшелон: цепочка поставок, alignment и inference security. Остальные темы представлены существенно слабее, особенно управление безопасностью, отслеживание активов и безопасность автономных агентов.

Рисунок 4: Количество статей по соответствию темам

Распределение статей по темам безопасности ИИ

Отдельный интерес представляет распределение публикаций по типам аффилиаций авторов. Доминируют академические учреждения, но заметна и доля смешанных команд, а также корпоративных авторов. Это косвенно показывает, что AI security уже давно вышла за пределы чисто университетской повестки и стала предметом прикладного интереса бизнеса и государственных структур.

Рисунок 5: Аффилиация автора(ов) по каждой статье

Если смотреть на всё это не как на сухую статистику, а как на карту рынка, вывод довольно прямой: быстрее всего растут области, где ИИ уже активно внедряется в реальные процессы. Но безопасность agentic AI, мультиагентных систем, агентной памяти, инфраструктуры и пользовательских сценариев пока исследована слабее, чем требует практика. И вот это уже не мелочь.

Для российских компаний, которые планируют внедрение AI-автоматизации, разработку AI-агентов, защищённые RAG-системы и enterprise AI, отчёт полезен как ориентир: он показывает, где риски уже понятны, а где придётся действовать осторожнее и закладывать дополнительные меры защиты на этапе архитектуры.

Источник: gov.uk