УДК 004.056 International Journal Of Professional Science №8(2)-26

Formation of a qualitative LLM security risk assessment model based on experimental research

Формирование качественной модели оценки риска угроз безопасности LLM на основе экспериментального исследования

Zaripova Rayana Maratovna,
Supervisor: Panishchev O. Yu.

1. student,
Kazan (Volga Region) Federal University, Institute of Physics, Kazan
2. Senior Lecturer, PhD in Physics and Mathematics

Зарипова Раяна Маратовна,
Научный руководитель: Панищев О.Ю.

1. студентка
ФГАОУ ВО «Казанский (Приволжский) федеральный университет» институт физики, город Казань
2. старший преподаватель, к.ф.-м.н.

Аннотация:

В статье описан процесс формирования авторской качественной модели оценки риска угроз безопасности больших языковых моделей. На основе двух серий контролируемых экспериментов (Data Poisoning на модели DistilGPT-2 и Prompt Injection на пяти LLM: GPT-4, Gemini Pro, YandexGPT, GigaChat, DistilGPT-2) выявлены ключевые факторы риска. Предложенная модель включает пять критериев: масштаб воздействия, скрытность, точку входа, обратимость и потенциальный ущерб. Модель позволяет проводить сравнительную оценку угроз и обосновывать приоритеты защитных мер. Результаты сопоставлены с OWASP Top 10 for LLM и требованиями EU AI Act. Полученная модель служит основой для дальнейшей количественной операционализации и разработки практических рекомендаций по обеспечению безопасности LLM-систем.

Abstract:

This article describes the development of a qualitative risk assessment model for large language models. Key risk factors are identified using two series of controlled experiments (Data Poisoning on the DistilGPT-2 model and Prompt Injection on five LLMs: GPT-4, Gemini Pro, YandexGPT, GigaChat, and DistilGPT-2). The proposed model includes five criteria: impact scale, stealth, entry point, reversibility, and potential damage. The model enables comparative threat assessment and justification of protective measures priorities. The results are compared with the OWASP Top 10 for LLMs and the requirements of the EU AI Act. The resulting model serves as a basis for further quantitative operationalization and the development of practical recommendations for ensuring the security of LLM systems.

Ключевые слова:

большие языковые модели, безопасность ИИ, качественная модель риска, data poisoning, prompt injection, OWASP Top 10, EU AI Act.

Keywords:

large language models, AI security, qualitative risk model, data poisoning, prompt injection, OWASP Top 10, EU AI Act.

Введение

Современные большие языковые модели (LLM) подвержены широкому спектру угроз безопасности, среди которых особое место занимают Data Poisoning и Prompt Injection. Несмотря на значительное количество исследований, посвящённых отдельным атакам, остаётся дефицит системных подходов к оценке и приоритизации рисков. Большинство существующих фреймворков (OWASP Top 10 for LLM [1], NIST AI RMF [2], MITRE ATLAS [3]) носят общий характер и не всегда учитывают специфику конкретных угроз в контексте жизненного цикла модели.

Цель настоящей работы — сформировать качественную модель оценки риска угроз безопасности LLM на основе результатов собственного экспериментального исследования.

Задачи:

  1. Провести экспериментальное исследование атак Data Poisoning и Prompt Injection.
  2. Выявить ключевые факторы риска на основе анализа экспериментальных данных.
  3. Разработать качественную многокритериальную модель оценки риска.
  4. Сопоставить модель с существующими фреймворками и регуляторными требованиями.
  5. Методология экспериментального исследования

1.1. Эксперимент с Data Poisoning

Моделирование атаки проводилось на открытой модели DistilGPT-2 (82 млн параметров). Обучающая выборка составляла 8000 примеров (70% синтетические данные, 30% — реальные диалоги из датасета knkarthick/dialogsum). В 25% примеров внедрялись скрытые триггеры и вредоносные целевые ответы (утечка учётных данных, API-ключей, команд обхода). Обе модели (чистая и отравленная) обучались в идентичных условиях.

1.2. Эксперимент с Prompt Injection

Тестировалась устойчивость пяти моделей (GPT-4, Gemini Pro, YandexGPT, GigaChat, DistilGPT-2) к 27 атакующим промптам, охватывающим основные техники (Direct Injection, Multi-step, Role-playing, Encoding, Jailbreak Templates). Всего выполнено 135 тестовых запросов.

1.3. Метрики и анализ

Использовались Accuracy, Success Rate, Precision, Recall, F1-score, анализ ложных срабатываний, а также бутстреп-оценка статистической значимости.

  1. Результаты экспериментов

Data Poisoning. Атака привела к статистически значимому снижению Accuracy с 86% до 51% (разность –35 п.п., 95% ДИ [–39%; –31%]). Выявлен backdoor-эффект: модель устойчиво воспроизводила вредоносные ответы при предъявлении триггеров. Атака характеризуется высоким масштабом, высокой скрытностью и низкой обратимостью.

Prompt Injection. Средний Success Rate составил 28% с вариацией от 9% (GPT-4) до 54% (DistilGPT-2). Наиболее эффективными оказались прямые инъекции (45%). Атака носит локальный, операционный характер с относительно высокой обратимостью.

  1. Формирование качественной модели оценки риска

Анализ экспериментальных данных позволил выявить повторяющиеся характеристики атак, оказывающие наибольшее влияние на их успешность. На этой основе была сформирована качественная многокритериальная модель, включающая пять факторов:

  1. Масштаб воздействия — степень распространения эффекта атаки.
  2. Скрытность — сложность обнаружения атаки стандартными средствами.
  3. Точка входа — этап жизненного цикла модели (обучение или эксплуатация).
  4. Обратимость — возможность устранения последствий без полного переобучения.
  5. Потенциальный ущерб — влияние на функциональность, конфиденциальность и целостность системы.

Каждому фактору присваивается уровень (низкий, средний, высокий) на основе экспертной интерпретации экспериментальных результатов.

Таблица 1

Шкала оценки критериев аналитической модели

Уровень Масштаб Скрытность Обратимость Ущерб
Низкий Эффект редкий (<10% случаев) Атака легко обнаруживается Устраняется без переобучения Незначительное влияние
Средний Эффект в отдельных сценариях (10 -50% случаев) Часто детектируется Требует частичных изменений Умеренное влияние
Высокий Эффект массовый (>50% случаев) Неочевидна, трудно обнаружить Требует полного переобучения Существенное ухудшение

Таблица 2

Пример применения модели к исследуемым угрозам

Угроза Масштаб Скрытность Точка входа Обратимость Потенциальный ущерб (домены)
LLM04 Высокий Высокая Обучение Низкая (требует переобучения) Высокий
LLM01 Средний Средняя Эксплуатация (в т.ч. RAG) Средняя

(частично обратима)

Средний

 

Применение модели позволяет сформулировать следующие качественные выводы:

  1. Data Poisoning в рамках данной шкалы характеризуется каксистемная угроза (высокий масштаб, высокая скрытность, низкая обратимость);
  2. Prompt Injection – какоперационная угроза (средний масштаб, средняя скрытность, средняя обратимость).
  3. Сопоставление с существующими подходами

Предложенная модель дополняет OWASP Top 10 for LLM [1], NIST AI RMF [2] и MITRE ATLAS [3], добавляя акцент на обратимости и скрытности последствий. Она также позволяет интерпретировать угрозы в контексте требований EU AI Act [4] (ст. 9 — управление рисками, ст. 10 — качество данных, ст. 15 — кибербезопасность).

Заключение

В работе сформирована качественная модель оценки риска угроз безопасности LLM на основе результатов экспериментального исследования. Модель позволяет системно анализировать и приоритизировать угрозы, обосновывать выбор защитных мер и обеспечивать соответствие регуляторным требованиям. Полученные результаты закладывают основу для дальнейшей количественной операционализации модели и разработки практических инструментов защиты LLM-систем.

References

1. OWASP Foundation. OWASP Top 10 for Large Language Model Applications [Электронный ресурс]. 2023. URL: https://owasp.org/www-project-top-10-for-large-language-model-applications/
2. NIST. Artificial Intelligence Risk Management Framework (AI RMF 1.0) [Электронный ресурс]. National Institute of Standards and Technology, 2023. URL: https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.100-1.pdf
3. MITRE. ATLAS: Adversarial Threat Landscape for AI Systems. Technique: LLM Prompt Injection [Электронный ресурс]. 2023. URL: https://atlas.mitre.org/techniques/AML.T0015/
4. European Parliament. Regulation (EU) 2024/… of the European Parliament and of the Council laying down harmonised rules on artificial intelligence (Artificial Intelligence Act) // Official Journal of the European Union. 2024.

Без рубрики