В МИФИ создали нейросеть, которая оценивает уверенность своих решений и противостоит атакам

Ученые Национального исследовательского ядерного университета «МИФИ» (НИЯУ МИФИ) предложили
архитектуру нейронной сети, которая одновременно повышает устойчивость ИИ к состязательным атакам и позволяет оценивать неопределенность собственных прогнозов. Такой подход может использоваться, в частности, в системах кибербезопасности.
Современные системы искусственного интеллекта (в том числе ChatGPT и другие языковые модели) демонстрируют впечатляющие успехи. Однако у них есть серьезный недостаток: нейросеть может быть уверена в неправильном ответе. Особенно серьезной эта проблема становится в тех случаях, когда нейросеть целенаправленно пытаются обмануть. Злоумышленник может подобрать небольшие изменения во входных данных (состязательные примеры), которые практически не меняют их исходный смысл, но заставляют нейросеть принять неправильное решение.
Например, система обнаружения сетевых вторжений должна определить, является ли наблюдаемая сетевая активность нормальной или представляет угрозу. Проблема усугубляется тем, что нейросеть, распознающая угрозу, может не просто ошибиться на состязательных примерах, а сделать это с высокой степенью уверенности. Возникает естественный вопрос: можно ли сделать нейросеть менее уязвимой к состязательным воздействиям и одновременно научить ее определять, насколько надежен собственный прогноз?
Ученые НИЯУ МИФИ предложили подход, который позволяет одновременно решать две проблемы: оценивать, насколько нейросеть уверена в своем решении, и повышать ее устойчивость к попыткам обмана. В основе подхода лежит идея стохастического трансформера — нейросети, параметры которой, в отличие от классического трансформера, являются случайными.
«Представьте, что вместо фиксированных значений коэффициентов (весов) у каждого нейрона теперь имеется «облако» возможных значений. При каждом запуске модель случайным образом выбирает свои веса, в зависимости от подаваемых на вход данных. Это означает, что для одного и того же входного объекта может быть получено множество различных прогнозов сети. Если эти прогнозы получаются примерно одинаковыми, то система может считать свое решение достаточно надежным. Если же результаты заметно различаются, то это указывает на высокую неопределенность», — рассказали авторы исследования, аспирант Роджер-Ник Анаедевха и доцент кафедры «Кибернетика», кандидат технических наук Александр Трофимов.
Стохастический трансформер дополнительно может показать, насколько устойчив прогноз к небольшим изменениям самой модели и насколько сильно различаются полученные прогнозы. Это особенно важно для обнаружения новых или необычных атак. Если система сталкивается с данными, существенно отличающимися от обучающих примеров, высокая неопределенность может стать сигналом для проверки специалистом.
Кроме того, авторы утверждают, что случайность может создать дополнительное препятствие для злоумышленника. Если атакующий знает точную структуру и поведение модели, то он может подобрать специальное изменение входных данных, заставляющее ее ошибиться. Но если внутренние параметры модели случайным образом изменяются (авторы называют это «движущейся мишенью»), одна и та же атака уже не обязательно будет одинаково эффективна при каждом запуске модели.
Разработка ученых МИФИ объединяет несколько механизмов, позволяющих одновременно решать три важные задачи: повышать устойчивость нейросети к состязательным атакам, улучшать соответствие ее уверенности реальной точности прогноза и сокращать объем данных, требующих ручной разметки. Предложенный подход рассматривает надежность искусственного интеллекта сразу с нескольких сторон: нейросеть должна быть устойчива к попыткам ее обмануть, уметь адекватно оценивать неопределенность своих решений и эффективно использовать человеческое участие там, где оно действительно необходимо.
«Мы создали не просто очередную нейросеть, а теоретически обоснованный фреймворк. Наша работа доказывает, что стохастичность (случайность) в параметрах модели не мешает, а помогает: она делает ИИ одновременно и более защищенным, и более достоверным», — прокомментировали полученные результаты авторы исследования.
Разработку протестировали на девяти наборах данных в трех прикладных областях: обнаружение сетевых вторжений, выявление токсичного контента и распознавание фейковых новостей. В планах ученых — адаптация метода для больших языковых моделей (LLM) с использованием технологий низкоранговой адаптации (LoRA), что позволит применять стохастические механизмы защиты к крупным нейросетям без необходимости полностью переобучать все их параметры.
Разработка выполнена в рамках стратегического проекта НИЯУ МИФИ по цифровой безопасности. Код и модели находятся в открытом доступе, что позволяет мировому научному сообществу уже сейчас использовать наработки российских ученых для создания более безопасного и надежного искусственного интеллекта.
Источник: Официальный ресурс Министерства образования и науки Российской Федерации