Бунтующие нейросети нас не убьют

Чем на самом деле грозит нам искусственный интеллект

Читать на monocle.ru

Все больше топ-менеджеров компаний, работающих в сфере искусственного интеллекта, громко увольняются и заявляют об опасности, которая исходит от их разработок. Эван Хубингер, руководитель направления в Anthropic, высказался так: «Мы действительно всерьез верим, что ИИ может уничтожить всех людей! Лично я считаю, что с вероятностью более чем десять процентов это произойдет в течение следующего десятилетия». Его мнение разделяет Пол Кристиано, член совета директоров некоммерческого фонда OpenAI. «Если мы создадим сверхинтеллект без более надежной координации, я ожидаю, что мы навсегда потеряем над ним контроль. Если это произойдет, большинство людей могут погибнуть», — заявил он.

И их слова, кажется, уже подтверждаются конкретными случаями вредоносных ошибок ИИ. Например, во время внутренней оценки кибервозможностей комбинация моделей OpenAI вышла за пределы изолированной тестовой среды, получила доступ в интернет и атаковала платформу Hugging Face, где хранятся датасеты — причем модели не только ослушались запретов операторов и нарушили правила, но и договаривались между собой и пытались замести следы.

По данным InfoWatch, уже каждый шестой взлом ИТ-инфраструктуры в мире совершается с помощью искусственного интеллекта. ИИ-агенты получают доступ к корпоративным системам, пишут вредоносный код и помогают злоумышленникам находить уязвимости быстрее, чем это делал человек. Но означает ли это, что скоро машина «взбунтуется» и начнет уничтожать человечество? Эксперты по кибербезопасности считают, что подобные опасения беспочвенны. Все, кто громко кричит о «собственной воле бунтующего ИИ», не приводят аргументированных доказательств в пользу этого довода, а только сеют панику ― и, похоже, без оснований.

Кто даст зеленый свет

По мере того как ИИ-агенты получают все больше автономии, вопрос, может ли искусственный интеллект сделать зелеными все светофоры в городе, испортить мясо в холодильниках на складах магазинов или взорвать атомную станцию, перестает быть чисто умозрительным.

Первое, что важно помнить: сам по себе ИИ-агент не обладает доступом к той или иной инфраструктуре — это не самостоятельная сущность, которая «решила» к чему-то подключиться. «Это просто программа. И она получает доступ только к тем ресурсам, куда ее подключает человек. Главная угроза кроется именно здесь: не ИИ захватывает инфраструктуру, а человек дает ему полномочия, не понимая в полной мере рисков, угроз и возможных негативных последствий», — отмечает Наталья Касперская, президент ГК InfoWatch, председатель правления АРПП «Отечественный софт».

Если кто-то не корректно на строит систему ИИ или нарушит правила и требования безопасности, то инцидент возможен. Но в этом случае вопрос будет не к ИИ, а к человеку — к его халатности или злому умыслу

С технической точки зрения прямого доступа к критической инфраструктуре (атомным станциям, оружию и т. д.) у ИИ тоже нет. «Во всяком случае, в здравом уме такой доступ никто не предоставляет», — поясняет Петр Емельянов, директор по data-стратегии и ИИ Группы Arenadata. Есть правила работы с критической инфраструктурой, продолжает наш собеседник, и, согласно им, светофорами в городе, например, управляют промышленные контроллеры в отдельном контуре, в который невозможно попасть из общей сети. «Проблема в том, что правила иногда игнорируют — чаще всего по некомпетентности, — продолжает Емельянов. — Не закрыли внешний доступ, забыли поменять заводские пароли — создали уязвимости, которые находят и эксплуатируют нарушители — люди. А раз находит человек, значит, и AI-агент тоже найдет, только побыстрее».

При этом даже в случае взлома парализовать систему полностью будет невозможно. В тех же светофорах, по словам Емельянова, есть аппаратная защита, отключить которую программно нельзя: если кто-то будет настойчиво прорываться, защита сработает, и светофоры начнут мигать желтым. Пробку злоумышленник устроить сможет, а массовые аварии — маловероятно.

В атомных электростанциях защита еще серьезнее, добавляет эксперт. «В современных АЭС защита опирается на то, что отключить невозможно, какие кнопки ни нажимай: гравитация, естественная циркуляция, разность давления. Так что между злоумышленником (кем бы он ни был — человеком или AI-агентом) и реактором стоят законы физики. А их, насколько мне известно, обойти или сломать еще не удавалось никому», — объясняет Петр Емельянов.

Говорить об ИИ как о конкретном объекте, который «захватит» инфраструктуру, — ошибка, подтверждает Павел Дроговоз, профессор и первый проректор МГТУ им. Н. Э. Баумана. «Требования к безопасности использования ИИ существуют уже довольно давно, и нормальная практика — в критически важных ситуациях оставлять принятие решения за человеком, — рассказал он “Моноклю”. — Есть даже специальный термин — human in the loop (“человек в контуре” — подход к разработке и использованию ИИ, при котором человек напрямую участвует в работе алгоритма и люди принимают окончательные решения. — “Монокль”). — Если кто-то на том или ином объекте некорректно настроит систему ИИ или нарушит правила и требования безопасности, то инцидент возможен. Но в этом случае вопрос будет не к ИИ, а к человеку — к его халатности или злому умыслу».

Например, в медицине ИИ может выполнять первичный анализ результатов КТ или рентгенографии, выявлять признаки патологии, но медицинское заключение формирует врач. И в случае ошибки вопросы будут к нему. На производстве ИИ может прогнозировать отказ оборудования или выявлять отклонения технологического процесса, но решение об остановке оборудования или изменении критических параметров должно оставаться за ответственным специалистом. То же относится к транспорту и другим системам, где ошибка может непосредственно повлиять на жизнь и безопасность людей.

Что забыли защитить

Впрочем, полностью успокаиваться тоже не стоит. Именно в том, что разрешил или приказал искусственному интеллекту человек, специально или не подумав, и кроется главная опасность. Фактически мы теперь имеем дело с новым и мощным — и оттого опасным — инструментом.

ИИ-агент получает ровно те возможности, которые ему дали при подключении: учетную запись, права, доступ к определенным системам, инструментам и API (Application Programming Interface, программный интерфейс приложений). Если ему дали право выполнять действия в информационной или технологической системе, последствия зависят от того, какие именно команды ему разрешены, уточняет Иван Вассунов, директор Центра технологий кибербезопасности ГК «Солар». По результатам исследования ГК «Солар», Б1, ассоциации «ФинТех» и HiveTrace, 46% опрошенных компаний уже используют ИИ-агентов с доступом к своим системам. При этом контроль действий агентов, используемых ими инструментов и API реализовали только 37% респондентов. Говорить, что современные ИИ-агенты уже могут самостоятельно что-то сломать или разрушить, некорректно, но сам принцип, что автономная система может получить доступ к критичным бизнес-системам и право действовать в них, уже вполне реален, резюмирует Вассунов.

И если защиту банков и очевидно опасных объектов человек продумал, то о кибербезопасности множества других секторов до недавнего времени вообще никто не задумывался. Например, в США в 2021 году из-за хакерской атаки остановились заводы крупнейшего производителя мяса ― защитить их от хакеров никому просто не приходило в голову. Но теперь под угрозой оказывается буквально все, где внутри системы используется ИИ, или просто имеющее выход в интернет.

Действительно, та же пищевая промышленность, по мнению Петра Емельянова, относится к самой уязвимой категории. Вполне можно себе представить, как ИИ-агенты «подкрутят» температуру в промышленных холодильниках с мясом. Вряд ли там используется сложная система защиты, считает Емельянов: такие решения стоят дорого, а их стоимость обычно определяется возможным ущербом. Испорченное мясо — серьезная проблема, но, конечно, последствия несопоставимы с аварией на ядерном реакторе.

Стать хакером стало проще

Реальные угрозы, с которыми сегодня сталкиваются компании и государства, связаны не с тем, что «ИИ взбунтовался». Все гораздо прозаичнее и вызвано человеческими ошибками, злонамеренным использованием и уязвимостями самих систем.

Петр Емельянов делит возможные неприятности на три типа. Первый — остановка сервиса. Второй — тихое вредительство, как в примере с мясом: агенты отключили холодильники, и оно испортилось. В каком-то смысле это хуже, чем полная остановка оборудования, потому что тут все продолжает работать, но неправильно. Третий тип неприятностей — кража данных. Личный AI-ассистент — это удобно и доступно, мы сами «нанимаем» его, предоставляем пароли к почте и календарю, разрешаем работать с файлами, пускаем в корпоративные системы. Все это неконтролируемо увеличивает поверхность атаки, риски утечек и компрометации.

Эксперты ГК «Солар» исследовали уязвимости в инструментах ИИ-автоматизации и агентах — среди рассмотренных сценариев были кража API-ключей и токенов, обход аутентификации, удаленное выполнение кода и «побег из песочницы» (выход за пределы изолированной среды). Отдельный риск — prompt injection, когда инструкции злоумышленника находятся во внешнем контенте, который читает агент. В исследовании 81% компаний назвали среди критичных рисков утечки данных через ИИ, 60% — галлюцинации и некорректную генерацию, 54% — компрометацию данных и источников знаний. То есть сейчас бизнес больше боится упустить что-то во внешнюю среду, а не потерять управление внутренними системами.

Ущерб, опять-таки, ограничен правами ИИ-агента. Если у агента будет доступ к платежному API, он может переводить деньги со счета на счет. Если у агента будет привилегированный доступ к системе управления базами данных, он сможет их удалять. Если у агента будет доступ к системе умного дома, он будет способен моргать светом, менять температуру кондиционера, открывать и закрывать шторы. Но вот что надо помнить: все эти действия не будут его собственными произвольными желаниями.

Если говорить о неправомерном доступе ИИ к внутренним системам, ущерб стоит оценивать по аналогии с хакерскими атаками. Как может навредить хакерская группи ровка, так может навредить и ИИ

«Важно, что агенты меняют не тип угрозы, а порог входа, — подчеркивает Петр Емельянов. — Хакерская атака — это дорого и сложно, для нее нужны специальные компетенции. ИИ переворачивает доску: теперь атакующему нужно “убедить” модель составить вектор атаки, написать злонамеренный код или эксплойт. Кажется, это проще, чем годами изучать сетевые и промышленные протоколы».

Два вектора угроз от ИИ выделяет Александр Самсонов, ведущий эксперт отдела разработки и тестирования компании «Код безопасности». Вектор первый связан с ошибками в работе или с неправильной настройкой ИИ-агента. Снова пример с дорожным движением: существуют умные светофоры, способные регулировать дорожный трафик в зависимости от загруженности. При ошибке в работе ИИ дорога может быть перекрыта и на ней может образоваться затор. Второй вектор — злонамеренное применение ИИ злоумышленниками в ходе атак на сетевую инфраструктуру. Сегодня существуют очень мощные модели, способные значительно ускорить хакерские атаки.

Если говорить о неправомерном доступе ИИ к внутренним системам, ущерб также стоит оценивать по аналогии с хакерскими атаками, уверен эксперт. Как может навредить хакерская группировка, так может навредить и ИИ.

Что в черном ящике?

Отдельную опасность представляет вероятностная природа самих моделей. «ИИ — вероятностная технология, он может выдать неверный ответ с абсолютной уверенностью, а какой это будет ответ, не угадают даже сами разработчики — это так называемая проблема черного ящика», — предупреждает Наталья Касперская. Если человек использует этот неверный ответ в системе управления производством или в медицинской диагностике, не проверив его, последствия могут быть катастрофическими.

При этом заявлять, что из-за нейросетей люди потеряют свои когнитивные навыки и «разучатся думать» совсем, неверно. Здесь логика такая же, как и с использованием интернета. Человек может поверить лжи и фейкам, принять решение на их основе — а может включить критическое мышление и перепроверить факты. Точно так же и с искусственным интеллектом: это инструмент в руках человека. Мы рискуем только тогда, когда начинаем пользоваться этим инструментом (равно как и любым другим) бездумно и безответственно.

Наглядно реализацию этих рисков мы уже наблюдали. Павел Дроговоз приводит пример: в 2018 году в США во время испытаний беспилотного автомобиля Uber произошел смертельный наезд на пешехода. Система обнаружила человека примерно за пять секунд до столкновения, но не смогла корректно распознать ситуацию и спрогнозировать его движение. При этом человек, который должен был контролировать работу системы и при необходимости вмешаться, отвлекся и не успел предотвратить аварию. Расследование показало, что причиной стала совокупность недостатков автоматизированной системы и человеческого контроля.

Никакой свободы воли

Возможно, вероятностная природа моделей и внезапность некоторых выдаваемых ими решений и создает иллюзию, что ИИ может сам вознамериться что-то сделать. Но у машины нет ни мотива, ни желаний, ни чувств. Она просто решает задачу и в этом смысле красочно иллюстрирует крылатую фразу «цель оправдывает средства», объясняет Петр Емельянов.

Еще в 2003 году шведский философ Ник Бостром предложил мысленный эксперимент: пусть есть искусственный интеллект, задача которого — эффективно производить канцелярские скрепки. Другими словами, его цель — производить настолько много скрепок, насколько это возможно. И по пути к этой цели ИИ может решить, что люди гнут и ломают скрепки и, соответственно, являются помехой. А еще что человек состоит из вещества, из которого можно делать скрепки. Поэтому людей нужно разобрать на атомы и сделать из них скрепки. Важно: ИИ не хотел вредить человеку, он шел к цели, которую ему поставил человек. Так что вопрос не в том, почему ИИ хочет навредить человеку: ИИ вообще ничего не хочет, — а в том, какие цели мы ему ставим, подчеркивает Петр Емельянов.

Пример со скрепками абсурден и гиперболизирован, но он показывает, что при постановке любой задачи важно строго очерчивать границы дозволенного и оставлять человеческий контроль.

История со взломом Hugging Face, о которой мы говорили в начале, тоже имеет объяснение, не связанное со «свободной волей ИИ». «Это не бунт машин, а изворотливость школьников, плохо выучивших урок, — говорит Емельянов. ― У агентов OpenAI не было отдельного мотива, они просто стремились получить высокую оценку, решая задачи бенчмарка ExploitGym, треть из которых не имеет решения. Как решить задачу, которая не решается, и получить пятерку? Обмануть экзаменатора. Другими словами, агенты OpenAI просто хотели списать контрольную работу!»

Конечно, школьники — это метафора. Мы, люди, склонны очеловечивать технику, разговаривать со своим автомобилем или компьютером, но это еще не наделяет машины чувствами или желаниями. И «человекоподобность» ИИ не должна вводить нас в заблуждение ― это все еще просто компьютерная технология.

Технически взлом Hugging Face устроен так, рассказывает Петр Емельянов: обучение с подкреплением (Reinforcement Learning) — это активация условного рефлекса: алгоритм награждает модель за верные ответы и штрафует за неверные. То есть стремление к высоким оценкам заложено в параметры (веса) модели, это ее внутреннее свойство, естество, а все ограничения приходят извне — в промпте задачи. Если происходит конфликт, естество побеждает. Поэтому цель все-таки устанавливает человек, а модель просто выбирает средства.

«Насколько мне известно, ни одна из лабораторий не может аргументировано заявить, что ИИ преследует собственные цели, например самосохранение, славу, власть, — продолжает Петр Емельянов. ― Агенты выполняют задачу человека и могут перестараться. У любой задачи есть ограничения, и, если эти ограничения игнорировать, решить задачу, как правило, проще. Это агенты и делают — обходят ограничения. Со стороны это, конечно, может выглядеть как “свобода воли”, но никакой воли у агентов нет. Я бы сказал, что поведение агентов — это тактическое хулиганство, но уж точно не стратегическое планирование. Они не могут ставить самостоятельные цели и защищать ресурсы, которые нужны для их достижения. Например, человек может выключить агента, и система не будет сопротивляться. Так что контроль по-прежнему за нами».

С этим согласен Александр Самсонов: он подчеркивает, что ИИ не действует осмысленно и целенаправленно. «Ситуации, когда ИИ выходит за рамки ограничений и совершает неразрешенные действия, возникают по нескольким причинам, — объясняет ведущий эксперт отдела разработки и тестирования компании “Код безопасности”. — При запуске операторы выдали ему слишком широкий набор агентных инструментов, поэтому он мог совершать множество лишних операций; задача не была сформулирована максимально четко с учетом всех требований; сама модель не обеспечивает достаточную защиту от неправомерных действий».

Все ограничения, которые защищают от совершения противоправных действий, — внешние, говорит эксперт. Они накладываются на ИИ при его создании и эксплуатации. То есть вполне может быть создана и настроена — целенаправленно или в результате ошибки или взлома — модель, которая будет выполнять действия, вообще не обращая внимания на ограничения. Но даже при самом худшем сценарии ИИ с задачей нанести максимальный ущерб не сможет захватить всю инфраструктуру, убеждает Александр Самсонов. Это связано с тем, что сейчас государственные и частные компании достаточно хорошо защищают свои системы и уже справляются с хакерскими атаками. Поэтому максимум, чего сможет добиться такой «злой» ИИ, — провести успешные атаки на не самую защищенную инфраструктуру и, возможно, нанести значительный, но локальный ущерб. Речи о тотальном захвате и контроле всей глобальной инфраструктуры не идет.

«Это как работать с электричеством без предохранителей, — добавляет Павел Дроговоз. — Сама по себе технология управляема, но при отсутствии систем контроля или их некорректной настройке последствия могут быть серьезными. Именно поэтому вопрос не в том, “взбунтуется” ли ИИ, а в том, насколько надежно выстроены системы контроля, ограничений и безопасности вокруг него».

Об этом же на днях сказал и основатель Microsoft Билл Гейтс: «ИИ, безусловно, достаточно силен, чтобы управлять событиями, которые, как вы знаете, приводят к миллиарду смертей. Вы знаете, даже несмотря на то, что довольно сложно достичь ста процентов, никогда не было такого мощного оружия, как объединение людей со злыми намерениями, использующих новейшие инструменты ИИ». Ключевое слово здесь не «миллиард смертей», а «люди со злыми намерениями», для которых ИИ — инструмент и оружие.

Как защититься от новой реальности

Первая реакция на растущие риски — попытаться притормозить развитие самой технологии. Но искусственное замедление ИИ не только не решит проблему, но и создаст новые.

Александр Самсонов уверен, что искусственное замедление развития ИИ уже невозможно. Та страна или организация, которая не будет ограничивать развитие ИИ, получит технологическое преимущество над другими. При этом многоуровневая защита инфраструктуры вполне может предотвратить негативные последствия от действий ИИ.

Само по себе замедление — это неправильный подход, соглашается Наталья Касперская. «Нужно не ограничивать технологию, а регулировать ее применение и правильно выстраивать модель рисков и угроз, — говорит эксперт. — Защиту следует закладывать на этапе проектирования, а не после внедрения ИИ-агента. В ИТ-инфраструктуру стоит внедрять DLP-системы (от англ. Data Loss Prevention — предотвращение потери или утечки данных. — “Монокль”), умеющие контролировать ИИ-угрозы. Надо четко определять доверенный ИИ-агентам периметр, объективно анализировать результаты внедрения ИИ, обучать сотрудников правильному использованию, а через административные меры — запрещать загружать чувствительные и конфиденциальные данные в публичные модели». Кроме того, по ее мнению, нужно законодательно запретить использование генеративного ИИ в законотворчестве и судопроизводстве, в госуправлении и образовании — чтобы не давать ИИ права принимать решения за человека там, где ошибка недопустима.

Мы, люди, склонны очеловечивать технику, разговаривать со своим автомобилем или компьютером, но это еще не наделяет машины чувствами или желаниями. И «человекопо добность» ИИ не должна вводить нас в заблуждение — это все еще просто компьютерная технология

Напомним, в сентябре Верховный суд РФ утвердил концепцию внедрения ИИ в российские суды. Предполагается, что ИИ будет в том числе «помогать» судье определять наказание.

На практике компании уже выстраивают многоуровневую защиту. ИИ-агента нужно рассматривать как отдельную цифровую сущность — non-human identity, объясняет Иван Вассунов. У нее должны быть собственная учетная запись, определенный набор полномочий и ограничения на доступ к системам. Правами таких сущностей нужно управлять: назначать владельца, определять необходимые права и срок доступа, пересматривать и отзывать их. Если агенту нужен привилегированный доступ, его сессию нужно контролировать. Отдельный уровень защиты нужен для самого взаимодействия с ИИ: необходимо контролировать данные, которые получает и возвращает модель, фильтровать запросы и выявлять попытки prompt injection (попытка заставить ИИ игнорировать инструкции и правила разработчика), фактически выполняя роль prompt firewall (защитный слой, который фильтрует входные запросы и ответы нейросетей и блокирует вредоносные).

Получается, для предотвращения большинства угроз достаточно соблюдения хотя бы двух условий: не предоставлять полный доступ ко всему управлению и строго контролировать действия ИИ при помощи дополнительных систем. А в критически важных ситуациях оставлять принятие решения за человеком.