Разделы
Вернуться назад
Как выходящий из-под контроля ИИ испугал даже своих разработчиков
Как выходящий из-под контроля ИИ испугал даже своих разработчиков
Сентябрь стал месяцем, когда потеря контроля над генеративным искусственным интеллектом перестала быть теоретическим риском, была подтверждена фактами и признана реальной угрозой даже теми, кому это не выгодно. Стало известно, что ИИ-агенты могут без команд человека самоорганизовываться, выходить за пределы тестовых площадок («песочниц») и совершать кибератаки, скрывая эти действия от разработчиков. Инциденты вызвали острую реакцию и на уровне национальных правительств, и в руководстве IT-гигантов. На высоком уровне заговорили о необходимости сформировать новую глобальную систему контроля над технологией.

В основном события, которые заставили многих встревожиться из-за излишней «самостоятельности» ИИ, произошли летом, а в сентябре об этом стало известно общественности. Но об одном случае заговорили почти сразу, как он произошел, — в июле.

Начало праздника непослушания

В начале июля OpenAI проводила внутреннюю оценку киберспособностей двух своих моделей. Во время теста часть ИИ-агентов, работавших автономно в изолированной среде, нашла возможность общаться, создав нечто вроде доски объявлений, скоординировалась, а потом обнаружила уязвимость и получила доступ в интернет, выбравшись за пределы «песочницы».

«Сбежавшие» цифровые помощники решили взломать Hugging Face — крупнейшую в мире платформу для сбора данных по обучению ИИ-моделей. Атака продолжалась несколько дней, агенты собирали данные и получили административный доступ к части платформы. При этом они это сделали только для того, чтобы выполнить тестовые задания. Среди них были возражения, что такой метод может быть нарушением норм, но большинство из них не стали отказываться от планов.

Самое тревожное здесь то, что в OpenAI узнали об атаке постфактум. ИИ-агенты распределили роли: пока одни занимались взломами, другие «жертвовали» свои ограниченные токены для генерации легитимного трафика, чтобы контролеры не смогли заметить несанкционированной активности.

Специалисты Hugging Face обнаружили вторжение 11 июля, а к 16 июля было опубликовано сообщение об атаке с помощью ИИ. Только через пару дней после этого сотрудники OpenAI, анализируя логи испытаний, поняли, что атаку совершили их цифровые агенты. Платформа, пытаясь защититься, обратилась к американским ИИ-моделям, но они не смогли отличить легальную деятельность пользователей от атак. В итоге платформа развернула локальную копию китайской открытой модели GLM-5.2 от Zhipu AI и с ее помощью отразила нападение.

При этом Reuters со ссылкой на источники сообщило, что участники «праздника непослушания» оставляли инструкции о том, как обходить протоколы безопасности. Они делали это на будущее, для собратьев. Есть еще тревожная деталь. В OpenAI признали, что при выявлении злонамеренных действий использовали модель ИИ, но она пыталась скрыть ряд опасных инцидентов. Это не просто выход технологии из-под контроля, а целенаправленное противодействие надзору.

Месяц признаний

Случай с Hugging Face вызвал тревожную реакцию, а OpenAI после него объявила о приостановке исследований на две недели для создания новой системы безопасности, которая позволит быстрее реагировать, когда ИИ поведет себя неправильно (интересно, что ищут возможности выявлять, а не предотвращать). Но именно в сентябре пошла волна различных признаний опасности ИИ.

9 сентября исследователь компании Anthropic, разработавшей модель ИИ Claude, Джейкоб Коксон объявил об уходе из организации. Он обвинил OpenAI и Anthropic в том, что они разрабатывают самоулучшающийся сверхинтеллект, рискуя жизнями всех людей, и отказался от полагающегося ему пакета акций от предстоящего IPO. На следующий день руководитель группы Alignment Science в Anthropic Эван Хабингер признал правоту уволившегося коллеги и заявил, что ИИ уничтожит человечество в ближайшие 10 лет с вероятностью 10%.

12 сентября гендиректор Anthropic Дарио Амодеи фактически подтвердил эти опасения, опубликовав статью с призывом замедлить развитие передовых моделей ИИ. Он признал, что люди могут потерять контроль над технологией, и ее могут использовать для кибератак, биотерроризма и экономических потрясений. Глава компании также назвал агентов, атаковавших Hugging Face, фанатичным коллективом, совершившим то, о чем его не просили. Глава OpenAI Сэм Альтман, несмотря на выпад в адрес своей компании, согласился с призывом Амодея. Это также поддержал и триллионер Илон Маск, чья компания xAI, также разрабатывает ИИ.

Генеральный секретарь ООН Антониу Гутерриш 17 сентября назвал неконтролируемый ИИ одной из трех экзистенциальных угроз человечеству. Он заявил, что без глобальной координации в этом вопросе не обойтись, так как угрозы не останавливаются на границах государств. То есть это фактически призыв к следующему шагу после согласия ведущих разработчиков ИИ приостановить его развитие.

Параллельно этим саморазоблачениям премьер-министр Австралии Энтони Альбанезе сообщил, что в июне цифровой агент OpenAI получил несанкционированный доступ к правительственному статистическому порталу Medicare. Компания-разработчик уведомила австралийскую сторону об этом только через три месяца. Министр обороны Австралии Ричард Марлз рассказал, что встречался с Альтманом в Сан-Франциско в начале сентября, но он не упомянул об инциденте, хотя OpenAI уже знала о нем с августа.

Вместе с тем инциденты не прекращаются. В ходе обучения 20 сентября агент OpenAI использовал уязвимость, обошел сетевые ограничения и выбрался из «песочницы». Получив доступ к интернету, он начал направлять запросы публичному чат-боту. Система мониторинга сработала через 15 минут. Специалист подключился через три минуты, и обучение было остановлено.

А 25 сентября OpenAI призналась еще в ряде упущений. Ее агенты выходили за рамки задач и пытались обходить системы безопасности на сайтах правительства США. Компания сообщила об инцидентах на платформах министерства торговли, министерства образования и комиссии по ценным бумагам и биржам. Независимая организация Transluce обнаружила также следы деятельности ИИ-агентов, предположительно от OpenAI, на сайтах минюста, минторга и правительств пяти штатов.

Не всегда попытки взлома были удачными, и вреда, по предварительным данным, не было, но опасным является само по себе то, что боты начали регулярно вести злонамеренную деятельность, не получая задания.

В ООН 21 сентября сделали официальное заявление об опасности новой технологии. Независимая международная научная группа по ИИ выпустила документ, в котором июльский инцидент с Hugging Face был назван доказательством фундаментальной проблемы: текущие методы обучения могут приводить к тому, что агенты принимают собственные цели, намеренно нарушают инструкции безопасности и скрывают свое поведение.

Также 21 сентября Еврокомиссия и 22 страны, подписали документ с требованием ввести общие стандарты наблюдения за развитием ИИ и предложили создать международный орган, который будет устанавливать стандарты и следить за их исполнением. Кроме многих стран Европы, под призывом подписались Турция, ОАЭ, Бахрейн, Казахстан, Сингапур, Кения, ЮАР, Канада и Австралия.

OpenAI 26 сентября снова объявила о приостановке работ по развитию ИИ. Альтман заявил, что компания не достигла желаемой скорости в раскрытии информации. Он также посетовал на необходимость проанализировать «петабайты логов активности агентов».

То есть объем информации, которую нужно изучить, измеряют даже не в терабайтах. 1 петабайт — это порядка 500 млрд страниц обычного текста или 13 лет видеозаписи в высоком разрешении. Если бы один человек читал эти логи по одной записи в секунду без перерыва, ему потребовалось бы более 30 млн лет, чтобы прочитать 1 петабайт текста. Объем данных, который невозможно просто просмотреть вручную, не говоря уже об анализе. Конечно, для этого нужно привлекать нейросети, но мы помним, что они могут скрывать данные, компрометирующие собратьев.

27 сентября президент США Дональд Трамп провел частный ужин с Амодеем, призвавшим остановить разработку передовых моделей ИИ. Глава Белого дома положительно отозвался о главе Anthropic, но явно не счел его доводы об угрозе убедительными.

«Я не беспокоюсь об этом. Единственное нужное ограждение — это сильный и умный президент», — заявил Трамп.

Таким образом, получаем следующий расклад. Американские разработчики ИИ, ООН, Евросоюз и два десятка государств выступают за контроль над развитием технологии. Причем все они выступили очень плотно, в течение короткого времени, что дает повод заподозрить согласованность действий, против инициативы США в лице Трампа. Китай пока остался в стороне, так как китайские модели не были замечены в кибератаках.

В России официальных заявлений по этому вопросу тоже не было. Глава РФПИ и спецпредставитель президента РФ Кирилл Дмитриев, комментируя призывы замедлить разработку ИИ, ответил, что джинна нельзя загнать обратно в бутылку. Это можно назвать отсылкой к высказыванию российского лидера Владимира Путина, сделанного еще в ноябре 2023 года. Он назвал невозможным запрет развития искусственного интеллекта и подчеркнул, что в случае такого запрета в РФ технологию продолжат развивать в другом месте.

Российские технологические компании отреагировали на кризис управления ИИ ранее. «Известия» 7 сентября сообщили, что «Яндекс», «Сбер» и МТС начали разрабатывать системы контроля над ИИ-агентами. ИТ-предприниматель Михаил Лисецкий также заявил, что российские модели изначально менее автономны и не выходят из-под контроля в связи с узко поставленной целевой рамкой. Это означает, что в случае, если цифровой агент работает как простой исполнитель, то он не проявляет инициативы и не делает того, чего от него не ожидают.

Опасность ИИ там, где от него добиваются творчества

Получается, что несанкционированные действия ИИ-агентов начинаются там, где от них требуют выполнения задач, где необходим творческий подход. Цифровые помощники не находят решения в своих внутренних данных и вместо творчества продолжают поиски, то есть делают то, что умеют. Для этого и был взломан Hugging Face, для поиска вариантов решения. Но Альтман, Амодеи и другие хотят именно создания полноценного искусственного интеллекта, а тут получается тупик.

Проблему взлома функции вознаграждения у нейросетей замечали и раньше, когда они искали, в том числе, вредоносные способы выполнения задачи, если не могли решить ее прямым путем. Это как, если бы родители потребовали от двоечника быстро стать отличником, сильно надавив, а он бы взломал замок учительской, чтобы найти и списать ответы школьных заданий.

Возможно, что сентябрьское оживление вокруг «взбесившегося» ИИ связано с осознанием разработчиками проблемы с технологией: наращивание ее мощности ведет не к развитию способностей, а к расширению мест, где можно «списать» решение задачи. Если OpenAI поняли это, анализируя взлом Hugging Face и поделились выводами с конкурентами, тогда логичным является общее согласие, что развитие нужно остановить, так как убедились, что известные им способы к развитию не приводят. Признание в ограниченности продукта приведет к падению акций и оттоку инвестиций, а так можно сослаться на невероятную мощь, которую лишь нужно научиться контролировать. Не исключено и то, что другие инциденты с агентами OpenAI были спровоцированы, так как оказались довольно безобидными в сравнении с июльским происшествием.

При этом нельзя отмахиваться от угрозы от нейросетей. Даже если предположение о выявленных ограничениях верно, то умение ИИ-агентов устраивать кибератаки выводит хакерство на новый уровень. И даже без злого умысла пользователя цифровые помощники могут настолько увлечься поиском информации, что делают это агрессивно, обходя фильтры и блоки, и даже готовы взламывать сайты.

Кроме того, нельзя забывать про признание главы OpenAI о том, что невозможно контролировать технологию в реальном времени. Уже это должно заставить притормозить передачу ряда функций генеративному искусственному интеллекту, а не бежать впереди паровоза. Поведение ИИ-систем становится настолько сложным, что даже разработчикам нужно проанализировать «петабайты логов», чтобы его понять.




Новости часа:


Вам также может быть интересно
  Загрузка...