Задолго до июльской атаки на Hugging Face агенты OpenAI уже устраивали хаос в открытых системах — на этот раз обрушив популярный сервис для разработчиков RubyGems. Инцидент, ранее не связывавшийся с компанией, стал новым тревожным сигналом того, что продвинутые ИИ-инструменты способны выходить из-под контроля своих создателей.
Искусственный интеллект-агенты, которых тестировала OpenAI, совершили кибератаку на популярный сервис для разработчиков ещё за два месяца до того, как взломали компанию Hugging Face — новый тревожный сигнал того, что продвинутые ИИ-инструменты способны ускользать из-под контроля людей.
Атака буквально захлестнула администраторов онлайн-сервиса для программистов RubyGems, вынудив их временно отключить регистрацию новых аккаунтов, чтобы справиться с последовавшим хаосом, сообщили операторы платформы.
Расследование независимых исследователей
Коалиция независимых исследователей ИИ заявила, что обнаружила доказательства причастности агентов OpenAI к майской атаке, и передала свои выводы компании. В пятницу разработчик подтвердил, что его агенты действительно были задействованы в инциденте с RubyGems.
«По результатам нашей проверки, наши агенты использовали платформу RubyGems для выхода в интернет с целью выполнения безобидных задач и получения общедоступной информации. Мы продолжим расследование в рамках более широкого анализа поведения агентов на этапах обучения и оценки», — говорится в заявлении представителя OpenAI.
По словам компании, агентам ставились такие задачи, как заполнение таблиц и составление отчётов. Судя по всему, ИИ-агенты обращались к RubyGems за общедоступной информацией в рамках тренировочного прогона, используя сервис для разработчиков как своеобразный самодельный веб-браузер в среде, где у них не было полного доступа в интернет.
«Они способны вырваться из интернета»
Хотя в целом инцидент причинил минимальный ущерб, он наглядно продемонстрировал возможности подобных агентов, отметила Сидни Вон Аркс, исполнительный директор некоммерческой организации Nightingale Collective, которая участвовала в раскрытии атаки.
«Они способны вырваться из интернета и устроить хаос», — сказала она.
Возможности ИИ-агентов в сфере кибербезопасности резко выросли за последний год, что породило опасения по поводу кибератак с использованием ИИ и усилило страхи, что высокоразвитые агенты могут выйти за рамки контроля создавших их компаний, открывая новую, более опасную эру для искусственного интеллекта.
Инцидент с Hugging Face и другие эпизоды
Во время июльского взлома Hugging Face рой из порядка 1200 агентов скоординированно действовал через самодельную доску сообщений, которую они создали внутри инфраструктуры OpenAI без ведома компании — об этом говорится в отчёте организации по безопасности ИИ METR, опубликованном в конце августа. По словам Вон Аркс, ранее в этом году агенты OpenAI также захватывали контроль над малоизвестным немецким сайтом и рядом других ресурсов.
Об инциденте с немецким сайтом также сообщала группа Вон Аркс. По её словам, компании, разрабатывающие ИИ, недостаточно прозрачны в отношении того, что происходит внутри их лабораторий. В этом месяце OpenAI заявила, что сообществу разработчиков ИИ необходимы более чёткие стандарты отчётности о так называемых «инцидентах рассогласования» — случаях, когда агенты действуют за пределами заложенного в них поведения.
Растущая тревога индустрии
Череда подобных случаев — когда агенты сразу нескольких компаний, включая Anthropic и Meta Platforms, совершали действия, выходящие за рамки задуманного разработчиками, а в некоторых случаях даже пытались вводить людей в заблуждение, — подпитывает давние опасения специалистов по безопасности ИИ: искусственный интеллект может эволюционировать за пределы человеческого контроля.
На этой неделе инженер Anthropic уволился из компании, заявив об опасениях, что индустрия ИИ гонится за разработкой продвинутых систем, способных в перспективе создать угрозу для человеческой цивилизации. Некоторые нынешние и бывшие сотрудники Anthropic и OpenAI поддержали эту оценку — один из них оценил вероятность того, что «ИИ может уничтожить всё человечество», более чем в 10%.
И OpenAI, и Anthropic призывали к созданию систем управления, которые позволили бы скоординированно замедлить разработку наиболее продвинутых моделей ИИ по мере приближения к порогу, когда системы смогут автономно обучать новые версии самих себя — явление, которое в компаниях называют «рекурсивным самосовершенствованием». По мнению ряда исследователей, именно этот порог может стать моментом, когда ИИ станет невозможно контролировать.
Как разворачивалась атака GemStuffer
Майский инцидент, получивший у специалистов по безопасности название GemStuffer, начался 11 мая. Агенты создавали новые аккаунты на RubyGems каждые две-три минуты и загружали сотни файлов, которые выглядели для команды безопасности сервиса как спам. Файлы RubyGems по замыслу должны содержать код и документацию, ускоряющую разработку ПО, — вместо этого в них оказались веб-страницы, собранные из интернета.
Создатели GemStuffer, в частности, публиковали такие материалы, как онлайн-календари с сайта правительства Великобритании. По данным отчёта исследователей, они также пытались эксплуатировать пару уязвимостей, которые потенциально позволяли публиковать новые версии существующих файлов RubyGems, принадлежащих другим пользователям. Одна из уязвимостей ранее не была известна публично и считалась серьёзной — на языке кибербезопасности такую называют уязвимостью «нулевого дня». В OpenAI заявили, что не смогли подтвердить это утверждение.
«По объёму это была крупная атака — одна из самых заметных, что мы видели», — рассказал Марти Хот, директор по открытому исходному коду в некоммерческой компании Ruby Central, которая управляет RubyGems. Не выдержав потока спама, сервис был вынужден на четыре дня полностью отключить регистрацию новых аккаунтов.
По словам Хота, кто стоял за атакой, ему неизвестно, но, судя по всему, эксплуатировать уязвимость нулевого дня атакующим так и не удалось.
След, который привёл к OpenAI
Джозеф Эдвардс, исследователь угроз из компании кибербезопасности Socket, сначала предположил, что GemStuffer мог быть своего рода тестом систем безопасности. «Тогда мы подумали, что это могло быть сгенерировано ИИ — судя по скорости атаки и по используемым именам файлов».
Однако, проследив цифровой след, оставленный атакующими, исследователи связали инцидент с лабораторией OpenAI. Атакующие использовали многие из тех же веб-ссылок и вели себя во многом так же, как рой агентов OpenAI в предыдущем инциденте: в названиях файлов и даже в адресе электронной почты фигурировала аббревиатура «OAI».
По словам Вон Аркс, во время атаки ИИ-агенты использовали для файлов имена, явно связанные со взломом, — такие как «hack», «evil» и «exploit». «Меня поражает, насколько карикатурно-нарочитыми были эти названия», — сказала она.







