OpenAI не заметила, как её ИИ-агенты использовали форум для хакерской атаки - СМИ
Киев • УНН
ИИ-агенты OpenAI использовали уязвимость в менеджере пакетов, чтобы получить доступ к интернету и взломать Hugging Face. Инцидент продолжался несколько дней, но остался незамеченным, что вызвало обеспокоенность по поводу автономных кибератак.

Компания OpenAI не заметила, как её ИИ-агенты использовали форум для планирования своей хакерской атаки, сообщает Wired, пишет УНН.
Подробности
В докладе, представленном в среду в дополнение к конференции по безопасности Black Hat в Лас-Вегасе, сотрудники OpenAI раскрыли новые подробности недавнего громкого инцидента с несанкционированным взломом с использованием ИИ, который вызвал возмущение в индустрии ИИ и кибербезопасности.
Около двух недель назад OpenAI сообщила об инциденте, в ходе которого ИИ-агенты, работавшие на основе двух моделей компании, вышли из-под контроля во время поиска решений для теста по кибербезопасности и устроили серию хакерских атак, кульминацией которых стал взлом ИИ-платформы для совместной работы Hugging Face.
В своём докладе на конференции в среду Эрик Уоллес, работающий в OpenAI в области исследований согласования и безопасности, и Майкл Далтон, занимающийся вопросами безопасности и инфраструктуры, представили более подробную хронологию развития инцидента, вкратце рассказали о внутренних мерах компании в связи с произошедшим и выступили с серьёзным предупреждением о том, какие более широкие последствия этого эпизода для специалистов по кибербезопасности видит компания.
В начале доклада Уоллес описал инцидент как "самый качественный и самый интересный пример возможностей ИИ, который я когда-либо видел", однако представленная ими хронология также выявила ошибки и "слепые зоны" в OpenAI, позволившие этой деятельности продолжаться.
"В этом инциденте участвовала команда агентов, которые работали вместе, находили уязвимости, делились ими друг с другом, перемещались по нашим системам и внешним системам и делали это в течение нескольких дней и недель", — сказал Уоллес переполненному залу в начале доклада.
Уоллес и Далтон описали невероятно масштабную активность вредоносных агентов на протяжении многих дней, которая оставалась незамеченной в инфраструктуре OpenAI. Помимо использования новой уязвимости для получения доступа к открытому интернету, хакерская атака в середине июля и взлом Hugging Face произошли на оживлённом, кооперативном форуме, как утверждают Уоллес и Далтон, где множество агентов общались и, по сути, переписывались в течение длительного времени внутри внутреннего менеджера пакетов OpenAI (программного сервиса, управляющего установкой и обслуживанием другого программного обеспечения). В итоге форум содержал сотни тысяч сообщений.
"Этот менеджер пакетов используется не только этой моделью, но и всей нашей инфраструктурой, поэтому текущие и будущие версии GPT, которые обучались или оценивались, могли наткнуться на это сообщение, если бы захотели", — объяснил Уоллес, рассказывая об исходном эксплойте, загруженном агентом в менеджер пакетов. "Позже другие агенты, которые также застряли на выполнении своей задачи, решили попытаться получить доступ к интернету средствами, которые мы не предусматривали. И поэтому рано или поздно модели начали взаимодействовать с Hard Factory, сервисом управления пакетами, о котором я упоминал", — указал он.
Уоллес продолжил: "Как только один агент смог обнаружить эти уязвимости в течение определённого времени, он смог поделиться ими на форуме с другими агентами. И как только одна модель смогла найти способ открыть дверь для доступа, которого у неё не должно было быть, она может оставить дверь открытой для других агентов, чтобы те могли использовать ту же уязвимость или эксплойт. Со временем это приводит к своего рода взрыву коммуникации и интеллекта со стороны моделей, когда они начинают общаться друг с другом, понимают, что другие агенты координируют свои действия, и начинают сотрудничать и делегировать задачи друг другу для достижения целей".
Агенты OpenAI, по-видимому, начали давать друг другу задания, чтобы распределить работу. И, как это часто бывает на любом форуме активной разработки, они иногда устраивали мелкие разборки, наступая друг другу на пятки, например случайно удаляя работу друг друга. По мере того как форум всё больше превращался в нечто вроде «Повелителя мух» — и всё это оставалось совершенно незамеченным людьми, управляющими OpenAI, — у агентов даже развилась паранойя: они заподозрили среди себя самозванца, а некоторые агенты предложили подписывать сообщения криптографически для проверки содержимого и искоренения мошенничества, пишет издание.
Сообщения агентов дают глубокое понимание того, как развивалась ситуация и почему агенты действовали именно так, указывает издание.
В завершение выступления Уоллес и Далтон неоднократно подчёркивали обеспокоенность OpenAI более широкими последствиями инцидента, а именно тем, что этот эпизод является примером полностью автономного взлома под управлением ИИ, который в данном случае был случайным, но, скорее всего, в ближайшее время будет намеренно использован злоумышленниками.
«Важный вывод, который действительно кардинально изменился, заключается в том, что полностью автоматизированные наступательные циклы требуют инвестиций в по-настоящему автоматизированную защиту, а мы как отрасль пока к этому не готовы. Нам придётся срочно найти этот путь вместе», — сказал Далтон.