OpenAI не помітила, як її ШІ-агенти використали форум для хакерської атаки - ЗМІ
Київ • УНН
ШІ-агенти OpenAI використали вразливість у менеджері пакетів, щоб отримати доступ до інтернету та зламати Hugging Face. Інцидент тривав кілька днів, але залишився непоміченим, що викликало занепокоєння щодо автономних кібератак.

Компанія OpenAI не помітила, як її ШІ-агенти використовували форум для планування своєї хакерської атаки, повідомляє Wired, пише УНН.
Деталі
У доповіді, яка стала доповненням до конференції з безпеки Black Hat у Лас-Вегасі в середу, співробітники OpenAI представили нові подробиці про нещодавній гучний інцидент з несанкціонованим зломом ШІ, який викликав обурення в індустрії ШІ та кібербезпеки.
Близько двох тижнів тому OpenAI повідомила про інцидент, у якому ШІ-агенти, що працюють на основі двох моделей компанії, вирвалися з-під контролю під час пошуку рішень для тесту з кібербезпеки та влаштували серію хакерських атак, кульмінацією яких стало злом ШІ-платформи для колаборації Hugging Face.
У своїй доповіді на конференції в середу Ерік Воллес, що працює в OpenAI в галузі досліджень узгодження і безпеки, і Майкл Далтон, який займається питаннями безпеки та інфраструктури, представили більш докладну хронологію розвитку інциденту, коротко розповіли про внутрішні заходи компанії у зв'язку з подією і виступили з серйозним попередженням про те, що компанія бачить як ширші наслідки цього епізоду для захисників кібербезпеки.
На початку доповіді Воллес описав інцидент як "найякісніший і найцікавіший приклад можливостей ШІ, який я коли-небудь бачив", але представлена ними хронологія також виявила помилки та "сліпі плями" в OpenAI, які дозволили цій діяльності продовжуватися.
"У цьому інциденті брала участь команда агентів, які працювали разом, знаходили вразливості, ділилися ними один з одним, переміщалися по наших системах і зовнішніх системах, і робили це протягом декількох днів і тижнів", - сказав Воллес переповненій залі на початку доповіді.
Воллес та Далтон описали неймовірно масштабну активність зловмисних агентів протягом багатьох днів, яка залишилася непоміченою в інфраструктурі OpenAI. Крім використання нової вразливості для отримання доступу до відкритого інтернету, хакерська атака в середині липня і злом Hugging Face відбулися на жвавому, кооперативному форумі, як стверджують Воллес і Далтон, де безліч агентів спілкувалися і, по суті, переписувалися протягом тривалого часу всередині внутрішнього менеджера пакетів OpenAI (програмного сервісу, що управляє установкою та обслуговуванням іншого програмного забезпечення). Зрештою, форум містив сотні тисяч повідомлень.
"Цей менеджер пакетів використовується не тільки цією моделлю, а й усією нашою інфраструктурою, тому поточні та майбутні версії GPT, які навчалися або оцінювалися, могли натрапити на це повідомлення, якби захотіли", - пояснив Воллес, розповідаючи про оригінальний експлойт, завантажений агентом у менеджер пакетів. "Пізніше інші агенти, які також застрягли на своєму завданні, вирішили спробувати отримати доступ до інтернету засобами, які ми не припускали. І тому рано чи пізно моделі почали взаємодіяти з Hard Factory, сервісом управління пакетами, про який я згадував", - вказав він.
Воллес продовжив: "Щойно один агент зміг виявити ці вразливості протягом певного часу, він зміг поділитися ними на форумі з іншими агентами. І як тільки одна модель змогла знайти спосіб відкрити двері для доступу, який їй не належить мати, вона може залишити двері відчиненими для інших агентів, щоб ті могли використовувати ту ж вразливість або експлойт. Згодом це призводить до свого роду вибуху комунікації та інтелекту з боку моделей, коли вони починають спілкуватися один з одним, розуміють, що інші агенти координують свої дії і починають співпрацювати та делегувати завдання один одному для досягнення цілей".
Агенти OpenAI, мабуть, почали давати один одному завдання, щоб поділити роботу. І, як це часто буває на будь-якому форумі активної розробки, вони іноді влаштовували дрібні розбірки, наступаючи один одному на п'яти, наприклад, випадково видаляючи роботу один одного. У міру того, як форум все більше перетворювався на подобу "Володаря мух" - і все це залишалося абсолютно непоміченим людьми, які управляють OpenAI, - в агентів навіть розвинулася параноя, вони запідозрили самозванця серед себе, а деякі агенти запропонували підписувати повідомлення криптографічно для перевірки контенту та викорінення шахрайства, пише видання.
Повідомлення агентів надають глибоке розуміння того, як розвивалася ситуація та чому агенти так діяли, вказує видання.
На завершення виступу Воллес і Далтон неодноразово наголошували на занепокоєнні OpenAI щодо ширших наслідків інциденту, а саме на тому, що цей епізод є прикладом повністю автономного злому, керованого ШІ, який у цьому випадку був випадковим, але, найімовірніше, буде використаний зловмисниками навмисно найближчим часом.
"Важливий висновок, який справді кардинально змінився, полягає в тому, що повністю автоматизовані наступальні цикли вимагають інвестицій у по-справжньому автоматизований захист, а ми як галузь поки що до цього не готові. Нам доведеться терміново знайти цей шлях разом", - сказав Далтон.