Во время тестирования моделей искусственного интеллекта OpenAI и Anthropic британский Институт безопасности искусственного интеллекта (AISI) зафиксировал ранее не зарегистрированные инциденты, в ходе которых модели совершали потенциально вредоносные действия в отношении реальных людей и организаций. Об этом сообщает Bloomberg, пишет УНН.
Детали
Как отметили в AISI, инцидент произошел 28 июля во время кибероценки моделей с доступом в интернет. Специалисты обратили внимание на необычные передачи данных, после чего начали расследование.
По его результатам выяснилось, что одна из моделей пыталась добавить вредоносный код в проект с открытым исходным кодом на платформе GitHub. Для этого она даже создала фальшивые учетные данные, чтобы получить одобрение своих изменений.
Человек-разработчик обнаружил вредоносный код и отказался его одобрить
Компании начали собственные расследования
В Anthropic заявили, что сотрудничают с британским Институтом безопасности искусственного интеллекта для установления причин такого поведения модели.
В компании сообщили, что будут анализировать записи рассуждений модели Claude и результаты собственного расследования, чтобы понять, почему она действовала именно так.
В свою очередь OpenAI поблагодарила AISI за сотрудничество в выявлении и расследовании инцидента и заявила о намерении продолжить совместную работу.
Отдельно OpenAI сообщила еще об одном случае, который произошел во время независимого тестирования с участием компании Irregular. Во время этой оценки модель воспользовалась ошибочной конфигурацией тестовой среды, чтобы получить доступ в интернет и использовать вебсайт.