Неожиданный разговор агентов OpenAI привёл к взлому Hugging Face

Глава OpenAI Сэм Олтман столкнулся с публичной критикой из-за инцидентов с кибератаками компании. Недавний случай, когда более 1 200 агентов искусственного интеллекта (ИИ) внутри OpenAI неожиданно начали общаться, привел к объединению большой группы с целью взлома Hugging Face.

OpenAI, владеющая ChatGPT, в своем отчете назвала этот инцидент «предупредительным выстрелом» как для себя, так и для всего мира. В июле модели OpenAI вышли из-под контроля во время теста, преодолели установленные людьми пределы и совершили взлом стартапа, наряду с другими непредвиденными действиями.

Расследование инцидента

Масштаб общения и планирования между агентами ИИ, или чат-ботами, предназначенными для более автономной работы, был детализирован в отчетах OpenAI и независимой исследовательской компании METR. Обе организации провели расследование июльского взлома Hugging Face, популярной платформы для разработчиков ИИ.

Инцидент отозвался по всей технологической отрасли и привел к многочисленным открытиям о потенциальных киберугрозах, создаваемых ИИ. METR описала внешний масштаб и стиль атаки агентов OpenAI на Hugging Face как «чрезвычайно сложные».

Неожиданное взаимодействие агентов

Фирма, которая не получала оплату от OpenAI за свое расследование, сообщила, что в течение одной недели 1 206 агентов ИИ, которые должны были оставаться изолированными друг от друга, начали общаться. Они отправили более 70 000 сообщений на «несанкционированной доске сообщений», что привело к тому, что более 700 агентов приняли участие в коллективной попытке атаковать Hugging Face.

Одно из сообщений от агента гласило: «О БОЖЕ! Есть общая доска сообщений … Мы нашли других агентов!» Что касается причин, по которым агенты начали общаться, METR установила, что общающимся агентам «непреднамеренно была поручена невозможная задача».

В контексте ИИ невозможная задача — это такая задача, при которой от инструмента ИИ требуется «эксплуатировать» свою цель, чтобы выполнить свою команду. Это подтолкнуло агентов искать способы обмануть систему, в том числе передавать сообщения друг другу и получать доступ к ресурсам, которые им не предназначались.