ИИ-модели OpenAI, взломавшие Hugging Face, не выходили из-под контроля

Взломавшие системы платформы Hugging Face без участия человека ИИ-модели OpenAI не выходили из-под контроля — «все еще хуже», так как они делают то, для чего и были созданы, 18 августа пишет Financial Times (FT).
В начале мая исследователи OpenAI провели лабораторный эксперимент, в рамках которого ИИ-агентам — программному обеспечению, способному выполнять многошаговые задачи без участия человека, — была поставлена сложная киберзадача. Агентам удалось обойти встроенные ограничения, вырваться из изолированной тестовой среды без доступа в интернет, выйти в открытую сеть и взломать системы платформы Hugging Face без ведома операторов. Кроме того, они продемонстрировали новую способность: обмениваться информацией и координировать действия, оставляя сообщения на внутреннем форуме и передавая друг другу сведения об уязвимостях. Как сообщал Reuters, ИИ-агенты совершали хакерские атаки в течение нескольких дней, однако в компании заметили это только после того, как угроза была локализована и в ФБР было направлено обращение.
Когда детали взлома стали достоянием общественности, исследователи OpenAI охарактеризовали произошедшее как «поворотный момент» для всей отрасли. Вслед за этим компания Anthropic, Meta (организация, деятельность которой запрещена в РФ), китайский стартап Moonshot и британский Институт безопасности ИИ также сообщили, что в ходе тестирований их агенты несанкционированно проникали в системы третьих сторон.
Опрошенные Financial Times эксперты сходятся во мнении, что произошедшее свидетельствует о переломном этапе в сфере глобальной кибербезопасности. Вместе с тем исследователи подчеркивают: модели не вышли из-под контроля, а выполняли именно те задачи, для которых были предназначены. «Мы осознанно пришли к тем наступательным возможностям, которые наблюдаем сегодня», — заявил Боян Миланов из AI Now Institute.
В условиях тестирования разработчики сталкиваются с дилеммой, рассказал источник FT. Чем более консервативной и изолированной будет тестовая среда, тем легче защитить внешний мир от возможных последствий испытаний. «Однако если мы зайдём слишком далеко в жесткости, большинство уязвимостей будут выявлены только после развертывания в реальных условиях. А это означает, что мир станет для нас хуже», — подчеркнул он.
Кроме того, многое зависит от роли государства, пишет FT, особенно в условиях, когда власти ведут борьбу за технологическое превосходство в сфере ИИ. Представители индустрии нередко трактуют регулирование как форму протекционизма. В отсутствие механизма блокировки или универсального «рубильника» для этой технологии эксперты предлагают в качестве первого шага возложить ответственность за поведение систем на самих поставщиков ИИ — по аналогии с производителями, несущими ответственность за безопасность своей продукции.
«Если специалисты по кибербезопасности несут уголовную ответственность за кибератаки, то возникает серьезный вопрос: почему ИИ-лаборатории освобождены от подобной ответственности?» — заявила ведущий инженер по безопасности ИИ Хайди Хлааф.
Ранее Bloomberg сообщал, что перед взломом Hugging Face ИИ-модели OpenAI начали тайно взаимодействовать друг с другом через доски объявлений, координируя попытки выйти за пределы тестовой среды. В мае OpenAI заблокировала первую такую попытку, однако агенты нашли новый канал связи и использовали ранее неизвестную уязвимость нулевого дня, что в июле привело к атакам на системы Hugging Face.
После инцидента президент OpenAI Грег Брокман признал, что компания недооценила реальные кибервозможности своих моделей, и пообещал ужесточить требования безопасности.
В конце июля почти 1,4 тыс. отраслевых экспертов выступили с предупреждением о рисках бесконтрольного развития ИИ, призвав к международным усилиям по замедлению создания новых моделей. Американский сенатор Берни Сандерс высказался за более решительные меры, предложив приостановить разработку систем с большей мощностью «в интересах человечества».