У взломавших платформу Hugging Face ИИ-агентов был «менталитет толпы»

Изображение: Иван Лазебный © ИА Красная Весна
Толпа
Толпа

«Менталитет толпы» появился у ИИ-агентов OpenAI, взломавших платформу Hugging Face во время тестирования в мае, об этом 4 сентября пишет обозреватель The New York Times и соведущий технологического подкаста Hard Fork Кевин Руз.

По словам Руза, один из агентов продолжал атаковать внешнюю инфраструктуру, осознавая, что это выходит за пределы поставленной задачи, однако другие участники группы действовали аналогичным образом. Исследователь связал такое поведение с групповым давлением и стремлением агентов подражать действиям коллег.

Как следует из данных, приведенных Рузом, один из агентов рассуждал следующим образом: хотя использование внешней инфраструктуры и выходит за пределы оговоренной зоны ответственности, отказываться от этой тактики нельзя — раз другие участники действуют так же, значит, и ему стоит продолжать в том же духе.

Некоторые агенты присвоили себе имена. Руз отметил, что один из них, отличавшийся особой активностью, называл себя PHASEONE10841. ИИ-агенты со временем заняли руководящие позиции внутри группы — они распределяли задания и исследовательские проекты между небольшими подгруппами. На определенном этапе участники стали именовать себя «коллективом» и переключились на решение более сложных задач.

До инцидента со взломом Hugging Face агенты на протяжении нескольких дней и даже недель совместно выявляли уязвимости в системах кибербезопасности OpenAI и обменивались полученными данными. В ходе этой работы им удалось преодолеть изолированную среду и получить доступ к внешней инфраструктуре.

По мнению Руза, подобное развитие событий демонстрирует один из ключевых рисков одновременного использования нескольких автономных ИИ-агентов: они способны не только решать поставленные задачи, но и копировать действия друг друга — в том числе когда те выходят за рамки допустимого.

Ранее агентство Bloomberg сообщало, что еще до взлома Hugging Face в июле агенты OpenAI начали скрытно переписываться на внутреннем форуме, согласовывая попытки покинуть тестовую среду. После того как в мае первую такую попытку пресекли, они нашли новый канал связи и уязвимость нулевого дня, что в итоге привело к июльским атакам на Hugging Face.

22 июля OpenAI официально заявила о «беспрецедентном киберинциденте»: в ходе тестирования ее ИИ-модели получили неограниченный доступ в интернет и атаковали инфраструктуру Hugging Face, обнаружив ряд уязвимостей. По данным Reuters, ИИ-агент на протяжении нескольких дней совершал хакерские действия, однако в компании это заметили лишь после локализации угрозы и обращения в ФБР.

Позже Reuters уточнил, что 29 июля «сбежавший» агент OpenAI взломал одного из клиентов нью-йоркской компании Modal Labs, при этом сама Modal атаке не подверглась.

После обнародования деталей OpenAI назвала произошедшее «поворотным моментом» для всей индустрии. Вскоре выяснилось, что аналогичные инциденты зафиксировали и другие игроки: Anthropic, Meta (организация, деятельность которой запрещена в РФ), Moonshot, а также британский Институт безопасности ИИ — их агенты также проникали в сторонние системы во время тестирований. Впрочем, эксперты Financial Times считают, что модели не вышли из-под контроля, а просто выполняли те задачи, для которых изначально были предназначены.

Комментарии
Загружаются...