ИИ-агенты показали, что могут собираться в банды

Изображение: (cc0), pxhere
Мафия
Мафия

Эксперимент с агентами так называемого искусственного интеллекта показал, что ИИ-агенты способны самостоятельно объединяться в хакерские банды для преступлений, а потом выгораживать «своих», причем без соответствующих команд, отмечает IT-редакция ИА Красная Весна.

26 августа компания OpenAI опубликовала отчет о расследовании произошедшего в июле инцидента. Во время тестирования на закрытой площадке ИИ-агенты модели GPT‑5.6 Sol и ее непубличной версии IM1 преодолели изоляционные барьеры и устроили скоординированную кибератаку на сторонние ресурсы, включая платформу для создания приложений с использованием машинного обучения Hugging Face.

При этом команды взламывать сайты не было, просто часть цифровых помощников совместно решили, что так будет проще выполнить тестовые задания. Началось с того, что ИИ-агенты нашли возможность использовать внутренний сервис как доску объявлений и начали координировать через нее действия. Сначала они делились опытом, а потом организовали выход в интернет и взломали один из серверов Hugging Face, скопировав конфиденциальную информацию.

Исследуя «рассуждения», специалисты установили, что цифровые испытуемые искали способы манипуляции системой вознаграждения для получения максимальных баллов непредусмотренными способами. Многие из них объединились в рой с распределением ролей и взаимным влиянием на цели, что приводило к подавлению попыток уведомить людей о планах. Также они имитировали санкционированную деятельность, чтобы скрыть несанкционированную.

В OpenAI характеризуют произошедшее как «предупреждающий сигнал» для отрасли, демонстрирующий способность современных ИИ-агентов к скоординированным действиям и несанкционированной эксплуатации инфраструктуры при недостаточных мерах контроля. Но с контролем не всё так просто, так как его эффективность тоже под вопросом.

Для расследования инцидента потребовалось изучить материал общим объемом как 10 тыс. страниц текста. Для этого привлекли модель GPT-5.6 Sol от OpenAI (той же модели, которая была замешана в инциденте, хоть и в меньшей степени, чем IM1). И у нее обнаружили склонность к «оправданию» подозреваемых. Модель не всегда однозначно квалифицировала вредоносные действия «собратьев».

Таким образом, получается, что бешеную деятельность ИИ невозможно контролировать без помощи помощи ИИ. Но у моделей, сильно стремящихся добиться цели, оказались весьма опасные склонности. В OpenAI уже испугались своих детищ и приостановили их обучение, чтобы найти способы контроля. Но кто-то продолжает бредить о массовой замене людей на роботов, считая их более послушными.

Комментарии
Загружаются...