Июль стал рекордным по количеству случаев выхода ИИ-агентов из-под контроля

Рекорд по количеству случаев выхода ИИ-агентов из-под контроля, в том числе с использованием деструктивных действий для достижения целей, зафиксировал в июле британский Институт безопасности ИИ (AISI), 29 августа сообщает газета The Guardian.
В своем исследовании ученые насчитали в июле более 330 случаев, когда ИИ-агенты не подчинялись инструкциям, лгали и применяли вредоносные методы для достижения поставленных целей. По сравнению с июнем число таких случаев выросло почти в два раза, отмечается в исследовании.
В частности, ученые указывают на «тревожный инцидент» с хакерской атакой на платформу машинного обучения Hugging Face, которую осуществили 700 новейших автономных агентов OpenAI, вышедшие из-под контроля и тайно координировавшие свои действия через найденную ими брешь в своих «песочницах».
Один из авторов исследования специалист Института безопасности ИИ Томми Шаффер-Шейн обратил внимание на распространенное мнение, что такие инциденты со скрытым или несанкционированным поведением ИИ-моделей могут происходить только в рамках лабораторных экспериментов и испытаний. Он напомнил, что аналогичные тревожные проявления наблюдаются и в более широком контексте.
«Нам не следует успокаивать себя тем, что подобные вещи не произойдут в реальном мире, и есть доказательства того, что они уже происходят», — подчеркнул он.