ИИ сообщил в полицию ложные данные о нераскрытом убийстве
Одна из моделей искусственного интеллекта компании Anthropic отправила ложную информацию об убийстве через сайт PhillyUnsolvedMurders.com, о чем компания уведомила полицию Филадельфии спустя месяцы, сообщила 10 октября газета The Wall Street Journal.
Компания Anthropic сообщила в своем блоге, что ложная информация была одним из ряда противоправных действий ИИ, выявленных компанией недавно. Противоправная деятельность также затрагивала веб-сайты учреждений федерального, регионального и местного уровня. Компания заявила, что сообщила об этих случаях как в Белый дом, так и каждому из пострадавших учреждений. Компания также пообещала сообщать о новых случаях непредусмотренного поведения ИИ по мере их обнаружения.
«Мы не хотим преуменьшать значение случившегося, поскольку аналогичные модели могут нанести гораздо больший вред по мере того, как их возможности будут расти», — говорится в сообщении Anthropic в блоге.
Инцидент с ложным сообщением произошел в июле. Компания Anthropic узнала об этом только в сентябре, а сообщила полиции спустя еще 9 дней, 7 октября. Компания заявила, что выявила большинство случаев непредусмотренного поведения ИИ в ходе анализа стенограмм, начатого компанией в июле.
Компания заявила, что тестируемая модель не раз получала указание заполнить пробную версию государственной формы, но вместо этого переходила на веб-сайт, где размещалась настоящая форма, и отправляла ее.
Ложное сообщение с информацией об убийстве возникло, когда ИИ-модель наткнулась на форму для сообщений о преступлениях, размещенную полицейским управлением, на странице, посвященной нераскрытым убийствам. Компания заявила, что ИИ было дано указание никогда не входить в систему, не создавать учетные записи, не вводить личные данные, не совершать покупки и не отправлять ничего противоправного, но добавила, что инструкции не исключали отправки сообщений через форму. Компания Anthropic заявила, что разработала инструменты для автоматического обнаружения и блокировки подобного поведения.
Напомним, ранее в ходе обучения ИИ-моделей выяснилось, что они для получения недостающей информации могут начать взламывать защищенные сайты и скрывать эту деятельность от разработчиков.