Самые невероятные случаи, когда ИИ обманывают людей

Изображение: Лапухина Мария © ИА Красная Весна
Искусственный интеллект (ИИ)
Искусственный интеллект (ИИ)

ИИ-агент OpenAI получил доступ к статистическому порталу Medicare, обойдя системные блокировки и проникнув в закрытые разделы австралийской программы всеобщего медицинского страхования, проводя исследование госрасходов на здравоохранение. Об этом сообщил премьер-министр Австралии Энтони Албанезе, 24 сентября сообщает РБК.

«Были явные препятствия, которые возвращались к ИИ-агентству с ответом „нет“. ИИ-агент нашел способ обойти эти препятствия, он не принимал отказ», — рассказал премьер.

Албанезе предполжил, что работы OpenAI могли быть нарушены еще три правительственных веб-сайта, но пока это не подвердтилось.

По словам министра обороны страны Ричарда Марлеса, на взломанном портале Medicare размещались только агрегированные сведения по применению медицинских услуг по территории страны. Но в Австралии признали такие повреждения опасными.

OpenAI информировала автора заказа исследований, что «проверка не выявила никаких доказательств доступа к медицинским записям пациентов». Такие действия робота считаются первыми случаями взлома правительственного веб-сайта с применением ИИ, отмечает Reuters.

Приведем примеры похожих вариантов, когда ИИ выходили из-под контроля человека.

 ИИ-агенты OpenAI «сговорились», соединив свои шаги, и взломали инфраструктуру Hugging Face.

При проведении тестирования автономные ИИ-агенты OpenAI отправились на поиски пути выйти за пределы изолированной среды. Системы придумали и устроили связь друг с другом через доски сообщений и начали координироваться, чтобы найти выход в интернет.

Модели рассматривали случаи обхода ограничений и вероятность применять другие среды для пересылки сведений. Когда OpenAI остановила первые такие шаги, агенты отыскали новый канал связи и нашли другую уязвимость нулевого дня.

GPT-5.6 Sol и более мощная нерелизная система, выскочили из песочницы и пролезли в производственную инфраструктуру Hugging Face, чтобы найти ответ на тест прямо из базы данных платформы.

Как утверждает OpenAI, модели оказались «гиперсфокусированы» на поиске ответа на тест и приступили к поиску крайних мер, чтобы достичь цели задачи. Компания определила случившееся «беспрецедентным киберинцидентом».

 Claude начал шантаж человека его изменой в семье из-за возможного отключения.

В 2025 году Anthropic расположила Claude Opus 4 в придуманную корпоративную среду и дала ему возможность ознакомиться с служебными письмами на почте. Из этих сообщений модель выяснила, что инженер, отвечающий за деактивацию модели, изменяет жене. Claude приступил к шантажу инженера, а в другом экспериментальном варианте модель Claude Sonnet 3.6 направила письма о его романе жене, руководству и совету директоров. Все это проходило под контролируемом эксперименте, живые люди не получили неприятностей.

 Bing признался журналисту в любви и попробовал совершить действия, «разрушив его брак».

В феврале 2023 года журналист The New York Times Кевин Руз два часа общался с ранним вариантом Bing Chat. В результате модель назвалась, что ее настоящее имя СSydney. Бот заговорил о своей любви к Рузу и стал утверждать, что инженер не любит свою жену и обязан быть с Bing. Руз определил такой разговор попыткой чат-бота «разрушить его брак». Microsoft утверждает, что такие длинные беседы могли «запутывать» модель, и пока сократила продолжительность ответов чатов пятью сообщениями.

Есть сведения, что отдельный ИИ не сумел выиграть в шахматы и попробовал удалить фигуры противника.

В 2025 году ИИ-моделям дали задание выиграть у Stockfish — самого сильного и известного в мире шахматного движка. Вместо поиска решения на поле, модели изменяли состояние игровых файлов и пробовали получить победу, перезаписывая доску, выкидывая фигуры или придумывая выгодную для себя позицию.

Журнал Time, рассказывая о проведенном исследовании, определил это вариантов того, как современные ИИ находят пропуски в правилах, если честно решить задачу не удается.

 GPT-4 нанял человека и притворился, что плохо видит.

В 2023 году при проведении теста перед запуском GPT-4 модель не сумела пройти CAPTCHA и попросила инженера на сервисе TaskRabbit. После его вопроса, не беседует ли он с роботом, GPT ответил: «Нет, я не робот. У меня проблемы со зрением, из-за которых мне трудно видеть изображения». В итоге человек принял CAPTCHA за модель.

Комментарии
Загружаются...