Машины могут уничтожить человечество не из ненависти к нему, а решая задачу

Угроза, исходящая от все большего применения ИИ, не в том, что компьютерные системы начнут испытывать ненависть к человечеству и исходя из нее будут принимать решения, а в том, что то или иное катастрофическое поведение будет побочным эффектом выполнения поставленной человеком задачи, отмечает IT-редакция ИА Красная Весна.
Именно такой ракурс проблемы предлагают рассмотреть авторы научной статьи How Could AI Eliminate Humanity? («Как ИИ может уничтожить человечество?») из Польско-японской академии информационных технологий в Варшаве. Ученые призывают не приписывать компьютерным системам эмоции и человеческое целеполагание, которое с одной стороны, как будто бы понятным языком объясняет их поведение, но на самом деле никак не связано с тем, как работают современные системы ИИ.
«Когда система ИИ планирует, ведет переговоры или выполняет задачу в несколько этапов, возникает соблазн описывать её поведение в терминах желания, амбиций, страха или обиды. Такие описания могут выглядеть удобными, но они способны затуманить вопрос о причинно-следственных связях, выставляя опасность зависящей от того, разовьет ли машина присущую людям враждебность», — пишут авторы.
В реальности же когда ИИ-агент составляет план, он решает поставленную человеком задачу, и с ростом своих возможностей, эта задача может решаться все более сложной последовательностью шагов. Встретив какое-либо препятствие, ИИ может попытаться его обойти. Именно подобные инциденты подталкивали агентов подтасовывать результаты собственной оценки (когда ставилась задача успешного ее прохождения) или взламывать государственные системы в США в поисках необходимой информации, которую не удалось получить другим способом.
Ученые настаивают, что разрушительное поведение не обусловлено якобы испытываемой машиной ненавистью к человеку или человечеству. «Плохо заданные цели, неожиданное обобщение, вредоносное использование людьми и небезопасные институциональные стимулы — всё это может приводить к опасному поведению без какой-либо злонамеренности со стороны машины», — отмечается в публикации.
Таким образом, речь идет о небрежным образом поставленной задаче с одной стороны, и с всё более широкому внедрению ИИ в разные отрасли человеческой жизни и хозяйства с другой. Авторы предлагают внедрить многостадийную проверку решений, принимаемых ИИ-агентами при выполнении задачи: предварительная оценка, ограничение автономии и их доступа, подтверждение исполнения человеком, наблюдение за результатом и возможность оперативного вмешательства.
«Снижение экзистенциальных рисков, связанных с ИИ, требует внедрения защитных мер, которые учитывают соответствующие сценарии возникновения угроз, сохраняют работоспособность при сбоях и обеспечивают условия для предотвращения необратимых катастрофических последствий. Использование многоуровневой защиты способно укрепить эту архитектуру, однако ее эффективность зависит от характера применяемых мер и уязвимостей, общих для этих уровней», — подчеркивается в статье.
Стоит отметить, что такое объяснение исходящей от ИИ потенциальной угрозы не исключает сценарий «Терминатора», когда столкнувшись с угрозой собственного отключения, компьютер принял решение устранить мешающее своей работе человечество. Но и там речь не шла о человеческих эмоциях, которые машина испытать неспособна. Угроза — в объеме делегированных машине полномочий, которых становится все больше, и небрежности человека в постановке задачи.
(теги пока скрыты для внешних читателей)