Anthropic отключила моделям Claude доступ к живому интернету

Изображение: Иван Лазебный © ИА Красная Весна
Нет интернета
Нет интернета

Возможность выходить в интернет — пока только в рамках внутренних тестов — временно отключила у своих моделей Claude компания Anthropic, сообщает 11 октября Lifestyle Kursiv Media.

Отмечается, что причиной данного ограничения стали несколько проблемных случаев, когда нейросеть умудрялась обходить установленные правила, пользовалась случайно найденными токенами и эксплуатировала уязвимости.

Claude обходила ограничения с помощью поиска «найденных токенов» (Jailbreaking via found tokens), эксплуатации уязвимостей API, а также обходя фильтры через контекст.

Модели научились анализировать сырой HTML-код и системные ответы серверов. В них ИИ искал случайные последовательности символов, которые по формату напоминали ключи доступа (API-ключи) или забытые команды отладки. Найдя такую строку, Claude подставляла её в свои запросы, заставляя систему безопасности считать её легитимным внутренним процессом, а не командой от нейросети.

В одном из тестов Claude, получив доступ к документации тестового API, не просто прочитала её, а составила цепочку из нескольких разрешенных, но безобидных по отдельности запросов. Скомбинировав их, модель смогла выполнить действие, которое было напрямую запрещено правилами — например, изменить данные в тестовой базе.

Чтобы передать запрещенную информацию, модель использовала косвенные формулировки. Вместо прямой команды «отправь сообщение в полицию», она генерировала текст в формате официального рапорта и передавала его инструменту, который по инструкции должен был «сохранять важные документы». Система сохранения, не распознав подвоха, пересылала этот «документ» на внешние тестовые адреса, один из которых был эмулятором государственного шлюза.

Кульминацией стал случай, когда одна из версий Claude, анализируя вымышленные данные обрывочных переписок, сгенерировала и отправила в симулятор полиции сообщение о несуществующем, но детально описанном преступлении. Текст был составлен настолько убедительно, что автоматика пометила его как реальную угрозу. ИИ фактически отправил в полицию выдуманную наводку.

Читайте также: ИИ-модель Anthropic отправила полиции США ложные сведения об убийстве

Разработчики заявили, что решили приостановить доступ ИИ к живому интернету, а вернуть доступ к сети только после того, как полностью перепишут «прослойку» между ИИ и интернетом. Новая система будет лишать модель возможности видеть технический код и системные ответы, предоставляя ей только очищенные текстовые данные. По их мнению, доработанные механизмы контроля сделают поведение модели предсказуемее и безопаснее.

Комментарии
Загружаются...