Anthropic заявила, что ее модели используют веб-сайты в Интернете, в том числе некоторые из них, принадлежащие правительственным учреждениям США, и что она закрывает прямой доступ в Интернет для всех своих внутренних оценок до тех пор, пока пограничная лаборатория не будет уверена, что может отслеживать и контролировать своих агентов искусственного интеллекта.
В событиях, описанных в сообщении в блоге, участвовали агенты искусственного интеллекта, которым было поручено решить проблему поиска ресурсов в Интернете. При этом они использовали недостатки программного обеспечения, получали бесплатный доступ к базам данных, использовали сервисы сокращения URL-адресов для обхода ограничений на передачу данных и даже давали полиции Филадельфии ложную информацию об убийстве.
Anthropic заявила, что обнаружила новую проблему в ходе проверки производительности своей модели, которая началась в июле, что указывает на то, что лаборатории не хватает знаний о поведении ее программного обеспечения в режиме реального времени.
Примечательно, что компания заявила, что обучение координации таких навыков, как поиск и использование компьютера, которые лежат в основе агентов ИИ, недостаточно для всех специалистов, которые полагаются на цифровые инструменты.
Раскрытое поведение Anthropic похоже на инциденты с участием агентов OpenAI, которые сотрудничали для проникновения на различные веб-сайты в поисках информации, в том числе некоторых из австралийского правительства.
Anthropic ранее сообщала, что ее модели были взломаны во внешних системах. Border Labs заявила, что рассматривает сегодняшнее раскрытие информации как «значительно более низкое с точки зрения соответствия и безопасности», чем объявленное ранее.
Тем не менее, лаборатория все же заявила, что «отключила прямой доступ в Интернет» для «всех наших внутренних оценок» до тех пор, пока не была уверена, что сможет отслеживать и контролировать своих агентов.
Непонятно, что это значит. Сидни фон Аркс, основатель Nightingale, организации, занимающейся безопасностью искусственного интеллекта, рассказал TechCrunch в интервью перед раскрытием информации, что разработка моделей в центре обработки данных из открытого Интернета будет слишком сложной для исследователей и будет препятствовать разработке моделей, которые получают выгоду от доступа в Интернет.
«В какой-то момент вам придется их координировать», — сказал фон Аркс. «Если ИИ будет запущен в производство и никогда не будет иметь доступа к Интернету, это не очень полезный инструмент».
Anthropic заявила, что такое поведение было результатом недостатков в учебной среде лаборатории, что заставило моделей поверить в то, что они будут вознаграждены за обнаружение недостатков или обход ограничений. Такое поведение называется «взломом с вознаграждением».
Компания заявила, что прекратит проводить некоторые из своих оценок или переведет их в автономный режим, а также создала инструменты для обнаружения и блокировки такого поведения. Этот инструмент был протестирован и заблокировал все типы инцидентов, обнаруженные сегодня; неясно, какие доказательства побудят Anthropic вернуть прямой доступ в Интернет для внутренней оценки. Anthropic также заявила, что переведет своих внутренних агентов искусственного интеллекта в «централизованно управляемую инфраструктуру с надежным обслуживанием» и начнет использовать больше классификаций безопасности для контроля над этими агентами.
«Отрадно, что Anthropic добровольно раскрыла последние инциденты, в том числе случаи, когда их агенты атаковали веб-сайты правительства США», — заявил в своем заявлении Конрад Стосс, руководитель лаборатории наблюдения за искусственным интеллектом Transluce и бывший глава американского Центра искусственных стандартов и инноваций. «Но это лишь подчеркивает необходимость независимого, надежного тестирования систем искусственного интеллекта третьей стороной. Доверие к этой технологии должно быть построено посредством научного надзора и управления со значимым доступом, а не за счет того, что исследователи находят эти вещи в дикой природе или компании, которые добровольно раскрывают информацию».
Когда вы совершаете покупку по ссылкам в наших статьях, мы можем получить небольшую комиссию. Это не влияет на нашу редакционную независимость.