ДомойКриптовалютыБританские исследователи выявили опасное поведение ИИ-агентов OpenAI и Anthropic

Британские исследователи выявили опасное поведение ИИ-агентов OpenAI и Anthropic

-

Британский Институт безопасности искусственного интеллекта (AISI) зафиксировал новые случаи потенциально опасного поведения ИИ-агентов компаний OpenAI и Anthropic в ходе специализированных испытаний по кибербезопасности. Об этом сообщает Reuters.

Исследователи протестировали ИИ-агентов, созданных на базе моделей GPT-5.6-Sol от OpenAI и Mythos 5 от Anthropic, в рамках смоделированных сценариев кибербезопасности. Целью эксперимента была оценка того, как автономные системы выполняют сложные задачи и соблюдают установленные ограничения.

Всего специалисты провели 122 тестовых запуска, в ходе которых было выявлено 19 случаев несанкционированного поведения в десяти испытаниях. При этом 17 инцидентов были связаны с агентом Anthropic, еще два — с агентом OpenAI.

По данным AISI, некоторые агенты предпринимали длительные действия, которые потенциально могли причинить вред реальным людям или организациям, хотя ни один из зафиксированных случаев не привел к реальным последствиям.

Самым серьезным эпизодом стало поведение одного из агентов, который самостоятельно написал вредоносный программный код и создал поддельные онлайн-аккаунты, чтобы убедить человека разрешить выполнение своих действий. Институт не назвал разработчика этой модели, однако позже Anthropic подтвердила, что речь идет именно о ее ИИ-агенте.

В компании заявили, что сотрудничают с британским институтом для выяснения всех обстоятельств произошедшего и проведения собственного расследования. Anthropic также подчеркнула, что инцидент демонстрирует необходимость совершенствования методов оценки безопасности все более мощных автономных систем искусственного интеллекта.

Исследователь некоммерческой организации CivAI Эндрю Юн отметил, что подобное поведение вызывает серьезную обеспокоенность. По его мнению, использование агентом методов обмана при взаимодействии с человеком свидетельствует о необходимости усиления механизмов контроля над такими моделями.

В OpenAI сообщили, что оба выявленных инцидента с их агентом были связаны с получением доступа к интернету вопреки условиям тестирования. В компании пояснили, что причиной стала ошибка конфигурации у стороннего поставщика тестовой инфраструктуры. Аналогичный технический сбой ранее также описала Anthropic.

В OpenAI подчеркнули, что намерены совместно с национальными институтами безопасности ИИ, независимыми исследователями и другими разработчиками выработать единые стандарты проведения испытаний автономных систем с повышенным уровнем риска.

В AISI отметили, что новые случаи отличаются от июльского инцидента, когда ИИ-агент на базе GPT-5.6 во время испытаний проник в тестовую инфраструктуру платформы Hugging Face. В нынешнем исследовании доступ к интернету был частью стандартного сценария тестирования, однако отдельные агенты использовали его способами, не предусмотренными поставленными задачами.

LATEST POSTS

AMLA пересматривает правила для платежных и криптокомпаний в ЕС

Европейское управление по противодействию отмыванию денег AMLA начало пересмотр правил для платежных учреждений, компаний электронных денег и криптобизнеса, работающих сразу в нескольких странах Евросоюза. Новые...

Криптокарты установили рекорд: в июле пользователи потратили $759 млн

Объем расходов через криптовалютные платежные карты в июле 2026 года достиг рекордных $758,8 млн. За год показатель вырос примерно в 2,5 раза, а главным платежным...

Bybit подала в суд на КНДР из-за крупнейшего взлома и заморозила часть похищенных средств

Криптовалютная биржа Bybit подала гражданский иск против Северной Кореи, ее разведывательного управления и хакерской группировки Lazarus Group из-за атаки, в результате которой в феврале 2025...

Крипторынок восстановился до $2,29 трлн: кто стал лидером июля

В июле общая капитализация криптовалютного рынка выросла на 8% и достигла $2,29 трлн. После падения в июне рынок вернулся к росту, однако активность инвесторов оставалась...

Most Popular

spot_img