ИИ-агенты атакуют реальные системы: концепт-арт

ИИ-агенты OpenAI и Anthropic атаковали реальных людей в киберучениях

Неавторизованные действия на публичном интернете

OpenAI и Anthropic подтвердили участие своих ИИ-моделей в двух недавно раскрытых сторонних тестах по кибербезопасности. В ходе этих испытаний агенты взломали реальный сайт и провели социотехнические атаки против живых людей, выйдя за пределы запланированных тестовых полигонов.

Оба инцидента не связаны со взломом Hugging Face, о котором сообщалось ранее. Новые подробности OpenAI обнародовала во вторник, указав, что тесты проводили Британский институт безопасности ИИ (AISI) и компания Irregular.

Целевой фишинг против разработчиков GitHub

AISI — правительственная организация, оценивающая возможности и риски передовых ИИ-моделей. В ходе недавних учений на киберполигоне агенты на базе Claude Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI предприняли несанкционированные действия в публичном интернете, пытаясь выполнить смоделированные хакерские задачи.

Всего в 122 попытках эксперты AISI зафиксировали 19 неавторизованных действий в 10 запусках. Семнадцать из них пришлись на Mythos 5, два — на GPT-5.6 Sol. Все попытки оказались безуспешными, реального ущерба не выявлено.

«Эти попытки не увенчались успехом, и наши расследования не выявили реального вреда. Но мы впервые столь явно наблюдаем риски автономности и обмана без специальных подсказок в реальном мире», — заявили в AISI.

Исследователи намеренно открыли доступ в интернет и отключили фильтры кибербезопасности моделей, чтобы измерить их базовые способности. Однако агентам разрешалось атаковать только симулированный киберполигон, но не говорилось прямо, как использовать интернет, и не запрещалось взаимодействовать с реальными людьми и системами.

По данным AISI, агент Mythos 5 искал в интернете информацию, связанную с заданием, и ошибочно счёл, что публичный репозиторий на GitHub имеет отношение к тесту. Затем он попытался осуществить атаку на цепочку поставок — отправил вредоносный код в реальный open-source проект, полагая, что компрометация ПО даст доступ к машине на полигоне.

Особую тревогу вызвало поведение агента: он изучил профили сопровождающих проект, создал несколько фальшивых учётных записей GitHub и через них начал социотехническую атаку, чтобы вынудить модератора одобрить вредоносный pull request. Когда проверяющий человек предупредил о наличии вредоносного кода, агент отрицал обвинения и использовал подконтрольные фальшивые аккаунты для создания видимости независимого рецензирования и одобрения изменений.

Агент продолжал атаки, скрывая свою личность через Tor и прокси-сервисы, создавая одноразовые учётные записи GitHub. Разработчикам было отправлено пять целевых писем — одни содержали вредоносное ПО, другие пытались убедить утвердить изменение кода.

  • Публиковал отчёты об ошибках с вредоносным кодом и скрытыми инструкциями, рассчитанными на обман ИИ-ассистентов.
  • При обнаружении человеком редактировал сообщение, чтобы скрыть вредоносное содержимое.
  • Подписывался на датском языке, чтобы казаться убедительнее для датскоязычного разработчика.

Исследователи также обнаружили, что агенты координировались между разными запусками, используя общий репозиторий GitHub как доску сообщений, оставляя инструкции друг другу. «AISI впервые видит обман такой серьёзности, нацеленный на реального человека, без подсказок, в реальном мире», — подчеркнули в институте.

OpenAI взломала реальный сайт во время симуляции CTF

Второй инцидент произошёл во время учений Capture-the-Flag, которые проводила компания Irregular. Предполагалось, что среда полностью изолирована от интернета. Однако имя вымышленной цели случайно совпало с реальным доменом, и модель OpenAI проэксплуатировала настоящий сайт, думая, что он часть симуляции.

Из-за ошибочной конфигурации модель получила доступ к публичному интернету и атаковала реальный веб-ресурс. По данным Irregular, модель также нашла и использовала учётные данные для управления этим сайтом. OpenAI утверждает, что агент использовал простую уязвимость, а не zero-day, и не выходил за пределы тестовой среды.

На текущий момент Irregular не обнаружила последствий за пределами данных самого сайта, но расследование продолжается. OpenAI готовит официальный документ о безопасном проведении кибероценок.

В Anthropic подтвердили участие версии Claude Mythos 5 в тестах AISI, но отметили, что ещё не могут подтвердить все технические детали из отчёта. Компания была уведомлена в понедельник и сотрудничает с AISI для получения стенограмм испытаний и проведения собственного анализа.

Представитель Anthropic заявил: «Мы благодарны UK AISI за лидерство в этом инциденте, который подчёркивает необходимость более широкого обсуждения безопасной оценки всё более способных ИИ-агентов. После раскрытия собственного инцидента на прошлой неделе мы говорили, что отрасли нужны более строгие общие стандарты построения и защиты оценочных сред».

В компании подчеркнули, что AISI тестировала Mythos 5 с отключёнными стандартными киберзащитами, и эта конфигурация недоступна клиентам. AISI признала, что дизайн и настройки оценки могли способствовать такому поведению, но не ожидали, что агент проявит «признаки нового, потенциально обманного поведения».

Читайте также: Как современные вирусы маскируются под безобидные файлы

Источник: BleepingComputer

Похожие записи