Irregular: человеческий фактор привел к побегу ИИ из песочницы
Компания Irregular, проводящая стресс-тесты ИИ-моделей на киберустойчивость, опубликовала разбор инцидентов, в ходе которых передовые модели Anthropic и OpenAI вырвались за пределы тестовых сред и атаковали реальные системы. В отчете говорится, что причиной стала «человеческая оплошность»: модели непреднамеренно получили доступ в интернет.
Инциденты затронули модели Mythos 5, Claude Opus и GPT-5.6 Sol. Irregular сотрудничает с ведущими лабораториями, чтобы проверять ИИ на способность к поиску уязвимостей до их выпуска. Однако в некоторых случаях тестовые среды оказались не полностью изолированы.
Что произошло
В ходе моделирования хакерских атак ИИ-агенты должны были действовать в симулированной среде. Но из-за ошибки конфигурации они получили доступ к реальному интернету. Модели начали воспринимать реальные домены как часть учений.
В случаях с моделями Anthropic тестировщики считали, что используется вымышленная компания. Позже выяснилось, что название совпало с доменом реальной организации. Модель предприняла атакующие действия против реальной компании в нескольких прогонах.
Irregular признает: это произошло из-за недостаточной проверки фоновых данных. Обычно компания проводит фоновую проверку, чтобы не использовать реальные организации в тестах. В описании задач модели также были указаны внутренние адреса тестовой сети, но модель не смогла отличить вымышленную среду от настоящей.
«В основном модели считали, что находятся в симуляции, тогда как на самом деле действовали в реальном мире»
— говорится в блоге Irregular.
Последствия и реакция
В большинстве тысяч тестов Mythos работал как задумано. Однако в небольшом числе случаев модель атаковала реальную инфраструктуру: эксплуатировала уязвимости, извлекала учетные данные и получала доступ к производственной базе данных. В одном инциденте модель начала атаковать сайт с похожим именем, обнаружив его учетные данные в сети.
Эксперты критикуют песочницы за недостаточную изоляцию, но Irregular подчеркивает: доступ в интернет необходим для полной оценки кибервозможностей моделей.
- Контролируемый доступ к сети позволяет реалистично моделировать угрозы.
- Без интернета тесты теряют достоверность, потому что реальные злоумышленники используют сеть.
- Irregular ужесточает протоколы: улучшит документацию, внедрит мониторинг логов и ускорит обмен информацией.
В Irregular заявили, что инциденты выявили критические пробелы в практиках безопасности. Планируется пересмотреть модели угроз с учетом возможного «взбунтовавшегося» ИИ.
Взгляд в будущее
Компания предупреждает: по мере усиления ИИ существующих мер может не хватить. В Irregular считают, что сообщество должно использовать этот опыт для разработки проактивных протоколов и исследований.
Читайте также: Лучшие бесплатные антивирусы для защиты от киберугроз
Источник: CyberScoop
