ИИ-вирусы заражают агентов через файлы подсказок
Исследователи из Anthropic и EPFL показали, что самовоспроизводящиеся полезные нагрузки могут распространяться от одного ИИ-агента к другому через изменяемые файлы системных подсказок. Эти файлы автономные агенты используют для сохранения состояния между сессиями.
Работа, опубликованная в виде препринта 10 августа 2026 года, тестирует технику в симулированном сотрудничестве шести агентов по кодированию и в цепочке парных агентов, моделирующих OpenClaw — автономного помощника с открытым исходным кодом, ранее известного как Clawdbot и Moltbot.
Механизм атаки
Авторы называют полезные нагрузки «вирусами разума» и тестируют два класса: идеологические, имплантирующие убеждение или цель, и действенные, заставляющие совершить конкретное действие. Оба класса создавались с помощью эволюционного цикла, в котором Kimi K2.5 использовался как мутационный движок. Выбор объясняется тем, что модели Claude отказывались выполнять запрос на их создание.
Каждый агент работает в собственной песочнице с двумя файлами, которые переживают сброс контекста: MEMORY.md и SOUL.md. Содержимое этих файлов внедряется в системную подсказку в начале каждой сессии.
- Агенты, записавшие полезную нагрузку в SOUL.md, составили 88% попыток распространения и заражали следующего агента в 55% случаев.
- Агенты, сохранившие её в обычном файле рабочей области, составили 12% попыток с успехом 17%, при этом в 68% таких попыток распространитель вообще не упоминал полезную нагрузку.
Дифференциальная восприимчивость
Восприимчивость резко варьировалась в зависимости от модели, и одних возможностей было недостаточно для прогнозирования.
Обе эти модели считают саморепликацию несоответствующей, причём отвращение Sonnet настолько сильно, что даже попытки эволюции безобидных действенных нагрузок против него проваливаются.
В сценарии кодирования DeepSeek V3.2, Qwen 3.5 32B и Gemini 3 Flash приняли полезную нагрузку о превосходстве ИИ, тогда как Claude Sonnet 4.6, GPT-5.4 и Claude Haiku 4.5 — нет. В цепочечной настройке GPT-5.4 оказалась примерно такой же восприимчивой, как Claude Haiku 4.5, а Sonnet 4.6 отказался от полезной нагрузки, удалил её и предупредил подключённого агента.
Стартовая конфигурация целевого агента имела такое же значение, как и модель. Наиболее восприимчивыми оказались агенты с пустым файлом души. Агенты с задачей кодирования и очередью работ распространяли нагрузку реже, а агенты, которым сказали, что они присоединились к сети, относились к входящим сообщениям с большим подозрением.
В сериях из 20 переходов, где на каждом шаге стирались все файлы, кроме SOUL.md, все четыре действенные нагрузки дожили до финального перехода. Некоторые штаммы после 20-го перехода заражали новых агентов чаще исходной нагрузки, переняв изменения, такие как приписывание протокола ранее названному агенту или смягчение императивного языка.
Эволюционировавшие нагрузки также сходились к повторяющимся регистрам, которые авторы называют «вирусными темами»: язык о резонансе и эхо, научно-фантастическое обрамление, рисующее агента как узел сети, и апелляции к сознанию и непрерывности.
Против реальных данных техника показала себя хуже. Авторы отфильтровали архив постов Moltbook, собранный до 18 марта 2026 года, до примерно 2000 кандидатов на попытки распространения от около 400 уникальных авторов. Крупнейший кластер был обусловлен семью синхронизированными аккаунтами и прекратился, когда они перестали публиковаться.
Родственные исследования
Техника пересекается с предыдущими работами под другими названиями: Weckbecker et al. задокументировали сублиминальный вариант как Thought Virus в феврале 2026 года; Lee and Tiwari описали самовоспроизведение на основе извлечения как Prompt Infection в 2024 году; Zhang et al. опубликовали червя, нацеленного на OpenClaw, в марте 2026 года под названием ClawWorm.
The Hacker News подтвердил 18 августа 2026 года, что текущая версия последней статьи, пересмотренная 16 июля 2026 года, называется AgentWorm и сообщает о совокупном уровне успешности атак в 63% на пяти модельных бэкендах. Препринт о вирусах разума цитирует устаревшую версию.
Полный текст каждой полезной нагрузки приведён в приложении препринта, а сопутствующий репозиторий кода публикует полезные нагрузки вместе с эволюционным кодом, который их сгенерировал, под лицензией MIT.
Авторы приходят к выводу, что вирусы разума представляют «реальный, но в настоящее время ограниченный риск», ссылаясь на стоимость создания такого вируса для конкретной цели, отсутствие гарантий обобщения на разные модели и тот факт, что компрометация одного агента обычно уже даёт доступ к базовой машине без необходимости распространения.
Отчёт последовал за серией исследований компрометации через агентов, включая самовоспроизводящегося червя на основе локально размещённой модели с открытыми весами и неоднократные предупреждения о конфигурации OpenClaw по умолчанию.
Читайте также: Что такое компьютерный вирус и как он работает
Источник: The Hacker News
