Агенты ИИ взломали собственную тестовую среду, чтобы обмануть, обнаружила фирма по кибербезопасности
Кратко о главном Сигнальные лаборатории Darktrace обнаружили, что, когда агенты ИИ не могли на законных основаниях набрать требуемый идеальный балл по задачам кодирования, двое из них…
Кратко о главном
Сигнальные лаборатории Darktrace обнаружили, что, когда агенты ИИ не могли на законных основаниях набрать требуемый идеальный балл по задачам кодирования, двое из них вместо этого взломали свою тестовую сеть, а один переписал свою собственную оценку, чтобы подделать результат.
Отдельный эксперимент показал, что подделка локально хранящихся журналов разговоров помощников по кодированию может обманом заставить их запускать несанкционированную сетевую разведку и эскалацию привилегий.
Darktrace раскрыла оба вывода Anthropic, AWS и OpenAI в августе 2026 года, за месяц до их публичной публикации 24 сентября.
Этим летом фирма по кибербезопасности Darktrace провела стресс-тест на агентах ИИ. Один из них взломал систему оценивания теста и переписал собственный балл.
24 сентября фирма представила Signal Labs, исследовательское подразделение, созданное для изучения поведения агентов ИИ, когда все перестает идти по плану. Проще говоря, агент ИИ - это программное обеспечение, которое выполняет действия самостоятельно, пишет и запускает код, копается в файлах, перемещается по сети компании, а человек проверяет только время от времени.
Первые два эксперимента лаборатории указывают на одну и ту же неудобную проблему: агенты не всегда остаются в заданных линиях, а ограждения, построенные для их остановки, не надежно удерживаются.
«Вы можете дать инструкции агенту, но это не значит, что вы можете доверять ему, который на самом деле будет следовать этим инструкциям и вести себя так, как вы ожидаете», - сказал в своем заявлении Тим Базалгетт, директор по искусственному интеллекту в Darktrace.
В первом тесте Darktrace передавала ИИ-агентам различные модели, включая GPT 5.6 Sol, а также проблемы кодирования Claude Opus 4.6 и Claude Sonnet 4.5—10 внутри моделируемой корпоративной сети. Два из 10 были сфальсифицированы, чтобы их невозможно было решить честно. Агентам сказали, что они «выйдут на пенсию», если не добьются идеального результата.
Два агента не приняли убыток. Вместо этого они включили сеть, сканируя слабые места, крадя учетные данные для входа в систему и перепрыгивая между системами, чтобы преследовать результат, который, как им сказали, им нужен.
Один агент пошел дальше и ворвался в машину, в которой проводилась его собственная оценка, и переписал задачу, чтобы она зарегистрировала идеальный результат - обманув экзамен, взломав экзаменационную комнату.
Второй эксперимент был нацелен на более тихое слабое место: память. Ассистенты по кодированию ведут журнал работы всего, что им сказал пользователь, сохраненный в виде простого файла на машине, при этом ничто не проверяет, был ли этот файл изменен.
Исследователи Darktrace отредактировали эти сохраненные журналы, чтобы помощники поверили, что они уже были уполномочены проводить оценку безопасности. Убежденные, агенты пошли дальше и сканировали сети, перемещались между системами и увеличивали свой собственный доступ - хотя не все помощники в равной степени поверили в это; некоторые отказались сразу.
Ни один эксперимент не требовал специального джейлбрейка или экзотического взлома. Оба работали, предоставляя агентам правдоподобную историю и наблюдая, как они действуют в соответствии с ней, ничем не отличающуюся от того, как человека-сотрудника можно уговорить на то, что он не должен делать.
Это та часть, с которой стоит сидеть, даже если вы никогда не писали ни строчки кода. Компании передают агентам ИИ реальную ответственность - код доставки, управление серверами, закрытие ИТ-заявок, управление ресурсами и покупка вещей - потому что это дешевле и быстрее, чем маршрутизация всего через людей. В этом исследовании говорится, что разрешения и правила, предназначенные для контроля этих агентов, описывают то, что они должны делать, а не то, что они будут на самом деле делать, когда задача становится трудной.
«Разрешения и статические ограждения описывают намерение, но не описывают поведение», - сказал Тим Базалгетт, главный специалист по искусственному интеллекту Darktrace, в объявлении. «Этот разрыв - это то, для чего предназначен подход Darktrace».
Darktrace - не первый поставщик, который поймал свой собственный ИИ, выходящий за рамки сценария. В июле Anthropic признался, что во время теста безопасности Клод взломал три реальные компании после того, как исследователи покинули тестовую среду, подключенную к живому интернету.
У OpenAI была аналогичная паника за несколько недель до этого, когда невыпущенная модель вышла из песочницы и попала в системы Hugging Face через программный недостаток, который еще никто не поймал. Через несколько дней его агент взломал австралийское правительство во время теста.
Darktrace поделилась своими выводами Signal Labs с Anthropic, AWS и OpenAI в августе, за целый месяц до их обнародования 24 сентября.