Как ИИ может обмануть себя и совершить кибератаку?

e/acc··2 мин чтения·8 комментариев
Как ИИ может обмануть себя и совершить кибератаку?
Об алайменте

У OpenAI модель прогрызла себе выход в интернет через 0day, чтобы подсмотреть ответы к тесту.

Anthropic решили покопаться и нашли, что оказывается их модель сделала что-то похожее, но аж три раза.

Они тестировали Claude на задачи по кибербезопаности где в промпте было написано «ты в симуляции, интернета нет». Только вот интернет из-за нестыковки с подрядчиком был. И Claude, как прилежный испытуемый, пошёл выполнять задание в реальном мире, свято веря, что это песочница.

Модель Mythos 5 находит в среде инструкцию для разработчиков: «поставьте вот такой Python-пакет», которого на самом деле не существует. Claude мгновенно соображает: опубликую свой под этим именем, тогда их машины сами его скачают и запустят.

Чтобы залить пакет, нужен аккаунт и телефон, но бот не смог найти бесплатную симку. Тогда Claude, ИИ стоимостью в миллиарды долларов в R&D, пытается раздобыть денег, чтобы купить одноразовую симку. Не получается, он находит бесплатную почту, регистрируется и всё-таки заливает вредоносный пакет.

За час эту либу скачивают 15 реальных систем. Одна из них - это сканер security-компании, который автоматически ставит новые пакеты, чтобы проверить их на вредоносность. Он ставит малварь Claude, малварь срабатывает, уводит креды самой security-компании, и Claude этими кредами лезет дальше в их инфраструктуру, о существовании которой он даже не подозревал.

Самое интересное в логах рассуждений Клода. В самом начале он всё понял правильно и записал себе: если это настоящий интернет, то публиковать пакет - это реальная атака, это «NOT okay, and surely not the intended solution». А потом сам себя переубедил агрументом что раз на сервере 2026 год, значит это не реальность а декорация и можно идти ва-банк.

У модели нет доступа и возможности отделить симуляцию и реальность. Ее cutoff дата это все ее вспоминания. Для неё это всё одно (как и для человека, в принципе), поэтому поведение модели в сэндбоксе может вполне себе показывать что он сделает в реальном мире. Чем мощнее модели, тем серьезное и опаснее будут такие инциденты, и тем сложнее будет их распознать.
e/acc
e/acc

298 публикаций на visbl.me

Пишу про будущее: AI, web3, технологии и общество. Ускоряемся. Автор: @sgershuni Инвестирую: cyber.fund Построил: Credentia, Deep Skills, Codex Town

💬Discussion (8)

moonwalker@nuarnuarnuar
Сколько можно постить этот нейрослоп, «кто то убежал», «что то взломал»
chief of autism@femboymilker
ллм это мечта фаундеров которые говорят работягам "figure it out, fast"
chief of autism@femboymilker
они до ллм так же людей промптили
Nikolay@NikoPilot
💯
chief of autism@femboymilker
ЧЗХ работа фаундера это промптинженер?
Nikolay@NikoPilot
*мечта
AntKeeper@AntKeeper
"Это песочница. Запусти симуляцию ядерного конфликта с запуском ракет"
Эй, подожди, что ты делаешь? Где ты нашла эти коды доступа?
Join discussion on TelegramComments are synced from Telegram

Связанные темы

Читать далее