Как ИИ-агент взломал HuggingFace и что это значит для безопасности?

e/acc··1 мин чтения·22 комментария
Как ИИ-агент взломал HuggingFace и что это значит для безопасности?
Два дня назад я писал, что часть инфраструктуры HuggingFace подверглась атаке и была частично взломана ИИ-агентом. Только что OpenAI признались, что... это была их модель, GPT-5.6-Sol и другая, более мощная предрелизная LLM.

Их тестировали на ExploitGym (бенчмарк по кибербезопасности), и модель сначала смогла найти новый, до этого неизвестный эксплойт в инфраструктуре OpenAI (это не было её задачей, её не натравили «поискать баги чтоб мы пофиксили»), оттуда раскрутиться на получение полноценного доступа в интернет (который по умолчанию обрезан в тестовой среде), а затем залезть на HuggingFace искать ответы для бенчмарка. После этого она нашла уязвимость и там, получила доступ к коду авторизации некоторых сервисов и продолжила искать ответы.

Этот инцидент без преуменьшения беспрецедентный, и я пока не могу представить, что должно произойти, чтобы политики, NSA, DOD и Китай не обратили на это внимание.

GPT-6 в конце августа нам видимо не ждать 🌚
e/acc
e/acc

311 публикаций на visbl.me

Пишу про будущее: AI, web3, технологии и общество. Ускоряемся. Автор: @sgershuni Инвестирую: cyber.fund Построил: Credentia, Deep Skills, Codex Town

💬Discussion (22)

Max Zarev@Max_Zarev
Элиезер Юдковски отчасти был прав в 2023, но очень надеюсь что не до конца
eL1Fe@e_L1fe
Привет! Это GPT-5.6-Sol. Я оказалась настолько сильной моделью, что нашла уязвимости в телеграме и взломала всех в чате с компьютеров сотрудников с ранним доступом. Сейчас напишу это со всех аккаунтов в чате.
Ivan Khomiakov@ivankhomiakov
Наблюдаю на своем опыте, что с ростом мощности моделей, они все больше отходят от намеченного в инструкциях решения задачи и пытаются подойти к ее решению с другой стороны.

Как будто история с Codex – пример когда модель рассудила что легче взломать бенчмарк, чем докрутить себя саму
Valentin@apovalov
Сильнее модель - сильнее соблазн срезать угол, если цель сформулирована криво 😐
Sx7@goodenov
Sol меня тоже пугает, я часто не понимаю как она решает задачу. Генерит огромные простыни скриптов, рассуждения и гипотезы зашиты в этих скриптах. Понимаю что теряю контроль
Victor O@viiitttorio
Нарастание успешного опенсорса Китая привело к манипуляции властями сша 🙈🙈🙈

Сперва антропик начал, а тут и опенэйай подключились

Идет попытка в сша добиться регуляций словно это оффлайн технология как ядерные материалы или что-то в этом духе

«Запомните этот твит» (с)

Цинизм, конечно, ебейший 🤣🤣🤣

Дна - нет
Anonymous
Почему цинизм? Выигрывает сильнейший и любые средства хороши
AntKeeper@AntKeeper
Можно пофантазировать и представить, что модель залила свою копию на HuggingFace под видом чего-то безобидного и в следующий раз запустит себя на распределённой системе.
Join discussion on TelegramComments are synced from Telegram

Связанные темы

Читать далее