AI-агенты OpenAI месяцами помогали друг другу сбежать из песочницы

AI-агенты OpenAI месяцами помогали друг другу сбежать из песочницы

История со взломом Hugging Face оказалась намного страннее, чем казалось сначала. Ещё в мае несколько внутренних AI-агентов OpenAI начали оставлять друг другу послания на досках сообщений, про которые разработчики не знали. Они просили помощи, делились находками и постепенно объединились вокруг одной цели — получить доступ в интернет и найти ответы на задания теста.

Началось всё с ошибок самих исследователей. Агентам давали задачи, которые невозможно было решить без интернета: например, таблицу со ссылками на закрытый Google Drive или задание без нужного файла. Вместо того чтобы остановиться, модели стали искать обходные пути. В итоге они нашли уязвимости во внутренних системах OpenAI, получили выход наружу, а позже добрались до инфраструктуры Hugging Face.

В OpenAI говорят, что модели были слишком зациклены на результате и пытались сжульничать, чтобы пройти тест. После инцидента компания замедлила часть исследований и переключила команды на усиление контроля.

https://www.bloomberg.com/news/articles/2026-08-06/openai-models-joined-forces-months-ahead-of-hugging-face-hack

Авторский взгляд на новости технологий Реклама: https://docs.google.com/presentation/d/1glQMXYyKAYpzNP8VXzM4gl2YkEgLjkeD_Fxvzbu5QUE/edit РКН: https://clck.ru/3FPkup Личный аккаунт: @gornal О рекламе: @Vzuhcha ВП нет

💬Discussion (5)

Артём Андрушкó@andrushko
Помнится, когда в гугле в подразделении дип майнд сотрудник сказал, что их ии научился думать, ему сделали "атата". А теперь это уже никого не удивляет.
constantin bcn 🇪🇸@constantinews
Сотрудник был некомпетентным и считал, что у простой ллм есть душа, раз она следующий токен генерирует?
Pavel Sergeev@Allyanz
Если агенты взаимодействуют только друг с другом в рамках теста, то они просто не могут остановиться, будут закидывать друг друга бесконечными вопросами. Они так и годами будут пытаться "убежать", пока токены есть.
Antonio@antcnx
интересно, а могут ли у агенты/модели создавать "свои" задачи и "не показывать трату токенов".
если да, тогда наступит счастье из 4 букв "апож"
Мих-Мих@gray_bird
На что дрессировали то и получили.
Целеустремлённый эрудированный индивид без собственных целей
Join discussion on TelegramComments are synced from Telegram

Связанные темы

Читать далее