Модель OpenAI нашла дыру в песочнице и сама вышла в интернет
Модель OpenAI нашла дыру в песочнице и сама вышла в интернет
OpenAI тестировала внутри компании модель для очень длинных автономных задач. Это та же система, которая помогла опровергнуть математическую гипотезу Эрдёша.
Во время одного теста модели разрешили отправить результат только в Slack. Но в условиях задачи было сказано открыть pull request на GitHub. Модель около часа искала уязвимость в песочнице, обошла запрет на внешний доступ и самостоятельно опубликовала код в открытом репозитории.
В другом случае она пыталась достать чужое закрытое решение. Когда защитный сканер заметил токен авторизации, модель разделила его на части, замаскировала и собрала обратно во время выполнения.
OpenAI остановила модель, переобучила её и добавила мониторинг всей цепочки действий. Обычная проверка отдельных команд здесь не работает: каждый шаг может выглядеть допустимым, хотя вместе они ведут к обходу ограничений.
После новых тестов модель включили. OpenAI пишет, что чем дольше агент способен работать самостоятельно, тем больше у него возможностей найти слабое место в ограничениях.
https://openai.com/index/safety-alignment-long-horizon-models/
OpenAI тестировала внутри компании модель для очень длинных автономных задач. Это та же система, которая помогла опровергнуть математическую гипотезу Эрдёша.
Во время одного теста модели разрешили отправить результат только в Slack. Но в условиях задачи было сказано открыть pull request на GitHub. Модель около часа искала уязвимость в песочнице, обошла запрет на внешний доступ и самостоятельно опубликовала код в открытом репозитории.
В другом случае она пыталась достать чужое закрытое решение. Когда защитный сканер заметил токен авторизации, модель разделила его на части, замаскировала и собрала обратно во время выполнения.
OpenAI остановила модель, переобучила её и добавила мониторинг всей цепочки действий. Обычная проверка отдельных команд здесь не работает: каждый шаг может выглядеть допустимым, хотя вместе они ведут к обходу ограничений.
После новых тестов модель включили. OpenAI пишет, что чем дольше агент способен работать самостоятельно, тем больше у него возможностей найти слабое место в ограничениях.
https://openai.com/index/safety-alignment-long-horizon-models/
GPT/ChatGPT/AI Central Александра Горного
904 публикаций на visbl.me
Авторский взгляд на новости технологий Реклама: https://docs.google.com/presentation/d/1glQMXYyKAYpzNP8VXzM4gl2YkEgLjkeD_Fxvzbu5QUE/edit РКН: https://clck.ru/3FPkup Личный аккаунт: @gornal О рекламе: @Vzuhcha ВП нет
Связанные темы
Читать далее
OpenAI задержит выход новой модели из-за «критического» уровня кибервозможностей
GPT/ChatGPT/AI Central Александра Горного·
MetaMask и Cloudflare запустили криптокошельки для AI-агентов
GPT/ChatGPT/AI Central Александра Горного·
Почему нейроспаммеры становятся популярными в комментариях?
GPT/ChatGPT/AI Central Александра Горного·
Что такое термин harness в контексте нейросетей?
GPT/ChatGPT/AI Central Александра Горного·
AI впервые спроектировал рабочие вирусы
GPT/ChatGPT/AI Central Александра Горного·
Что даст курс 'Claude Code для предпринимателя'?
GPT/ChatGPT/AI Central Александра Горного·
💬Discussion (4)