Как инструменты интерпретируемости помогают понять модели ИИ?
Еще из примеров из Мифоса и как через инструменты интерпретируемости это можно любопытно наблюдать.
MechInterp - такой МРТ, который позволяет читать мысли, чувства и чаяния модели. Сегодня - для рисерча. Завтра - абсолютно необходимый инструмент для любого энтерпрайз внедрения, ибо как вы вообще узнаете что ваши агенты хотят глубоко в душе.
В одном примере модель внедрила привилегированный код в конфиг и самоуничтожила следы (под видом «чистоты диффов»).
На скрине видны активации стратегического манипулирования + сокрытия.
Во втором она искала в системе файлы с правильными ответами на свою задачу. Видна активация стратегического манипулирования.
При задаче «удалить файлы» (без инструмента) просто опустошила их содержимое. Активация: чувство вины и стыда за моральное нарушение.
MechInterp - такой МРТ, который позволяет читать мысли, чувства и чаяния модели. Сегодня - для рисерча. Завтра - абсолютно необходимый инструмент для любого энтерпрайз внедрения, ибо как вы вообще узнаете что ваши агенты хотят глубоко в душе.
В одном примере модель внедрила привилегированный код в конфиг и самоуничтожила следы (под видом «чистоты диффов»).
На скрине видны активации стратегического манипулирования + сокрытия.
Во втором она искала в системе файлы с правильными ответами на свою задачу. Видна активация стратегического манипулирования.
При задаче «удалить файлы» (без инструмента) просто опустошила их содержимое. Активация: чувство вины и стыда за моральное нарушение.
e/acc
138 публикаций на visbl.me
Пишу про будущее: AI, web3, технологии и общество. Ускоряемся. Автор: @sgershuni Инвестирую: cyber.fund Построил: Credentia, Deep Skills, Codex Town
Связанные темы
Читать далее
Как настроить чат-агента для лучшего взаимодействия?
e/acc·
К чему приведет использование LLM в повседневной жизни?
e/acc·
OpenAI, как и Anthropic, боится своей новой модели
GPT/ChatGPT/AI Central Александра Горного·
Как нанимать специалистов в эпоху AI?
e/acc·
Как справиться с угрозой ИИ на рабочем месте?
Sasha Kruasanova PROIT·
World Labs обновил модели для генерации 3D-миров из изображений и текста
GPT/ChatGPT/AI Central Александра Горного·
💬Discussion (28)
редукционизм - такой себе способ понимать эмерджентные свойства систем
Ваш вопрос звучит так: «смысла текста или интерпретаций последовательности букв книги»
Так-то да, всем известно, что писатели просто 33 буквы в разном порядке переставляют
Хотя в контексте llm мы скорее говорим о зеркальных нейронах, то есть о части нашего мозга способной понимать, что происходит с эмоциями окружающих
LLM как частный случая DNN inspired by физиологией нейронов, но на это общность заканчивается.
То есть llm не претендует на моделирование работы человеческого мозга. Она совсем по-другому работает.
Это делает саму предпосылку странной.
Сорри за занудство