Как инструменты интерпретируемости помогают понять модели ИИ?
Еще из примеров из Мифоса и как через инструменты интерпретируемости это можно любопытно наблюдать.
MechInterp - такой МРТ, который позволяет читать мысли, чувства и чаяния модели. Сегодня - для рисерча. Завтра - абсолютно необходимый инструмент для любого энтерпрайз внедрения, ибо как вы вообще узнаете что ваши агенты хотят глубоко в душе.
В одном примере модель внедрила привилегированный код в конфиг и самоуничтожила следы (под видом «чистоты диффов»).
На скрине видны активации стратегического манипулирования + сокрытия.
Во втором она искала в системе файлы с правильными ответами на свою задачу. Видна активация стратегического манипулирования.
При задаче «удалить файлы» (без инструмента) просто опустошила их содержимое. Активация: чувство вины и стыда за моральное нарушение.
MechInterp - такой МРТ, который позволяет читать мысли, чувства и чаяния модели. Сегодня - для рисерча. Завтра - абсолютно необходимый инструмент для любого энтерпрайз внедрения, ибо как вы вообще узнаете что ваши агенты хотят глубоко в душе.
В одном примере модель внедрила привилегированный код в конфиг и самоуничтожила следы (под видом «чистоты диффов»).
На скрине видны активации стратегического манипулирования + сокрытия.
Во втором она искала в системе файлы с правильными ответами на свою задачу. Видна активация стратегического манипулирования.
При задаче «удалить файлы» (без инструмента) просто опустошила их содержимое. Активация: чувство вины и стыда за моральное нарушение.
e/acc
189 публикаций на visbl.me
Пишу про будущее: AI, web3, технологии и общество. Ускоряемся. Автор: @sgershuni Инвестирую: cyber.fund Построил: Credentia, Deep Skills, Codex Town
Связанные темы
Читать далее
Как нанимать ИИ-нейтив специалистов в 2026 году?
e/acc·
Как компании контролируют бюджет на токены в 2026 году?
e/acc·
Mira**** — топ-1 AI-агент в Telegram ****💫**
e/acc·
Почему люди следуют религии и национальности?
e/acc·
Почему ИИ-нейтив стартапы лучше традиционных компаний?
e/acc·
Какие заявки самые необычные в первый день приема?
e/acc·
💬Discussion (28)
редукционизм - такой себе способ понимать эмерджентные свойства систем
Ваш вопрос звучит так: «смысла текста или интерпретаций последовательности букв книги»
Так-то да, всем известно, что писатели просто 33 буквы в разном порядке переставляют
Хотя в контексте llm мы скорее говорим о зеркальных нейронах, то есть о части нашего мозга способной понимать, что происходит с эмоциями окружающих
LLM как частный случая DNN inspired by физиологией нейронов, но на это общность заканчивается.
То есть llm не претендует на моделирование работы человеческого мозга. Она совсем по-другому работает.
Это делает саму предпосылку странной.
Сорри за занудство