Канонический базис: как повернуть LLM, чтобы заглянуть ей внутрь

· Искусственный интеллект
Исследователь предложил обратимое преобразование координат трансформера, которое не меняет его поведения, но делает каждую скрытую ось измеримой и управляемой по отдельности.

cover.svg

Скрытое состояние трансформера — это вектор в пространстве из сотен измерений, но система координат, в которой он живёт, произвольна: она такая, какой её оставило обучение. По отдельности ни одно измерение ничего не значит, и сравнивать их между слоями нельзя. Проект Gianluca Gernone под названием CBLL (Canonical Basis for Language Models) предлагает выход: повернуть модель так, чтобы каждая ось совпала с конкретным спектральным направлением её собственных весовых матриц.

Главное свойство преобразования — оно без потерь. Обучаемые коэффициенты нормализации RMSNorm заранее «впитываются» в соседние весовые матрицы, после чего модель поворачивается ортогональной матрицей, построенной из сингулярных векторов. Поведение не меняется: у Qwen 2.5 0.5B перплексия и результат MMLU остаются буквально теми же, у SmolLM2 расхождение — на уровне шума fp16. Для семейств с LayerNorm (например, Pythia 1.4B) применяется поворот, сохраняющий постоянную компоненту, — и снова без потерь. Автор подчёркивает: это микроскоп, а не модификация.

Что видно под микроскопом

В новом базисе явления, «размазанные» по всем измерениям, локализуются на отдельных осях. Среди находок — биполярный осциллятор: оси разбиваются на положительный и отрицательный полюса, и у 83% положительных осей есть выделенный тормозящий партнёр, работающий в противофазе (главная пара — оси 62 и 570 с корреляцией −0,97). Обнаружилось и своего рода «дыхание»: соотношение полюсов ритмично колеблется по слоям в четырёх фазах — кодирование, обработка, декодирование, вывод — независимо от содержания запроса. Ещё один эффект — гомеостаз: любое искусственное возмущение остаточного потока стирается за пару слоёв совместным действием нормализации, softmax внимания и рабочего диапазона SiLU. Это, по словам автора, свойство архитектуры, а не выученное поведение.

Отдельно впечатляет скромность реальной сложности: эффективный ранг корреляционной матрицы модели на полмиллиарда параметров может опускаться до одиннадцати независимых паттернов.

Геометрия не декоративна

Чтобы доказать функциональность этих структур, автор проводит причинный эксперимент. Обнуление одной-единственной оси 62 — это 0,11% модели — обрушивает MMLU с 47,5% до 21,25%, а перплексия взлетает с 4 до почти 24 тысяч: на выходе получается «the the the the...». При этом ось имеет почти нулевую статическую активацию, но максимальную центральность в сети корреляций — это динамический дирижёр, а не отдельный признак. Контрольные оси не дают никакого эффекта.

Весь код и предвычисленные данные опубликованы, есть интерактивный демо-чат с командами /ablate и /restore, позволяющий вживую почувствовать, как модель теряет и вновь обретает связность. Работа сопровождается статьёй на Zenodo; код под MIT, данные под CC-BY 4.0, коммерческое использование оговаривается отдельно.


Источник: Lobsters

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.