Латентные рассуждения ИИ оказались понятнее, чем считалось
Так называемые latent reasoning models (LRM) привлекли внимание тем, что рассуждают не словами, а в непрерывном скрытом состоянии. Это дёшево при инференсе и теоретически позволяет исследовать сразу несколько путей решения, но за удобство приходится платить прозрачностью: за ходом мысли такой модели невозможно уследить в привычном смысле, ведь она не выдаёт читаемый текст. Коннор Дилгрен и Сара Вигрефф в работе, представленной на конференции COLM 2026, решили проверить, действительно ли эти рассуждения так непроницаемы.
Логика: токены рассуждений почти не нужны
Авторы изучили две современные модели — Coconut и CODI — на задачах логического вывода вроде PrOntoQA и ProsQA. Выяснилось, что скрытые шаги рассуждений здесь по большей части избыточны: если заставить модель «перестать думать» досрочно, она почти всегда выдаёт тот же самый ответ. Иными словами, высокая точность на логических задачах объясняется не размышлениями во время инференса, а особенностями обучающих данных. Это ставит под сомнение заявленную в прежних работах роль таких токенов и заодно объясняет, почему LRM не всегда обходят модели с явными рассуждениями.
Математика: внутри прячутся обычные шаги решения
Интереснее становится там, где рассуждения действительно требуются, — на математических задачах. Исследователи спроецировали скрытые состояния обратно в обычный словарь и проверили, не спрятано ли в них привычное пошаговое решение. Оказалось, что для верно решённых примеров эталонную цепочку рассуждений удаётся восстановить в 65–93 % случаев. То есть модель, судя по всему, выполняет в фоне ровно те математические операции, которые и ожидались.
Чтобы убедиться, что это не совпадение, авторы меняли числа в условии и наблюдали за реакцией скрытых состояний — это подтвердило, какие именно операции выполняются. Наконец, они предложили способ извлекать проверенную цепочку рассуждений на естественном языке, не зная заранее эталонного решения. Такую цепочку удавалось найти для большинства правильных ответов и лишь для меньшинства ошибочных.
Отсюда любопытный побочный вывод: сама возможность декодировать связное рассуждение служит признаком того, что ответ, скорее всего, верен. Вопреки распространённому в сообществе мнению, современные модели со скрытыми рассуждениями кодируют вполне интерпретируемые процессы.
Источник: Lobsters
Комментарии
Войдите, чтобы комментировать.