Латентные рассуждения ИИ оказались понятнее, чем считалось

· Искусственный интеллект
Исследователи из COLM 2026 показали, что модели со скрытыми рассуждениями либо почти не пользуются ими, либо прячут внутри вполне читаемые математические шаги.

cover.svg

Так называемые latent reasoning models (LRM) привлекли внимание тем, что рассуждают не словами, а в непрерывном скрытом состоянии. Это дёшево при инференсе и теоретически позволяет исследовать сразу несколько путей решения, но за удобство приходится платить прозрачностью: за ходом мысли такой модели невозможно уследить в привычном смысле, ведь она не выдаёт читаемый текст. Коннор Дилгрен и Сара Вигрефф в работе, представленной на конференции COLM 2026, решили проверить, действительно ли эти рассуждения так непроницаемы.

Логика: токены рассуждений почти не нужны

Авторы изучили две современные модели — Coconut и CODI — на задачах логического вывода вроде PrOntoQA и ProsQA. Выяснилось, что скрытые шаги рассуждений здесь по большей части избыточны: если заставить модель «перестать думать» досрочно, она почти всегда выдаёт тот же самый ответ. Иными словами, высокая точность на логических задачах объясняется не размышлениями во время инференса, а особенностями обучающих данных. Это ставит под сомнение заявленную в прежних работах роль таких токенов и заодно объясняет, почему LRM не всегда обходят модели с явными рассуждениями.

Математика: внутри прячутся обычные шаги решения

Интереснее становится там, где рассуждения действительно требуются, — на математических задачах. Исследователи спроецировали скрытые состояния обратно в обычный словарь и проверили, не спрятано ли в них привычное пошаговое решение. Оказалось, что для верно решённых примеров эталонную цепочку рассуждений удаётся восстановить в 65–93 % случаев. То есть модель, судя по всему, выполняет в фоне ровно те математические операции, которые и ожидались.

Чтобы убедиться, что это не совпадение, авторы меняли числа в условии и наблюдали за реакцией скрытых состояний — это подтвердило, какие именно операции выполняются. Наконец, они предложили способ извлекать проверенную цепочку рассуждений на естественном языке, не зная заранее эталонного решения. Такую цепочку удавалось найти для большинства правильных ответов и лишь для меньшинства ошибочных.

Отсюда любопытный побочный вывод: сама возможность декодировать связное рассуждение служит признаком того, что ответ, скорее всего, верен. Вопреки распространённому в сообществе мнению, современные модели со скрытыми рассуждениями кодируют вполне интерпретируемые процессы.


Источник: Lobsters

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.