Трансформер за 67 центов набрал 44% на ARC-AGI-1

· Искусственный интеллект
Индийский исследователь Митхил Вакде обучил крошечную модель с нуля за полтора часа на одной видеокарте и обошёл по точности многие большие языковые модели — без синтетических данных и рекурсии.

cover.svg

Бенчмарк ARC-AGI, задуманный Франсуа Шолле как тест на «текучий интеллект», уже шесть лет сопротивляется штурму. Митхил Вакде, выпускник Индийского технологического института в Бомбее, показал, что для достойного результата не нужны ни гигантские языковые модели, ни горы синтетических данных.

Его небольшой трансформер (восемь слоёв) обучается с нуля прямо во время теста и набирает 44% на публичной выборке ARC-AGI-1 и 7% на более сложной ARC-2. Всё обучение и инференс укладываются в полтора часа на одной RTX 5090, а суммарная стоимость аренды карты составляет 67 центов. Код открыт, а результат, по словам автора, повторяет показатели нашумевших моделей TRM и HRM — при несопоставимо меньших затратах.

Что под капотом

Каждая пара «вход-выход» превращается в последовательность токенов, на которых авторегрессионно учится модель. Обучение идёт одновременно на обучающих и тестовых головоломках, но метки (правильные ответы тестовых пар) остаются скрытыми — то есть это не «обучение на тесте», а транcдуктивное метаобучение. Наибольший вклад в качество, судя по абляциям, дают удачные представления: трёхмерный RoPE и отдельный обучаемый эмбеддинг для каждой задачи. Уберите любой из них — и точность падает примерно до 25%.

По сравнению с прошлой версией Вакде подтянул архитектуру до современной (SwiGLU вместо GELU, RMSNorm вместо LayerNorm), сменил оптимизатор AdamW на NorMuon, резко сократил число аугментаций и перешёл к supervised-обучению только на выходных токенах. Любопытно, что при этом тестовый лосс ухудшился, а итоговый счёт вырос — объяснения этому у автора пока нет.

Полемика с индустрией

Большая часть заметки — это спор с распространёнными подходами. Вакде считает главной нерешённой проблемой ИИ именно эффективность по данным (sample efficiency) и упрекает исследователей в увлечении рекурсией: по его мнению, HRM и TRM не доказали абляциями, что рекуррентные циклы что-то дают, а заявленные «7 миллионов параметров» лукавы, поскольку сотни миллионов весов прячутся в эмбеддингах.

Достаётся и языковым моделям. Их прогресс на ARC, по наблюдениям автора, объясняется дообучением на данных, похожих на задачи бенчмарка, а не ростом абстрактного мышления: базовые модели по-прежнему набирают единицы процентов на ARC-2. Отсюда предложение — запретить любое предобучение и заставить модели учиться с нуля после сабмита, что автоматически исключит синтетические данные.

Вакде честно признаётся, что сам не ждал 45% от «просто трансформера с самым очевидным представлением», и недоумевает, почему за шесть лет и при миллионном призовом фонде до этого никто не додумался. Планка в 65%, уверен он, достижима в рамках той же архитектуры — и приглашает всех желающих улучшать открытый код (только, просит он, не наращивая обучающую выборку).


Источник: Hacker News

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.