Трансформер за 67 центов набрал 44% на ARC-AGI-1
Бенчмарк ARC-AGI, задуманный Франсуа Шолле как тест на «текучий интеллект», уже шесть лет сопротивляется штурму. Митхил Вакде, выпускник Индийского технологического института в Бомбее, показал, что для достойного результата не нужны ни гигантские языковые модели, ни горы синтетических данных.
Его небольшой трансформер (восемь слоёв) обучается с нуля прямо во время теста и набирает 44% на публичной выборке ARC-AGI-1 и 7% на более сложной ARC-2. Всё обучение и инференс укладываются в полтора часа на одной RTX 5090, а суммарная стоимость аренды карты составляет 67 центов. Код открыт, а результат, по словам автора, повторяет показатели нашумевших моделей TRM и HRM — при несопоставимо меньших затратах.
Что под капотом
Каждая пара «вход-выход» превращается в последовательность токенов, на которых авторегрессионно учится модель. Обучение идёт одновременно на обучающих и тестовых головоломках, но метки (правильные ответы тестовых пар) остаются скрытыми — то есть это не «обучение на тесте», а транcдуктивное метаобучение. Наибольший вклад в качество, судя по абляциям, дают удачные представления: трёхмерный RoPE и отдельный обучаемый эмбеддинг для каждой задачи. Уберите любой из них — и точность падает примерно до 25%.
По сравнению с прошлой версией Вакде подтянул архитектуру до современной (SwiGLU вместо GELU, RMSNorm вместо LayerNorm), сменил оптимизатор AdamW на NorMuon, резко сократил число аугментаций и перешёл к supervised-обучению только на выходных токенах. Любопытно, что при этом тестовый лосс ухудшился, а итоговый счёт вырос — объяснения этому у автора пока нет.
Полемика с индустрией
Большая часть заметки — это спор с распространёнными подходами. Вакде считает главной нерешённой проблемой ИИ именно эффективность по данным (sample efficiency) и упрекает исследователей в увлечении рекурсией: по его мнению, HRM и TRM не доказали абляциями, что рекуррентные циклы что-то дают, а заявленные «7 миллионов параметров» лукавы, поскольку сотни миллионов весов прячутся в эмбеддингах.
Достаётся и языковым моделям. Их прогресс на ARC, по наблюдениям автора, объясняется дообучением на данных, похожих на задачи бенчмарка, а не ростом абстрактного мышления: базовые модели по-прежнему набирают единицы процентов на ARC-2. Отсюда предложение — запретить любое предобучение и заставить модели учиться с нуля после сабмита, что автоматически исключит синтетические данные.
Вакде честно признаётся, что сам не ждал 45% от «просто трансформера с самым очевидным представлением», и недоумевает, почему за шесть лет и при миллионном призовом фонде до этого никто не додумался. Планка в 65%, уверен он, достижима в рамках той же архитектуры — и приглашает всех желающих улучшать открытый код (только, просит он, не наращивая обучающую выборку).
Источник: Hacker News
Комментарии
Войдите, чтобы комментировать.