Модель, знающая мир не дальше пятого класса
Современные языковые модели учат сразу на всём подряд, и потому трудно понять, действительно ли модель освоила новый навык или просто извлекла то, что и так уже видела в данных. Проект LittleLearner предлагает обойти эту неопределённость, поставив под контроль сам обучающий материал.
Учебник за начальную школу
Авторы собрали корпус LittleCurriculum объёмом 88 млрд токенов, отфильтровав FineWeb-Edu пятиступенчатым конвейером по стандартам Common Core для классов с K по 5. Понятия, факты и лексика, которые в американской школе проходят позже пятого класса, из данных исключены намеренно. На этом корпусе с нуля обучены модели трёх масштабов — 0,6, 1,3 и 5 млрд параметров, — и к каждой прилагается контрольный «двойник» с той же архитектурой и рецептом, но обученный на нефильтрованных данных.
В результате получилась чат-модель с чётко очерченной границей знаний: заранее известно, чего она в принципе не должна знать. 5-миллиардную версию можно опробовать прямо в браузере.
Извлечение вместо приобретения
Главный вопрос исследования — можно ли стандартными приёмами вытолкнуть модель за пределы того, чему её учили. Авторы проверили три рычага и получили один и тот же ответ.
Увеличение размера модели улучшает результаты внутри изученной программы и немного помогает на задачах, лежащих на той же траектории обучения, но почти ничего не даёт там, где требуются более продвинутые навыки. Пост-тренировка методом GRPO заметно поднимает способности в пределах K–5, однако не восстанавливает умения за этой границей — даже если дообучать на данных, выходящих за рамки программы. Обучение в контексте (in-context learning) на использованных подсказках тоже не открывает у модели новых способностей к рассуждению за пределами пятого класса.
Вывод исследователей прямолинеен: масштабирование, пост-тренировка и подсказки лишь усиливают то, что заложил учебный план, но фильтр предобучения задаёт эффективный потолок возможностей.
Зачем это нужно
Известная граница знаний превращает расплывчатые вопросы в чистые эксперименты. Авторы называют несколько направлений: способно ли обучение с подкреплением породить новую способность, а не только раскрыть уже имеющуюся; как модель ведёт себя у самой границы — отвечает, воздерживается или начинает выдумывать; и наконец, сравнение с детьми — нужен ли машине тот же объём примеров, что и ребёнку, чтобы освоить дроби, и одинаково ли они ошибаются в текстовых задачах.
Работа сопровождается статьёй (arXiv:2608.13545), опубликованными чекпойнтами всех трёх масштабов и парными контрольными моделями.
Источник: Hacker News
Комментарии
Войдите, чтобы комментировать.