Сжатая 4-битная модель обошла свой полноточный оригинал
Уменьшение большой языковой модели почти всегда обходится ценой качества. Стандартный рецепт эффективного развёртывания выглядит так: сначала сокращают архитектуру, удаляя слои, головы внимания или нейроны, затем квантуют оставшиеся веса до 4 бит, чтобы снизить требования к памяти и вычислениям. Оба шага экономят ресурсы, но вместе бьют именно по тем способностям, ради которых модели и используют: рассуждениям, математике и генерации кода. Поэтому в серьёзные конвейеры добавляют этап восстановления, который называют «лечением» (healing).
Исследователи из Multiverse Computing в статье о Quantization-Aware Healing (QAH) задались вопросом, который до сих пор оставался открытым: как правильно восстанавливать модель, прошедшую не только квантование, но и структурное сжатие. Применив QAH к модели GPT-OSS 120B, сжатой до 60B параметров и квантованной в формат MXFP4, они получили результат, переворачивающий привычную иерархию: 4-битная модель обошла собственную полноточную (bfloat16) версию на 7 из 9 бенчмарков — при этом она меньше, дешевле в работе и точнее того чекпойнта, из которого была получена.
В чём подвох прежних методов
Обычно лечение проводят через дообучение с фейковым квантованием (QAT) либо дистилляцией от замороженного полноточного учителя (QAD). Но после структурного сжатия независимой полноточной версии уменьшенной архитектуры попросту не существует. Единственный доступный учитель — сам восстановленный bfloat16-чекпойнт, который и так является приближением оригинала. Дистилляция от него привязывает ученика к уже деградировавшей цели и ограничивает его потолком этого чекпойнта.
Идея QAH
Авторы меняют одну деталь: дистиллируют напрямую из исходной, до сжатия, модели. Учитель и ученик даже не разделяют архитектуру — учитель полноразмерный и полноточный, ученик вдвое меньше и работает в MXFP4. Поскольку распределение выходов учителя не зависит от архитектуры, рассогласование размеров не мешает переносу знаний. Так квантование перестаёт быть «потерей на постобработке» и превращается во второй проход дистилляции — ученик подхватывает то, что этап восстановления просто не успел передать.
Результаты
Наибольший прирост пришёлся именно на способности, которые сжатие обычно повреждает сильнее всего: рассуждения на длинном контексте (+7,4 на AA-LCR) и математика (+5,6 на AIME 2025). На двух бенчмарках (MMLU-Pro и SciCode) QAH-модель проигрывает, но меньше чем на полтора пункта. Более того, при вдвое меньшем числе параметров и примерно вчетверо меньшей памяти под веса она превосходит исходного 120B-учителя на LiveCodeBench.
Отдельное преимущество — стабильность. В прямом сравнении на модели 9B оба метода достигают близкого пика (54,9 против 54,6), но QAH выходит на него примерно за 100 шагов — в семь раз быстрее QAT — и дальше почти не сползает. QAT же после пика резко деградирует, теряя к 1200-му шагу около 19 пунктов, а значит, требует аккуратной ранней остановки.
Вывод авторов: сжатая 4-битная модель не обязана быть худшей копией полноточной. При правильном рецепте лечения она может быть одновременно меньше, дешевле и точнее, а квантование превращается из «налога на эффективность» в дополнительную возможность обучить модель.
Источник: Hugging Face Blog
Комментарии
Войдите, чтобы комментировать.