Дообученная 9B-модель за $500 обошла топовые ИИ на проверке каталога

· Искусственный интеллект
Авторы Fermisense утверждают: открытая модель на 9 млрд параметров, дообученная методом обучения с подкреплением, превзошла ведущие проприетарные модели на конкретной задаче и оказалась в десятки раз дешевле в эксплуатации.

cover.svg

Команда Fermisense опубликовала подробный разбор подхода, к которому, по её наблюдениям, сходятся компании, реально выигрывающие от ИИ: не аренда универсальных моделей по токенам, а дообучение открытых моделей под собственные процессы. Тезис простой — если задача повторяется в больших объёмах и её результат можно проверить по правилу или рубрике, специализированная модель почти наверняка обгонит универсальную, которая «никогда не видела внутренностей вашей компании».

Эксперимент с каталогом

В качестве демонстрации авторы взяли типичную для e-commerce задачу — проверку товарных карточек: отнести листинг к нужной категории таксономии, извлечь атрибуты, сверить бренд и вынести решение (одобрить, пометить, отправить человеку). На данных Amazon Berkeley Objects они собрали «цифрового двойника» площадки — 177 767 проверочных эпизодов с реальными изображениями и описаниями, куда специально подмешали спорные и нарушающие правила случаи с заранее известным верным ответом.

Модель работала в этой среде с теми же инструментами, что и живой аналитик: искала по таксономии из ~13 000 категорий, проверяла регистрацию бренда, подтягивала схему атрибутов. Скорер оценивал каждое решение, причём штрафы кодировали бизнес-приоритеты напрямую — пропущенное нарушение обходилось модели в семь раз дороже ложной тревоги.

Цифры

Обучение методом GRPO шло на двух арендованных GPU, заняло около трёх с половиной суток и обошлось примерно в $500. Модель на 9 млрд параметров достигла 87,3% от максимально возможного балла против 76,9% у лучшей проприетарной конфигурации и 64,2% у собственной необученной базы. Пять топовых моделей даже с тщательно подобранными промптами уперлись в потолок, различаясь между собой на десятые доли балла; специалист этот потолок пробил.

Главный аргумент — не точность, а экономика. По расчётам авторов, специализированная модель обходится примерно в $0,50 за 1000 листингов против $34 у сильнейшей проприетарной модели: разница в 68 раз. На масштабе порядка 40 млн решений в день это около $7 млн в год вместо $500 млн.

Оговорки

Текст — по сути витрина услуг компании: он завершается предложением записаться на бесплатный аудит, а приведённые сравнения (Bridgewater, Harvey, Intercom, LinkedIn и другие) — это собственные заявленные показатели фирм против моделей, которые они замещали. Авторы честно очерчивают и границы метода: дообучение оправдано лишь там, где задача частая, а результат проверяем; если меняются не суждения, а факты, помогает не обучение, а извлечение из базы, а там, где исход проверить нельзя, нужен человек. Отдельный плюс — модель, обученная внутри собственного контура, не отправляет данные внешнему поставщику. Готовые модели выложены на Hugging Face.


Источник: Hacker News

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.