Qwen готовит модель Flash-Next: 125 млрд параметров при 6 млрд активных
На ModelScope появилась страница модели Qwen3.8-Flash-Next, о чём сообщили на Hacker News (122 балла, 47 комментариев). Из скупых данных следует немногое, но и это немногое любопытно.
Судя по обозначению 125B a6B, речь идёт об архитектуре Mixture-of-Experts: общее число параметров составляет около 125 миллиардов, тогда как в каждом отдельном проходе задействуется лишь порядка 6 миллиардов. Такой подход позволяет держать высокую ёмкость модели, но при этом заметно экономить вычислительные ресурсы на инференсе — именно на скорость намекает и слово Flash в названии.
Приставка Next и упоминание о релизе «завтра» указывают на то, что публикация весов и сопутствующих материалов должна состояться в ближайшее время. Подробной документации, бенчмарков или официального анонса на момент появления страницы ещё не было — доступно лишь имя модели и её базовые характеристики.
Пока это скорее повод для наблюдения, чем для выводов: без карточки модели, лицензии и результатов тестов судить о том, чем Flash-Next будет отличаться от предыдущих выпусков Qwen, преждевременно. Ждём официальных деталей.
Источник: Hacker News
Комментарии
Войдите, чтобы комментировать.