Qwen готовит модель Flash-Next: 125 млрд параметров при 6 млрд активных

· Искусственный интеллект
На платформе ModelScope замечена страница нового языкового моделя семейства Qwen — Flash-Next, релиз которого, судя по названию, ожидается совсем скоро.

cover.svg

На ModelScope появилась страница модели Qwen3.8-Flash-Next, о чём сообщили на Hacker News (122 балла, 47 комментариев). Из скупых данных следует немногое, но и это немногое любопытно.

Судя по обозначению 125B a6B, речь идёт об архитектуре Mixture-of-Experts: общее число параметров составляет около 125 миллиардов, тогда как в каждом отдельном проходе задействуется лишь порядка 6 миллиардов. Такой подход позволяет держать высокую ёмкость модели, но при этом заметно экономить вычислительные ресурсы на инференсе — именно на скорость намекает и слово Flash в названии.

Приставка Next и упоминание о релизе «завтра» указывают на то, что публикация весов и сопутствующих материалов должна состояться в ближайшее время. Подробной документации, бенчмарков или официального анонса на момент появления страницы ещё не было — доступно лишь имя модели и её базовые характеристики.

Пока это скорее повод для наблюдения, чем для выводов: без карточки модели, лицензии и результатов тестов судить о том, чем Flash-Next будет отличаться от предыдущих выпусков Qwen, преждевременно. Ждём официальных деталей.


Источник: Hacker News

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.