Baidu выпустила vLLM-Kunlun — плагин для запуска LLM на ускорителях Kunlun XPU

· Искусственный интеллект
Baidu открыла исходный код vLLM-Kunlun — подключаемого модуля, позволяющего запускать популярный движок вывода vLLM на собственных ускорителях Kunlun XPU без правки исходников vLLM.

cover.svg

Компания Baidu открыла проект vLLM-Kunlun — поддерживаемый сообществом аппаратный плагин, который позволяет запускать движок вывода больших языковых моделей vLLM на ускорителях Kunlun XPU. Репозиторий появился на GitHub 8 декабря 2025 года; к настоящему моменту он собрал несколько сотен звёзд и десятки форков.

Плагин, а не форк

Главная идея проекта — интеграция без модификации кода vLLM. vLLM-Kunlun работает как стандартный платформенный плагин через механизм Python entry points и следует принципам, изложенным в RFC о подключаемом оборудовании (Hardware Pluggable). Такой подход разъединяет поддержку конкретного «железа» и основной кодовой базы vLLM, что упрощает сопровождение с обеих сторон.

Через эту прослойку на Kunlun XPU запускаются популярные открытые модели самых разных архитектур: классические трансформеры, модели с разреженной активацией экспертов (MoE), эмбеддинг-модели и мультимодальные LLM.

Что поддерживается

Заявлена поддержка более двух десятков распространённых моделей, включая семейства Qwen, Llama, DeepSeek, GLM, Gemma4 и Kimi-K2, а также мультимодальные варианты (Qwen-VL, InternVL и другие). Помимо этого разработчики перечисляют:

  • квантование W8A8 (INT8), AWQ, GPTQ и compressed-tensors W4A16 для плотных и MoE-моделей;
  • тонкую настройку через LoRA и Multi-LoRA для моделей серии Qwen;
  • оптимизацию вычислительного графа Piecewise Kunlun Graph;
  • оптимизированное внимание FlashMLA для архитектур DeepSeek MLA;
  • спекулятивное декодирование — предсказание нескольких токенов (MTP) для DeepSeek-V3.2 и предсказатели в стиле DFlash/EAGLE;
  • тензорный параллелизм для распределённого вывода на нескольких устройствах;
  • сервер с API, совместимым с OpenAI.

Требования и статус

Для работы нужны ускоритель Kunlun3 P800, Ubuntu 20.04, Python не ниже 3.10 и специально собранная под KL3 версия PyTorch (xpytorch). Свежие возможности из семейства Qwen3.5 требуют библиотеки transformers версии 5.x.

Последний стабильный релиз — v0.11.0, вышедший в декабре 2025 года; в разработке находится версия v0.25.1, куда добавляют поддержку Qwen3.5 и Qwen3.5-MoE, текстового и мультимодального Gemma4, GLM MoE DSA и спекулятивного декодирования DFlash. Проект распространяется под лицензией Apache 2.0.

Появление такого плагина продолжает тенденцию: производители ускорителей стремятся обеспечить совместимость своего оборудования с де-факто стандартными инструментами инференса, чтобы разработчикам не приходилось переписывать инфраструктуру под каждую новую платформу.


Источник: Lobsters

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.