Baidu выпустила vLLM-Kunlun — плагин для запуска LLM на ускорителях Kunlun XPU
Компания Baidu открыла проект vLLM-Kunlun — поддерживаемый сообществом аппаратный плагин, который позволяет запускать движок вывода больших языковых моделей vLLM на ускорителях Kunlun XPU. Репозиторий появился на GitHub 8 декабря 2025 года; к настоящему моменту он собрал несколько сотен звёзд и десятки форков.
Плагин, а не форк
Главная идея проекта — интеграция без модификации кода vLLM. vLLM-Kunlun работает как стандартный платформенный плагин через механизм Python entry points и следует принципам, изложенным в RFC о подключаемом оборудовании (Hardware Pluggable). Такой подход разъединяет поддержку конкретного «железа» и основной кодовой базы vLLM, что упрощает сопровождение с обеих сторон.
Через эту прослойку на Kunlun XPU запускаются популярные открытые модели самых разных архитектур: классические трансформеры, модели с разреженной активацией экспертов (MoE), эмбеддинг-модели и мультимодальные LLM.
Что поддерживается
Заявлена поддержка более двух десятков распространённых моделей, включая семейства Qwen, Llama, DeepSeek, GLM, Gemma4 и Kimi-K2, а также мультимодальные варианты (Qwen-VL, InternVL и другие). Помимо этого разработчики перечисляют:
- квантование W8A8 (INT8), AWQ, GPTQ и compressed-tensors W4A16 для плотных и MoE-моделей;
- тонкую настройку через LoRA и Multi-LoRA для моделей серии Qwen;
- оптимизацию вычислительного графа Piecewise Kunlun Graph;
- оптимизированное внимание FlashMLA для архитектур DeepSeek MLA;
- спекулятивное декодирование — предсказание нескольких токенов (MTP) для DeepSeek-V3.2 и предсказатели в стиле DFlash/EAGLE;
- тензорный параллелизм для распределённого вывода на нескольких устройствах;
- сервер с API, совместимым с OpenAI.
Требования и статус
Для работы нужны ускоритель Kunlun3 P800, Ubuntu 20.04, Python не ниже 3.10 и специально собранная под KL3 версия PyTorch (xpytorch). Свежие возможности из семейства Qwen3.5 требуют библиотеки transformers версии 5.x.
Последний стабильный релиз — v0.11.0, вышедший в декабре 2025 года; в разработке находится версия v0.25.1, куда добавляют поддержку Qwen3.5 и Qwen3.5-MoE, текстового и мультимодального Gemma4, GLM MoE DSA и спекулятивного декодирования DFlash. Проект распространяется под лицензией Apache 2.0.
Появление такого плагина продолжает тенденцию: производители ускорителей стремятся обеспечить совместимость своего оборудования с де-факто стандартными инструментами инференса, чтобы разработчикам не приходилось переписывать инфраструктуру под каждую новую платформу.
Источник: Lobsters
Комментарии
Войдите, чтобы комментировать.