#инференс
-
Baidu выпустила vLLM-Kunlun — плагин для запуска LLM на ускорителях Kunlun XPU
Baidu открыла исходный код vLLM-Kunlun — подключаемого модуля, позволяющего запускать популярный движок вывода vLLM на собственных ускорителях Kunlun XPU без правки исходников vLLM.
-
Xiaomi описала комплексную оптимизацию инференса для серии MiMo-V2.5
Xiaomi опубликовала на блоге проекта MiMo материал о сквозной (full-pipeline) оптимизации инференса для моделей серии MiMo-V2.5. Подробности представлены в оригинальной публикации.
-
GLM 5.2 на AMD MI355X: вдвое дешевле Blackwell при 2626 ток/с на узел
Компания Wafer сообщила о запуске модели GLM 5.2 на ускорителях AMD Instinct MI355X, показавшем производительность 2626 токенов в секунду на узел при более чем двукратном снижении стоимости по сравнению с решениями на базе Nvidia Blackwell. Новость собрала заметный отклик на Hacker News.