#инференс
-
Может ли ИИ захватить сервер через уязвимости движка инференса
Эссе Бойда Кейна о том, как вредоносная языковая модель способна получить контроль над машиной, где загружены её же веса, эксплуатируя баги в движках вроде vLLM и SGLang.
-
Почему локальная LLM кажется глупее, чем есть на самом деле
Автор с форума Level1Techs провёл серию экспериментов, показав, что одни и те же веса модели выдают разные токены в зависимости от железа и софта — и что за этим стоит вполне материальная математика.
-
AMD покупает стартап Taalas, чтобы «выжигать» модели ИИ в кремнии
AMD приобрела Taalas — компанию, обещающую ускорить инференс за счёт переноса нейросетевых моделей непосредственно в структуру чипа.
-
Kimi K3 на AMD MI355X: лучше по цене за токен, чем NVIDIA B300
Инженеры Wafer запустили открытую 2,8-триллионную модель Kimi K3 на ускорителях AMD MI355X и получили заметно лучшую производительность на доллар, чем на флагманских NVIDIA Blackwell.
-
Baidu выпустила vLLM-Kunlun — плагин для запуска LLM на ускорителях Kunlun XPU
Baidu открыла исходный код vLLM-Kunlun — подключаемого модуля, позволяющего запускать популярный движок вывода vLLM на собственных ускорителях Kunlun XPU без правки исходников vLLM.
-
Xiaomi описала комплексную оптимизацию инференса для серии MiMo-V2.5
Xiaomi опубликовала на блоге проекта MiMo материал о сквозной (full-pipeline) оптимизации инференса для моделей серии MiMo-V2.5. Подробности представлены в оригинальной публикации.
-
GLM 5.2 на AMD MI355X: вдвое дешевле Blackwell при 2626 ток/с на узел
Компания Wafer сообщила о запуске модели GLM 5.2 на ускорителях AMD Instinct MI355X, показавшем производительность 2626 токенов в секунду на узел при более чем двукратном снижении стоимости по сравнению с решениями на базе Nvidia Blackwell. Новость собрала заметный отклик на Hacker News.