#квантование
-
Сжатая 4-битная модель обошла свой полноточный оригинал
Multiverse Computing представила метод Quantization-Aware Healing: 4-битная модель после сжатия и квантования превзошла собственную 16-битную версию на 7 из 9 бенчмарков.
-
Почему локальная LLM кажется глупее, чем есть на самом деле
Автор с форума Level1Techs провёл серию экспериментов, показав, что одни и те же веса модели выдают разные токены в зависимости от железа и софта — и что за этим стоит вполне материальная математика.
-
Qwen3.8-27B: 32 демо, собранные за один присест
К релизу модели Qwen3.8-27B опубликована галерея из 32 самодостаточных демо-страниц, сгенерированных за один сеанс. Отдельные работы показаны в разной точности вычислений.