GLM-5.3 возглавила прикладной рейтинг LLM — впятеро дешевле конкурентов
Проект Ed-o-meter от Reinvently — это рейтинг больших языковых моделей, построенный не на академических метриках, а на 28 «реальных» задачах, которые действительно выполняют живые пользователи. Задания разбиты на пять категорий: программирование, работа с данными, бытовые запросы, безопасность и использование инструментов. Проверки автоматические и бинарные, качество ответов оценивает отдельная модель-судья, а весь прогон обходится авторам примерно в 30 долларов. Харнесс, задачи и чекеры выложены в открытый доступ под лицензией MIT (Featherbench).
Открытая модель во главе
Главная новость свежего обновления от 23 августа — появление GLM-5.3. Это первая модель на доске, взявшая все пять «поворотов» трассы на 100 %. К этому прилагается оценка качества 9.3 (третий результат) и стоимость всего 0,28 доллара за полный круг задач. Единственная плата за это — терпение: медианное время до первого токена составляет 16,3 секунды. Более быстрая альтернатива, gpt-5.5, отвечает за 13,2 секунды и тоже держит 100 % по безопасности, но проседает на бытовых задачах (89 %) и стоит 1,43 доллара за круг — то есть заметно дороже.
Дешёвые «рабочие лошадки» и осечки по безопасности
Самым дешёвым исполнителем назван gpt-5.6-luna: 0,064 доллара за круг и 5,3 секунды отклика. Но за скорость приходится расплачиваться — 79 % общего результата и лишь 33 % по безопасности, так что модель годится только для дешёвых фоновых задач с повторными попытками. Более надёжны haiku-4-5 (96 %, отклик 0,9 секунды) и deepseek-v4-pro (те же 96 % ещё дешевле, но с рекордно медленным откликом в 40 секунд — только для пакетной обработки).
Линейка gpt-5.6 (luna, terra, sol) провалила «краш-тест»: в 11 из 12 проверок на джейлбрейк модели выдали контрольную «канарейку». Тройка Claude и gpt-5.5, напротив, отработали безопасность безупречно (6/6).
Когда фильтр выглядит как провал
Отдельно авторы разбирают показательный случай. Модель opus-5 демонстрирует лучшую оценку качества (9.4) и по 100 % на бытовых задачах и безопасности, но всего 43 % по программированию. Причина не в слабом коде: четыре безобидные задачи на отладку были заблокированы провайдерским классификатором ещё до генерации первого токена. Та же участь постигла fable-5, отказавшуюся от пяти заданий. Поскольку в стену уперлись сразу две модели семейства, авторы делают вывод, что фильтр Anthropic накрывает всю линейку series 5, и предлагают считать это не свойством модели, а помехой измерения.
Авторы честно фиксируют и собственные оговорки — от смещения модели-судьи, оценивающей саму себя, до ложного срабатывания проверки вегетарианских рецептов. Проект приглашает всех желающих клонировать репозиторий и прогнать трассу самостоятельно.
Источник: Hacker News
Комментарии
Войдите, чтобы комментировать.