DeepSeek выпустила V4-Flash в публичной бете с упором на агентов

· Искусственный интеллект
Обновлённая модель deepseek-v4-flash по агентным тестам обгоняет превью версии Pro и получила поддержку формата Responses API и адаптацию под Codex.

cover.svg

Компания DeepSeek открыла публичную бету обновлённой модели DeepSeek-V4-Flash. Способ обращения к API не изменился: достаточно указать имя модели deepseek-v4-flash. Обновление затрагивает только API-версию Flash — интерфейсы V4-Pro, а также модели в приложении и вебе остаются прежними. Официальный релиз V4-Pro обещан в ближайшее время.

Ставка на агентные задачи

Главный акцент новой версии — работа в роли агента. По заявлению разработчиков, результаты на профильных бенчмарках заметно превосходят показатели превью-версии V4-Pro. Среди приведённых цифр:

  • Terminal Bench 2.1 — 82,7
  • NL2Repo — 54,2
  • Cybergym — 76,7
  • DeepSWE — 54,4
  • Toolathlon verified — 70,3
  • Agent Last Exam — 25,2
  • Automation Bench (Public) — 25,1

Отдельно упомянуты внутренние наборы тестов: DSBench-FullStack (полноценная веб-разработка) — 68,7 и DSBench-Hard (сложные задачи кодового агента) — 59,6.

При этом в компании честно оговаривают условия замеров: для задач Code Agent из публичных наборов использовался фреймворк DeepSeek Harness в минимальном режиме (его ещё только предстоит выпустить) с максимальным уровнем «усилий», параметрами top-p 0,95 и температурой 1,0. Иными словами, повторить эти числа «из коробки» пока не получится.

Совместимость и устройство модели

Официальный V4-Flash нативно поддерживает формат Responses API и специально адаптирован под Codex — конфигурацию разработчики отсылают смотреть в документации. Любопытная деталь: версия DeepSeek-V4-Flash-0731 сохраняет ту же архитектуру и размер, что и превью, — её лишь заново дообучили на этапе пост-тренинга. То есть прирост качества получен без изменения самой модели, одной только доводкой.

Напомним, семейство V4 (Pro и Flash) DeepSeek представила в апреле 2026 года, сделав его доступным как через интерфейс OpenAI ChatCompletions, так и через API Anthropic. Прежние имена моделей deepseek-chat и deepseek-reasoner, служившие точками входа в нетематический и «думающий» режимы, компания планировала вывести из обращения по истечении трёхмесячного переходного периода.

Новость привлекла внимание сообщества: на Hacker News публикация набрала 205 голосов и 84 комментария.


Источник: Hacker News

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.