Cognition представила SWE-2 — дешёвую модель для кодинга на уровне лидеров

· Искусственный интеллект
Новая модель компании Cognition набирает 50% на бенчмарке FrontierCode 1.1 — почти как Fable 5.1, но при цене на 64% ниже. Ключ к результату — обучение с учётом баланса «стоимость–качество».

cover.svg

Компания Cognition, известная по ИИ-агенту для программирования Devin, выпустила SWE-2 — свою самую совершенную модель для написания кода. По утверждению разработчиков, она смещает границу оптимального соотношения цены и качества (парето-фронт): на бенчмарке FrontierCode 1.1 Main SWE-2 набирает 50,0% — на один пункт меньше, чем Fable 5.1 (50,9%), — но обходится на 64% дешевле. Модель уступает несколько пунктов лидеру GPT-6 Astra (53,3%), стоя при этом вчетверо меньше.

SWE-2 дообучена на основе открытой модели Kimi K3 с 2,8 трлн параметров, которая уже прошла масштабное обучение с подкреплением для агентного программирования. Даже поверх такой базы дополнительное обучение, по данным Cognition, добавило 5–6 пунктов на многих тестах.

Экономия ходов

Основной прирост эффективности связан не с грубой силой, а с более здравым инженерным суждением. Предыдущая версия SWE-1.7 запомнилась пользователям тем, что слишком дотошно исследовала код перед правкой и «переусердствовала» даже на простых задачах. SWE-2 действует избирательнее: она быстрее понимает, какие части репозитория действительно важны, и раньше приступает к делу. Первую содержательную правку модель в режиме medium вносит в среднем на 18-м шаге против 48-го у предшественницы, тратя при этом на 58% меньше ходов и на 81% меньше средств.

Внутренние тесты выявили и другие черты: модель лучше пишет сквозные тесты, находит обходные пути, когда прямой заблокирован (в одном случае она восстановила недоступные данные из истории Slack-канала), а при возражениях перепроверяет выводы, а не переупрямствует.

Единый прогон вместо зоопарка

Главное методологическое новшество — «парето-ориентированные штрафы за стоимость» в обучении с подкреплением. Вместо того чтобы тренировать отдельные варианты под каждый уровень «усилий», Cognition обучает все режимы (medium, high, max) за один прогон, добавляя к награде линейный штраф за стоимость, подобранный под наклон парето-кривой базовой модели. Авторы выводят этот подход из первых принципов и математически доказывают, что только линейный штраф даёт нужное свойство.

Отдельные разделы посвящены стабилизирующему обучение «взвешенному по длине» базовому уровню награды, ускорению генерации через спекулятивное декодирование и вычислениям низкой точности (NVFP4/FP8), а также утроению числа обучающих сред. Cognition также проверила модель на устойчивость к пропаганде и цензуре: на вопросах о политически чувствительных темах SWE-2 дала содержательные ответы в 98% случаев.

SWE-2 уже доступна в Devin Desktop и CLI, развёртывание в веб-версии продолжается.


Источник: Hacker News

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.