Cognition представила SWE-2 — дешёвую модель для кодинга на уровне лидеров
Компания Cognition, известная по ИИ-агенту для программирования Devin, выпустила SWE-2 — свою самую совершенную модель для написания кода. По утверждению разработчиков, она смещает границу оптимального соотношения цены и качества (парето-фронт): на бенчмарке FrontierCode 1.1 Main SWE-2 набирает 50,0% — на один пункт меньше, чем Fable 5.1 (50,9%), — но обходится на 64% дешевле. Модель уступает несколько пунктов лидеру GPT-6 Astra (53,3%), стоя при этом вчетверо меньше.
SWE-2 дообучена на основе открытой модели Kimi K3 с 2,8 трлн параметров, которая уже прошла масштабное обучение с подкреплением для агентного программирования. Даже поверх такой базы дополнительное обучение, по данным Cognition, добавило 5–6 пунктов на многих тестах.
Экономия ходов
Основной прирост эффективности связан не с грубой силой, а с более здравым инженерным суждением. Предыдущая версия SWE-1.7 запомнилась пользователям тем, что слишком дотошно исследовала код перед правкой и «переусердствовала» даже на простых задачах. SWE-2 действует избирательнее: она быстрее понимает, какие части репозитория действительно важны, и раньше приступает к делу. Первую содержательную правку модель в режиме medium вносит в среднем на 18-м шаге против 48-го у предшественницы, тратя при этом на 58% меньше ходов и на 81% меньше средств.
Внутренние тесты выявили и другие черты: модель лучше пишет сквозные тесты, находит обходные пути, когда прямой заблокирован (в одном случае она восстановила недоступные данные из истории Slack-канала), а при возражениях перепроверяет выводы, а не переупрямствует.
Единый прогон вместо зоопарка
Главное методологическое новшество — «парето-ориентированные штрафы за стоимость» в обучении с подкреплением. Вместо того чтобы тренировать отдельные варианты под каждый уровень «усилий», Cognition обучает все режимы (medium, high, max) за один прогон, добавляя к награде линейный штраф за стоимость, подобранный под наклон парето-кривой базовой модели. Авторы выводят этот подход из первых принципов и математически доказывают, что только линейный штраф даёт нужное свойство.
Отдельные разделы посвящены стабилизирующему обучение «взвешенному по длине» базовому уровню награды, ускорению генерации через спекулятивное декодирование и вычислениям низкой точности (NVFP4/FP8), а также утроению числа обучающих сред. Cognition также проверила модель на устойчивость к пропаганде и цензуре: на вопросах о политически чувствительных темах SWE-2 дала содержательные ответы в 98% случаев.
SWE-2 уже доступна в Devin Desktop и CLI, развёртывание в веб-версии продолжается.
Источник: Hacker News
Комментарии
Войдите, чтобы комментировать.