Google DeepMind выпустила Gemini 3.8 Flash и версию для кибербезопасности
Google DeepMind объявила о выходе семейства моделей Gemini 3.8 — третьего релиза линейки Flash всего за шесть недель. По словам компании, это её лучшая на сегодня модель для рассуждений и написания кода, сохранившая скорость и низкую стоимость предшественницы, Gemini 3.7 Flash. Представлены два варианта, построенных на общей основе.
Gemini 3.8 Flash
Основная модель ориентирована на длительные задачи программирования и автономных агентов. По утверждению DeepMind, на бенчмарке DeepSWE v1.1 она обходит большинство более крупных и дорогих моделей при решении сложных инженерных задач «от и до», а также показывает лучшие результаты в специализированных областях — финансовом и юридическом анализе (Vals Finance Agent V2, Harvey's Legal Agent Benchmark). На тесте HLE-Verified модель набрала 54,9%.
Ключевая особенность подана без ложной скромности: модель «работает усерднее». На сложных задачах она выполняет дополнительные шаги рассуждений и итеративно вызывает инструменты, что порой означает больший расход токенов. Для сценариев, где важнее экономия, разработчикам предлагают снижать «уровень усилий» или оставаться на 3.7 Flash.
Цена вводного периода — 0,75 доллара за миллион входных токенов и 3,75 доллара за миллион выходных; с 1 января 2027 года тарифы вырастут вдвое. В качестве демонстраций компания приводит созданные по одному запросу проекты: трёхмерную игру про волшебника в замке, работающую версию Google Maps в стилистике DOS и интерактивный 3D-визуализатор разборки устройств.
Gemini 3.8 Flash Cyber
Второй вариант предназначен для кибербезопасности и доступен только проверенным защитникам через новую программу Fairwind — государственным структурам, операторам критической инфраструктуры и мейнтейнерам ПО. Акцент сделан именно на обороне: DeepMind подчёркивает, что с самого начала приоритет отдавался исправлению уязвимостей, а не наступательным возможностям вроде эксплуатации.
На бенчмарке CyberGym модель, по данным компании, превосходит куда более крупные фронтирные системы, а на внутреннем тесте по 20 языкам программирования достигает свыше 70% успеха в обнаружении уязвимостей. В задачах автоматического патчинга (CWE-Bench) её результат pass@1 составил 47,2% против 47,8% у лидера — при заметно меньшей стоимости.
Google уже применяет модель внутри компании: команда безопасности Chrome сообщает, что она создаёт в 2,6 раза больше корректных патчей, чем крупные коммерческие аналоги, а специалисты Cloud Vulnerability Research нашли с её помощью критическую уязвимость менее чем за два часа вместо обычных месяцев.
Обе модели снабжены защитой от злоупотреблений в областях CBRN и наступательного кибервоздействия, а также, по утверждению DeepMind, заметно устойчивее к атакам через инъекцию промптов.
Источник: Google DeepMind
Комментарии
Войдите, чтобы комментировать.