Google DeepMind выпустила Gemini 3.8 Flash и версию для кибербезопасности

· Искусственный интеллект
DeepMind представила Gemini 3.8 Flash — рабочую модель для агентных задач и программирования — и отдельный вариант 3.8 Flash Cyber для защитников, специализирующийся на поиске и устранении уязвимостей.

cover.svg

Google DeepMind объявила о выходе семейства моделей Gemini 3.8 — третьего релиза линейки Flash всего за шесть недель. По словам компании, это её лучшая на сегодня модель для рассуждений и написания кода, сохранившая скорость и низкую стоимость предшественницы, Gemini 3.7 Flash. Представлены два варианта, построенных на общей основе.

Gemini 3.8 Flash

Основная модель ориентирована на длительные задачи программирования и автономных агентов. По утверждению DeepMind, на бенчмарке DeepSWE v1.1 она обходит большинство более крупных и дорогих моделей при решении сложных инженерных задач «от и до», а также показывает лучшие результаты в специализированных областях — финансовом и юридическом анализе (Vals Finance Agent V2, Harvey's Legal Agent Benchmark). На тесте HLE-Verified модель набрала 54,9%.

Ключевая особенность подана без ложной скромности: модель «работает усерднее». На сложных задачах она выполняет дополнительные шаги рассуждений и итеративно вызывает инструменты, что порой означает больший расход токенов. Для сценариев, где важнее экономия, разработчикам предлагают снижать «уровень усилий» или оставаться на 3.7 Flash.

Цена вводного периода — 0,75 доллара за миллион входных токенов и 3,75 доллара за миллион выходных; с 1 января 2027 года тарифы вырастут вдвое. В качестве демонстраций компания приводит созданные по одному запросу проекты: трёхмерную игру про волшебника в замке, работающую версию Google Maps в стилистике DOS и интерактивный 3D-визуализатор разборки устройств.

Gemini 3.8 Flash Cyber

Второй вариант предназначен для кибербезопасности и доступен только проверенным защитникам через новую программу Fairwind — государственным структурам, операторам критической инфраструктуры и мейнтейнерам ПО. Акцент сделан именно на обороне: DeepMind подчёркивает, что с самого начала приоритет отдавался исправлению уязвимостей, а не наступательным возможностям вроде эксплуатации.

На бенчмарке CyberGym модель, по данным компании, превосходит куда более крупные фронтирные системы, а на внутреннем тесте по 20 языкам программирования достигает свыше 70% успеха в обнаружении уязвимостей. В задачах автоматического патчинга (CWE-Bench) её результат pass@1 составил 47,2% против 47,8% у лидера — при заметно меньшей стоимости.

Google уже применяет модель внутри компании: команда безопасности Chrome сообщает, что она создаёт в 2,6 раза больше корректных патчей, чем крупные коммерческие аналоги, а специалисты Cloud Vulnerability Research нашли с её помощью критическую уязвимость менее чем за два часа вместо обычных месяцев.

Обе модели снабжены защитой от злоупотреблений в областях CBRN и наступательного кибервоздействия, а также, по утверждению DeepMind, заметно устойчивее к атакам через инъекцию промптов.


Источник: Google DeepMind

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.