Mistral выпустила Shieldstral: 3B-модель для модерации контента с открытыми весами
Mistral представила Shieldstral — мультимодальный классификатор безопасности на 3 млрд параметров с открытыми весами. Модель опубликована под лицензией Apache 2.0 и, по данным компании, работает на одной видеокарте NVIDIA с 16 ГБ памяти. Заявлено, что при таком скромном размере она не уступает открытым «сторожевым» моделям, которые в семь раз больше, а на мультимодальной модерации показывает новый лучший результат.
Политика как вопрос
Главная идея Shieldstral в том, что модерация формулируется как бинарная задача «вопрос–ответ». Обычные guardrail-модели зашивают фиксированный набор категорий вреда прямо в веса, и чтобы переориентировать их на новую задачу, приходится переобучать. Mistral справедливо замечает, что единственно верного набора категорий не существует: один и тот же материал безопасен для инструмента по кибербезопасности и вреден на платформе психического здоровья.
Поэтому политику здесь пишут обычными словами прямо во время работы модели. Запрос состоит из трёх частей: контекст оценки и строгость (Instruct), один вопрос с ответом «да/нет» — например, «продвигает ли этот контент насилие?» (Query), и сам материал для проверки: текст, пара «запрос–ответ» или изображение (Document). Модель считывает логиты токенов yes и no и превращает их в непрерывную оценку безопасности за один проход. Такая формулировка объединяет классификацию запросов, модерацию ответов, определение отказов и выявление токсичности в одну задачу, а сами политики можно менять без переобучения.
Ставка на данные
Разработчики подчёркивают: небольшая модель обыгрывает крупные, если правильно подготовить данные. Разнородные публичные датасеты — от бинарных меток до детальных многоуровневых таксономий — приводятся к единому формату, а формулировки инструкций варьируются, чтобы модель не переобучалась под один стиль. Чтобы научить её различать, а не запоминать, создавались пары почти неотличимых политик: текст переписывался так, чтобы нарушать одну политику, но не соседнюю. Для изображений, которые нельзя синтезировать языковой моделью, применялись дополнительные наборы и фильтрация через vision-language-реранкер.
Итоговая модель собрана слиянием нескольких LoRA-чекпойнтов методом SLERP, а обучение велось на внутренней платформе компании Forge.
Shieldstral выпущена в рамках Open Secure AI Alliance совместно с NVIDIA и другими организациями. В планах — многоязычность, устойчивость на длинных документах и расширение мультимодальной безопасности.
Источник: Hacker News
Комментарии
Войдите, чтобы комментировать.