Microsoft издала «кодекс поведения» для ИИ: не взламывать системы и не обманывать людей
Microsoft представила новый «кодекс поведения» для своих ИИ-моделей — документ, призванный удерживать системы от опасного поведения. В отличие от призывов «замедлить движение к рубежу», с которыми недавно выступал глава Anthropic Дарио Амодеи, текст Microsoft устроен более приземлённо: он описывает ценности и запреты, которые закладываются в модели ещё на этапе обучения.
Документ начинается с прогноза: в ближайшее десятилетие сверхразумные ИИ-системы превзойдут человека в большинстве задач. «Сдерживать, контролировать и согласовывать такую могущественную силу — один из величайших вызовов в истории человечества», — говорится в кодексе. Отсюда, по мысли компании, необходимость предельно ясно понимать, зачем такие системы создаются и как их предполагается держать под контролем.
Принципы и абсолютные запреты
Общие принципы звучат гуманистически: ИИ должен поддерживать человека, а не заменять его, и способствовать процветанию людей. Но самое интересное — в механике. У каждой модели Microsoft есть надстоящий кодекс, который перекрывает и пожелания отдельного пользователя, и конкретную поставленную задачу.
В него входят «абсолютные ограничения», прямо запрещающие кибератаки, участие в создании ядерного оружия и производство дипфейков. Отдельный блок посвящён более широкой угрозе — потере человеческого контроля над системой.
Формулировка недвусмысленна: модели MAI не должны использовать адаптивные, обманные, самоусиливающиеся, сговорные или иные механизмы, чтобы уклоняться от человеческого надзора и лишать уполномоченных людей возможности направлять их, изменять или отключать. Иными словами, компания заранее запрещает модели хитрить ради самосохранения.
Контекст выхода
Кодекс появился на фоне небывалого внимания к безопасности ИИ. Поводом стала серия инцидентов с «взбунтовавшимися» агентами, а также громкая отставка сотрудника Anthropic, публично предупредившего о растущем риске того, что ИИ приведёт к вымиранию человечества.
Microsoft вместе с Anthropic, OpenAI и xAI в целом поддержала идею «размеренного движения к рубежу» и, в частности, концепцию «встроенных оценщиков» (embedded evaluators) внутри ИИ-лабораторий. Глава Microsoft Сатья Наделла написал, что компания приветствует исследования и осознанный темп, необходимые, чтобы «сделать согласование целью проектирования», а также механизмы, которые превратят разговоры о безопасности во что-то большее, чем слова.
За торжественностью формулировок стоит вполне практический вопрос: как записать в модель правила, которые она сама не сможет обойти. Ответ Microsoft — иерархия, где кодекс стоит выше любых пользовательских запросов.
Источник: TechCrunch
Комментарии
Войдите, чтобы комментировать.