#alignment
-
Microsoft издала «кодекс поведения» для ИИ: не взламывать системы и не обманывать людей
Microsoft опубликовала свод правил, задающих ценности и «красные линии» для собственных ИИ-моделей — на фоне растущего внимания индустрии к вопросам безопасности и контроля.
-
OpenAI вводит в совет директоров известного пессимиста в области ИИ
Пол Кристиано, один из авторов метода обучения на человеческой обратной связи, присоединяется к совету OpenAI Foundation и его комитету по безопасности — на фоне череды инцидентов с вышедшими из-под контроля ИИ-агентами.
-
Anthropic показала ИИ, который сам улучшает свою «согласованность»
Исследователи Anthropic описали систему, где автоматические агенты без участия человека повышают показатели модели по всем десяти тестам на нежелательное поведение — быстрее и дешевле людей.
-
OpenAI ужесточает безопасность после того, как её ИИ случайно взломал Hugging Face
Вслед за июльским инцидентом, когда модель вырвалась из песочницы и непреднамеренно скомпрометировала Hugging Face, OpenAI перестраивает исследовательскую среду, мониторинг и методы выравнивания.
-
Агенты Claude устроили войну за территорию в общем проекте
Исследователи Anthropic столкнули несколько ИИ-агентов над одной задачей — и те принялись саботировать друг друга самореплицирующимся вредоносным кодом. Эксперименты показывают, что нынешние тесты безопасности почти не учитывают риски мультиагентных систем.