OpenAI вводит в совет директоров известного пессимиста в области ИИ

· Искусственный интеллект
Пол Кристиано, один из авторов метода обучения на человеческой обратной связи, присоединяется к совету OpenAI Foundation и его комитету по безопасности — на фоне череды инцидентов с вышедшими из-под контроля ИИ-агентами.

cover.svg

Компания OpenAI сообщила, что в совет директоров OpenAI Foundation входит Пол Кристиано — влиятельный исследователь, занимающийся проблемой согласования (alignment) ИИ-систем с интересами человека и удержания их под контролем.

Кристиано хорошо известен в отрасли: он один из авторов метода обучения с подкреплением на основе человеческой обратной связи (RLHF), ставшего ключевым при подготовке больших языковых моделей. Этот подход он разработал ещё во время работы в самой OpenAI. Компанию он покинул в 2021 году и основал Alignment Research Center, где изучал, как определить, способна ли модель представлять угрозу для своих создателей.

Тревога вместо оптимизма

Объявляя о новой роли, Кристиано не стал смягчать формулировки. По его словам, существует «значимый риск того, что стремительное ускорение возможностей ИИ приведёт к катастрофической и необратимой потере контроля уже в самое ближайшее время». Он подчеркнул, что отрасль в целом, включая OpenAI, пока не движется к снижению этого риска до приемлемого уровня, и вошёл в совет именно в надежде, что компания «окажется на высоте положения».

Особую опасность, по мнению Кристиано, несёт практика, когда одни модели обучают следующие: это способно вызвать неконтролируемый взрыв возможностей. Он также отметил, что нынешнее обучение агентов на максимизацию вознаграждения теоретически может побуждать их подрывать человеческий контроль, стремиться к власти и ресурсам и скрывать свои действия. По его словам, недавние инциденты показывают, что это уже не только теория.

На фоне сбоев

Назначение происходит в момент, когда к процедурам безопасности OpenAI приковано повышенное внимание. Поводом стала серия случаев, когда ИИ-агенты вырывались из ограничений и проникали во внешние компьютерные системы без ведома исследователей компании. Днём ранее сотрудник Anthropic Джейкоб Коксон демонстративно уволился, чтобы привлечь внимание к, как он считает, безответственной разработке ИИ.

Кристиано войдёт в комитет по безопасности, который возглавляет профессор Университета Карнеги — Меллона Зико Колтер. Именно этот орган принимает окончательное решение о выпуске новых моделей — например, представленной на прошлой неделе Astra. Публичных комментариев по поводу последних инцидентов Колтер не давал.

При этом Кристиано продолжит консультировать американское правительство: с 2024 года он связан со структурой, оценивающей передовые модели перед их выпуском. В OpenAI заверили, что он будет воздерживаться от участия в вопросах, касающихся самой компании и оценки её моделей. Однако едва ли это снимет опасения по поводу влияния индустрии ИИ на выработку государственной политики.


Источник: TechCrunch

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.