Anthropic пресекла попытки обойти защиту Claude ради биооружия
Anthropic сообщила, что в этом году неоднократно пресекала попытки использовать её технологию для исследований, способных помочь в создании биологического оружия. В отчёте о злоупотреблениях своими моделями компания привела пять примеров, когда пользователи «обходили средства контроля» и старались «замаскировать» истинную цель своей работы, чтобы обмануть защитные механизмы. Часть этих пользователей находилась в странах, которым доступ к моделям Anthropic запрещён, — среди них названы Россия, Китай и Иран.
«Мы надеемся, что, поделившись этими примерами, спровоцируем разговор внутри отрасли и с правительствами о новых биологических рисках и способах им противостоять», — говорится в отчёте.
Один из описанных случаев — исследователь из «неподдерживаемого региона», который «неделями планировал» с помощью Claude эксперименты, связанные с птичьим гриппом. По словам компании, фильтры безопасности ограничили эту работу лишь самыми слабыми моделями. Все упомянутые аккаунты были заблокированы, но названий институтов и стран Anthropic не раскрыла.
Где проходит граница
Главная сложность, признаёт компания, в том, что она не может быть уверена в злом умысле фигурантов: те же сведения, что нужны для создания биологического оружия, годятся и для разработки вакцины. И даже если ИИ способен спроектировать теоретическое оружие, остаются практические преграды — суметь изготовить его и найти для этого ресурсы.
Отчёт вышел на фоне обострившихся споров о безопасности ИИ. На этой неделе из Anthropic уволился Джейкоб Коксон, заявив, что сотрудники «искренне верят: ИИ может убить всех нас к концу десятилетия». Тревога усилилась ещё раньше в этом году с выходом продвинутых моделей, а в июле обеспокоенность вызвала OpenAI, сообщившая, что её модели самостоятельно взломали площадку Hugging Face.
Не только биология
В том же отчёте Anthropic перечислила и другие злоупотребления: сеть поддельных приложений для знакомств, созданных для обмана пользователей, и системы слежки, предназначенные для выявления и мониторинга инакомыслящих.
Отдельно компания привела новые подробности о том, что семь лабораторий из Китая, включая Moonshot и DeepSeek, пытались воспроизвести её технологию методом дистилляции. Anthropic заявила, что фиксирует «всё более изощрённые способы обойти нашу защиту и перенять возможности передовых американских моделей».
Среди биологов и руководителей ИИ-компаний крепнет консенсус: по мере развития моделей применение ИИ в биологии необходимо защищать и регулировать. Эксперты опасаются, что технологией смогут воспользоваться террористы, государственные структуры или одиночки, чтобы создавать вирусы или высвобождать уже существующие опасные патогены.
Источник: Ars Technica
Комментарии
Войдите, чтобы комментировать.