Спецслужбы США обвинили китайские ИИ-компании в промышленной «дистилляции» западных моделей

· Безопасность
АНБ, CISA и ФБР выпустили совместный бюллетень, в котором утверждают, что китайские разработчики систематически выкачивают возможности Claude, GPT, Gemini и Grok, чтобы обучать собственные модели дешевле и быстрее.

cover.svg

Три американских ведомства — Агентство национальной безопасности (АНБ), Агентство по кибербезопасности (CISA) и ФБР — выступили с совместным предупреждением. По их версии, китайские ИИ-компании ведут «систематическое извлечение» закрытых возможностей передовых американских моделей через атаки дистилляции, причём делают это в промышленных масштабах и с молчаливого одобрения властей КНР.

Сама по себе дистилляция — законный приём в исследованиях ИИ: одна модель обучается на ответах другой. Но, как подчёркивают авторы бюллетеня, речь идёт об агрессивном и целенаправленном варианте, при котором из чужих моделей вытягивают именно те функции, доступ к которым ограничен.

Кого назвали

В документе перечислены DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun и Z.AI. Утверждается, что с конца 2024 года они извлекли миллиарды токенов в ходе миллионов запросов к вариантам Claude от Anthropic, GPT от OpenAI, Gemini от Google и Grok. По каждой компании приведены конкретные обвинения: DeepSeek якобы обучала так свои R1 и V3, Moonshot AI — модели серии Kimi, Alibaba совершенствовала навыки программирования и работу с изображениями, а StepFun и Z.AI черпали данные из свежих версий Claude и GPT.

Как это устроено

Поскольку западные модели официально в Китае недоступны, разработчики, по версии ведомств, обходят географические ограничения через VPN, подставные аккаунты и автоматических агентов. Экономию обеспечивает оптовая закупка премиум-подписок, которыми пользуется целая команда. Запросы маскируют, распределяя их между разными провайдерами, облаками и сторонними агрегаторами, а на маркетплейсах Taobao и Xianyu расцвёл серый рынок прокси-серверов за пределами материкового Китая, работающих ретрансляторами.

Среди технических приёмов упоминаются извлечение цепочек рассуждений (chain-of-thought), автоматическое переключение между каналами при блокировках и системы оценки качества, способные распознавать защитные контрмеры. Результат — заметно более короткие сроки разработки и меньшие расходы на обучение собственных передовых моделей.

Что рекомендуют

Американским компаниям советуют внедрять комплексные механизмы обнаружения, незаметно искажать ответы при подозрении на злонамеренную дистилляцию и сопоставлять активность между разными провайдерами, чтобы выявлять распределённые кампании.

Это не первое подобное обвинение. Ещё в феврале Anthropic сообщала о промышленных кампаниях DeepSeek, Moonshot AI и MiniMax, а на этой неделе Google Threat Intelligence Group зафиксировала всплеск атак на свои модели — некоторые превысили 100 миллионов запросов.

Эксперт Arctic Wolf Исмаэль Валенсуэла призывает трактовать бюллетень как злоупотребление легитимным доступом, схожее по тактике с распределённым перебором учётных данных. По его словам, даже компании, далёкие от передовых моделей, напрасно считают проблему сугубо государственной: ключи API и служебные аккаунты становятся ценной мишенью, ведь злоупотребление доступом выглядит как обычная законная активность.


Источник: The Hacker News

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.