Правительство США ввело жёсткие ограничения на экспорт передовых чипов в Китай — это должно помешать стране получать ключевые ресурсы для развития передовых AI-моделей. Однако данные и профессиональные знания для обучения AI-моделей практически не контролируются при трансграничном перемещении.
Американские компании из Кремниевой долины, которые сотрудничают с OpenAI, Anthropic и федеральными органами США, тайно продают ключевые данные для обучения AI-моделей ведущим китайским AI-лабораториям. Объём таких трансграничных сделок достигает нескольких сотен миллионов долларов.
Высококачественные данные — важнейший ресурс для улучшения AI-моделей, наряду с вычислительной мощностью. Как отмечает исследователь Allen Institute for AI Натан Ламберт, именно качественные данные делают модель практически применимой. Для обучения AI-систем сложным процессам — например, бухгалтерскому учёту или сетевым экспериментам — нужны не просто конечные результаты работы людей, а детали проектирования данных: какие сведения должны быть в центре внимания модели, а также детальные стандарты оценки, разработанные профессионалами.
Шесть крупнейших китайских AI-лабораторий ежегодно тратят около 500 млн долларов на покупку данных у американских компаний. При этом китайские лаборатории не считают друг друга прямыми конкурентами и действуют как объединённая группа покупателей западных высококачественных наборов данных.
Среди примеров сотрудничества — работа Tencent с Mercor: Tencent требовала от Surge AI закупить обучающие данные для финансового сектора, сетевой безопасности и AI-систем с возможностью самосовершенствования. Сотрудники Alibaba подтвердили соглашения о закупках с AfterQuery и Mercor, а Ant Group тесно сотрудничает с AfterQuery. Во втором квартале текущего года доходы Mercor от китайских AI-лабораторий составили 2% от общего дохода. AfterQuery получает из Китая не менее 50 млн долларов регулярного дохода. Исполнительный директор Surge AI Эдвин Чен лично ездил в Китай, чтобы обсудить углубление сотрудничества.
Американские поставщики данных продают китайским лабораториям как кастомизированные решения, так и стандартизированные наборы данных (OTS). Эти наборы создаются на основе «каналов знаний» (knowledge pipelines), которые изначально разрабатывались для OpenAI и Anthropic. Китайские лаборатории, покупая OTS-наборы, экономят время на поиске и тестировании данных. Есть сведения, что китайские покупатели прямо просят американские компании продать им данные, уже закупленные ведущими американскими лабораториями.
Ситуация вызывает споры. Основатель Striker Venture Partners Макс Газор считает, что продажа данных китайским AI-компаниям — это моральный выбор для компаний. Издание «» характеризует текущую ситуацию в сфере регулирования как «Regulatory Wild West»: в отличие от строгих ограничений на экспорт чипов, трансграничное перемещение профессиональных знаний почти не контролируется. Часть представителей отрасли видят в этом угрозу национальной безопасности. Например, исполнительный директор Micro1 Али Ансари в соцсети X раскритиковал сотрудничество некоторых компаний по обработке данных с иностранными конкурентами, отметив прогресс китайских моделей вроде Kimi K3. Micro1 заявляет, что не продаёт данные за пределы США. Scale AI в 2024 году прекратила переговоры с ByteDance из‑за опасений по поводу национальной безопасности. В то же время противники ограничений на экспорт данных опасаются, что такие меры могут навредить экосистеме открытых ИИ в США и укрепить монопольное положение OpenAI и Anthropic.
Китайские исследовательские учреждения и военные структуры используют метод «моделиного дистилляции» (model distillation), чтобы получить результаты работы ведущих американских моделей (OpenAI, Anthropic) и обучить на них свои системы, в том числе оборонные и военные. Этот метод позволяет использовать выходные данные мощных моделей как материал для обучения более мелких специализированных моделей без затратных вычислений. Например, исследователи из подразделения 96941 Народно‑освободительной армии Китая использовали GPT‑3.5 от OpenAI для обработки чувствительных военных исходных кодов. В научных статьях описано, как с помощью выходных данных передовых американских ИИ‑моделей генерируются синтетические данные для обучения локальных моделей. Такие модели затем могут безопасно работать в закрытых военных сетях Китая.
Таким образом, в условиях ограничений на экспорт чипов поток «профессиональных знаний человека» и результатов логического вывода моделей становится ключевым элементом научно‑технологического соперничества между США и Китаем. <<<CODE_BLOCK_N>>> <<<IMG_N>>>
