美国联邦调查局、国家安全局和网络安全及基础设施安全局联合警告说,包括深度求索(DeepSeek)、月之暗面和阿里巴巴在内的六家中国人工智能公司,涉嫌通过大规模“知识蒸馏”(knowledge distillation)提取美国先进模型的能力,以降低自身模型的研发和训练成本。
三家机构星期二(9月8日)发布的18页联合网络安全公告说,这些行动至少从2024年底持续至今,涉及数百万次交互或请求,以及从Claude、ChatGPT、Gemini和Grok等美国前沿模型取得的数十亿词元。
被公开点名的六家公司分别是深度求索、月之暗面、阿里巴巴、MiniMax、阶跃星辰和Z.AI。Z.AI的运营实体是北京智谱华章科技有限公司,通常也被称为智谱AI。
美方称,这些中国企业正在“以工业规模开展具有攻击性、恶意和针对性的蒸馏活动”,而且有关行动“很可能是在中国政府知情的情况下”进行。
中国外交部星期三否认美方指控。发言人毛宁说,中国人工智能的发展来自“高水平科技自立自强”,并敦促美国停止对中国进行“虚假指控和抹黑”。
这是首次由美国情报、执法和网络安全机构联合详细列出中国企业的名称、目标模型和操作方法,但公告没有说明中国政府具体如何参与,也没有公开可供外界独立核查的完整账户记录、服务器日志或其他底层证据。
什么是模型“蒸馏”
模型蒸馏本身是一种广泛使用的人工智能训练方法。开发者让规模较小的“学生模型”学习较大、能力更强的“教师模型”产生的答案,以较低的计算成本复制部分推理、编程或专业知识能力。
这一技术并不一定违法。例如,模型开发商可以利用自己的模型或获得授权的模型进行蒸馏。但争议焦点在于,相关公司是否未经许可大量收集专有模型输出、规避地域限制和安全措施,并违反服务条款,将取得的数据用于训练竞争产品。
三家美国政府机构发布的公告称,上述六家中国公司并非通过普通研究方式使用美国模型,而是利用虚假账户、第三方接口聚合商、云端服务以及被称为“中转站”的灰色市场代理,掩盖请求来源并绕过美国公司的使用限制。
公告还说,有关企业使用共享的高级订阅账户降低成本,在不同访问渠道之间自动切换,并清除请求中的企业身份信息。一些账户全天候运行,新注册后立即达到最大使用量,其流量和行为模式与普通个人用户明显不同。
三家美国机构称,DeepSeek从至少2024年底开始提取美国模型的推理、法律、写作和智能代理能力,用于训练R1和V3模型;月之暗面则被指利用数百万次交互,提取软件工程、数学、工具使用和计算机视觉能力,训练Kimi系列模型。
公告还指称,阿里巴巴使用Claude和GPT模型提升通义千问的编程、客户服务和智能代理能力;MiniMax、阶跃星辰和智谱也分别提取了美国模型的推理、代码生成和智能代理功能。
美方担忧军事和网络用途
美国三家机构称,这种大规模蒸馏可以让中国企业减少计算资源和研发投入,更快缩小与美国前沿模型之间的差距。这不仅会损害美国企业的知识产权和竞争优势,还可能增强中国的军事及网络攻击能力。
路透社7月的一项调查发现,部分与中国军方有关的研究人员曾利用美国先进模型的输出来训练本土人工智能系统,相关用途涉及监控、无人机、网络行动和战场决策。
美国人工智能公司此前也曾提出类似指控。Claude开发商Anthropic今年2月说,DeepSeek、月之暗面和MiniMax通过大约2.4万个虚假账户,与Claude进行了超过1600万次交互。
建议美国企业协调防御
三家机构建议美国人工智能公司加强账户身份验证,监测新账户突然出现的超高使用量、多个网络地址共享账户以及持续24小时运行等异常行为。
公告还建议模型公司、云服务商和应用程序接口聚合商共享可疑账户、网络地址和流量模式,并可在高度确定遭遇恶意蒸馏时,悄然降低返回答案的推理深度或改用能力较弱的模型,以减少被提取数据的训练价值。
这份公告发布之际,美国总统唐纳德·特朗普(Donald Trump)预计于9月24日在华盛顿会晤中国国家主席习近平。美中双方还在准备举行人工智能安全对话。中国企业大规模提取美国模型能力有可能将与知识产权保护、模型访问限制及军事用途成为两国AI对话中讨论的议题。
评论区