AI蒸馏之争与开源跃升:透视全球大模型竞争格局之变

来源:爱集微 #AI模型# #主权AI# #上市公司分析#
670

核心观点

1、蒸馏是行业通用的知识迁移技术,争议核心不在技术而在数据获取方式。 蒸馏通过教师模型向学生模型迁移决策逻辑,被全球模型企业普遍使用;美方的指控实质是将一项正常技术和商业问题政治化,把未经授权的数据获取行为与蒸馏技术本身捆绑定性。

2、开源开放权重模式推动中国模型实现市场层面的整体跃升。 中国开放模型下载量占全球17%、首次超过美国的15.8%;阿里千问以20.45亿次下载登顶全球第一;OpenRouter上中国模型token调用量占61%,价格优势高达16.7倍,市场话语权已发生结构性变化。

3、蒸馏与开源互为表里,技术流动是双向的。 开源模型为蒸馏提供合法底座,蒸馏将前沿能力快速商品化;DeepSeek与Meta均蒸馏阿里千问,美方企业也在要求使用中国开源模型,"单向窃取"的叙事难以成立。

4、封堵与反制并行,开放权重令传统管制手段效力存疑。 美方构建"公告+立法+联盟"的封堵体系,中方以"科技霸权、算力垄断"定性回应并保留反制权利;模型可复制、可传输的特性,决定了这场博弈难以复制芯片管制的剧本。

美东时间2026年9月8日,美国国家安全局(NSA)、网络安全与基础设施安全局(CISA)与联邦调查局(FBI)联合发布网络安全公告AA26-251A,指控DeepSeek、月之暗面(Moonshot AI)、阿里巴巴、MiniMax、StepFun、Z.AI六家中国企业,自2024年底以来通过"transfer station"代理网络、思维链提取、自动化故障转移等工业化手段,从Claude、GPT、Gemini等美国前沿模型中获取了数十亿token,开展"工业规模"蒸馏。公告罕见地将一项行业通用技术写入国家安全文件,称相关活动"是中国AI发展战略的核心内容而非附带内容",且可能在政府知情下进行。9月9日晚间,中国商务部回应称,美方所谓指控无凭无据,蒸馏是包括美国企业在内的全球模型企业普遍使用的正常技术,美方此举是在人工智能领域推行科技霸权、搞算力垄断、打压竞争的又一明证,中方对此坚决反对。

一纸公告,让"蒸馏"(distillation)这项原本安静运行在无数实验室与生产线上的通用技术,被推上中美科技博弈的最前台。要判断这场争议的走向,需要回到蒸馏技术与开源生态的本源,看清全球大模型竞争格局的真实变化。

蒸馏之辩:一项通用技术缘何成为"安全指控"

蒸馏是当前大模型产业的标准工艺之一。据昆仑万维年报描述,蒸馏是让较小的"学生模型"从较大的"教师模型"中学习决策逻辑,而非仅学习数据标签的知识迁移技术;DeepSeek-R1正是通过蒸馏技术实现高性能、低资源需求,大幅降低了端侧AI的商业部署门槛。对企业而言,蒸馏意味着用更小的模型、更低的成本获得接近大模型的能力:Airbnb首席执行官曾公开表示,借助蒸馏等技术,公司将AI成本降低了30%至40%。

事实上,蒸馏的"师承关系"早已跨越国界。DeepSeek在发布R1时曾同步推出六个小尺寸蒸馏模型,其中四个直接基于阿里千问(Qwen)系列蒸馏而来;一度占据开源霸主地位的Meta,也被承认蒸馏了阿里千问。这正是中方回应的底气所在——正如商务部所指出的,蒸馏是"包括美企在内全球模型企业都在用"的正常技术。

美方公告的指控并非针对蒸馏技术本身,而是针对数据获取方式。美国AI企业Anthropic发布的报告称,阿里、月之暗面与DeepSeek对Claude模型开展了持续的蒸馏攻击;据其披露,相关攻击通过约2.4万个虚假账号产生了超过1600万次Claude交互,违反了服务条款与地区访问限制。用虚假身份批量绕开授权体系获取模型输出,这才是美方叙事中"越界"的部分。

值得注意的是美国业内对蒸馏的另一种定性:有分析认为,蒸馏的本质是获取训练数据而非参数能力,对中国企业而言,它是一种"追赶工具而非超车工具"。这种观点提示,蒸馏决定了追赶的速度,但不决定能力的天花板。DeepSeek创始人梁文锋在《Nature》发表的论文中,通过纯强化学习与蒸馏技术验证了模型自主进化的可能性,审稿人将其评价为"R1开启了一场革命"。真正的能力跃升,来自开源生态与自主创新,而非单纯的蒸馏——这也是理解下一节市场格局变化的关键。

开源跃升:中国模型从"跟随者"到"市场主导者"

能力层面,中国前沿模型的追赶速度有目共睹。知识库资料显示,DeepSeek自2023年5月成立以来,模型智能指数(100分制)从最初的DeepSeek LLM 67B的20分,经过V2的45分、V3的58分,迅速跃升至R1-0528的68分,跻身全球AI实验室第二梯队,成为开源权重领域的领导者。斯坦福大学HAI研究所的报告显示,中美顶尖模型性能差距已从2023年的20%缩窄至2024年底的0.3%,在数学、编程等关键基准上已无实质差异。

三年间智能指数提升逾两倍,说明中国模型的能力积累并非依赖单一的蒸馏捷径,而是训练体系、数据工程与强化学习共同作用的结果。

市场层面,开放权重模式带来了更具戏剧性的变化。麻省理工学院与Hugging Face的联合研究显示,中国开放模型的下载量已占全球17%,首次超过美国的15.8%。

"开放"市场的占有率易主,意味着全球开发者获取AI能力的默认来源正在改变,这是比单项基准测试更深层的话语权转移。

具体到模型家族,阿里千问的登顶最具标志性。Qwen系列在Hugging Face的累计下载量达20.45亿次,衍生模型超过15.1万个,是Meta同期的2.6倍;相比之下,谷歌Gemma为4.18亿次,Meta Llama为2.27亿次。

下载量与衍生模型数量代表生态的"再生产"能力——15.1万个衍生模型意味着全球开发者正基于中国模型构建自己的产品,而非仅仅下载试用。

调用量与价格进一步印证了这种渗透的深度。模型调用平台OpenRouter的数据显示,中国开源AI模型的token使用量已居全球榜首,结束美国主导地位,DeepSeek、Kimi、GLM等中国模型合计占平台总调用量61%:其中MiniMax M2.5处理4.55万亿token,Kimi K2.5达1.21万亿,GLM-5为7800亿。而在2025年中,中国开源模型在全球应用总量中的占比还只有33.3%,其中DeepSeek使用率最高,其次是Qwen——从三分之一到六成以上,只用了一年多时间。

价格的差距同样惊人。MiniMax M2.5与GLM-5的每百万输入token定价仅0.30美元,而Claude Opus 4.6为5美元,两者相差16.7倍。

低价与开放权重的组合,使AI能力加速进入企业、消费者以及亚洲、非洲、中东和拉美市场。2025年7月,全球十大开源模型中中国一度占据九席;从拉各斯到吉隆坡,预算有限的开发者纷纷转向中国开源模型——去年5月,马来西亚通讯部副部长公开表示,该国国家级AI基础设施将依托DeepSeek技术搭建。

封堵与反制:从"公告点名"到"立法制裁"

面对市场格局的变化,美方正在构建一套"公告+立法+联盟"的封堵体系。行政层面,美国国务院已下令在全球范围内开展行动,外交电报指示外交人员向各国表达对"敌手们提取和蒸馏美国人工智能模型"的担忧;白宫科技政策办公室主任克拉齐奥斯在备忘录中写道,"美国政府掌握的信息表明,主要位于中国的外国实体正在蓄意开展工业规模的蒸馏运动"。立法层面,众议员比尔·惠曾加等人提出《遏制美国人工智能模型盗窃法案》,拟对被认定通过蒸馏获取美国模型能力的中国企业实施制裁。产业层面,英伟达今年3月成立Nemotron Coalition,集结Mistral、Thinking Machines Lab、Perplexity等开放模型开发商应对中国开放模型的崛起;获25亿美元估值的Reflection AI则自称要做"西方的DeepSeek"。

中方的回应则将问题重新拉回技术与社会常识层面。商务部在9月9日的答记者问中表示,美方将"蒸馏"这一包括美企在内全球模型企业都在用的正常技术和商业问题政治化、工具化,并在实践中搞双重标准,中方坚决反对。早在7月27日,商务部就美方拟对中国AI企业调查制裁答记者问时便援引了美国业界的表态——一些美国大型跨国企业明确表示,模型蒸馏是行业广泛应用的技术,应允许美国企业使用中国开源人工智能模型。

封堵逻辑存在明显悖论:Meta蒸馏千问、美企要求使用中国开源模型的事实说明,技术流动从来是双向的;而在0.30美元对5美元的价格落差面前,行政命令很难改变全球开发者的理性选择。

蒸馏与开源交织下的竞合走向

蒸馏与开源的结合,正在改写AI能力扩散的规则。开源为蒸馏提供合法底座——开放权重模型允许自由下载、微调与二次训练,基于Qwen蒸馏在多数司法辖区并无法律障碍;蒸馏则将前沿能力快速商品化,把少数实验室垄断的智能转化为普惠的生产要素。两者相乘,解释了中国开放模型为何能在一年多的时间里,将全球下载量占比从追随者位置推至第一。

这也决定了管制工具的局限。芯片是实体商品,可以靠出口管制与供应链追踪限制流通;模型则是可复制、可传输的比特,开放权重一旦公开便难以撤回,传统出口管制对"已开源的能力"几乎无从下手。美国可以限制最先进芯片流向中国,却难以限制其他国家下载Qwen——这正是"主权AI"叙事在南方国家兴起的现实土壤,也是美方公告难以阻止市场选择的结构性原因。

后续有两个观察点。一是美方公告发布后,执法与立法的落地速度,以及中方反制措施的力度与指向;二是双方能否将蒸馏争议与AI安全对话分开处理,为前沿模型安全事件保留政府间沟通渠道。在技术平权与地缘管制的角力中,蒸馏与开源的故事才刚刚揭幕——最终决定胜负的,并非公告和法案,而是谁能向全球开发者提供更好用、更便宜、更开放的模型。

责编: 张轶群
来源:爱集微 #AI模型# #主权AI# #上市公司分析#
THE END

*此内容为集微网原创,著作权归集微网所有,爱集微,爱原创

关闭
加载

PDF 加载中...