星火X2.5:全国产算力闭环上的MoE跃迁

来源:爱集微 #科大讯飞# #星火X2.5# #MoE架构# #训练效率# #攻击性定价#
874

引言

2026年9月7日,科大讯飞发布星火X2.5大模型。在总参数2930亿、激活参数仅300亿的MoE架构背后,是一次从"参数规模"到"能力密度"的叙事转向,更是一场关于全国产算力能否撑起大模型产业闭环的关键验证。

研究发现,星火X2.5的意义远超单一产品发布:

其一,它将"全国产算力"从政治叙事首次直接翻译为价格优势——限时输入价约为GPT-6的1/44;

其二,训练效率从对标A800集群的30%攀升至93%,证明国产算力经深度工程优化后可达国际相当的有效算力水平;

其三,官方全程缺位第三方权威跑分,能力提升仍主要依赖官方自述,透明度之困尚未破解。

星火X2.5的发布,折射出中国大模型产业坐标的深层位移:竞争重心正从"谁的参数最大"转向"谁的闭环最完整、谁的落地最扎实"。但它也提出了一个尖锐的问题——在缺乏可比较基准的前提下,"全国产算力闭环"这一差异化叙事,能否真正转化为可持续的产业竞争力?

1. MoE 293B-A30B与能力优先:星火X2.5的技术内核与X系列演进

2026年9月7日,科大讯飞正式发布星火X2.5大模型。这并非一次常规的版本迭代——在总参数2930亿、激活参数仅300亿的混合专家(MoE)架构背后,是讯飞从X1到X2.5历经四代、不到两年时间完成的技术跃迁路线图。它折射出的行业信号是:中国大模型竞赛的叙事重心,正从"参数规模"转向"能力密度"。

MoE架构:293B容量与30B消耗的解耦术

星火X2.5的核心架构选择是MoE(Mixture of Experts),官方型号标注为"293B-A30B",即总参数约2930亿,单次推理仅激活约300亿参数,支持256K上下文窗口,覆盖200余种语言。

MoE的核心思想是"条件计算"——不同输入激活网络的不同部分,而非让每个token通过全部参数。路由器(Router)根据token特征,从多个并行的"专家"子网络中选择top-k个参与计算,从而将模型的知识容量与每token计算量解耦(AcingAI)。这意味着星火X2.5以30B规模的推理成本,获取了接近293B规模的知识容量——激活比例约10.2%,高于DeepSeek-V3的5.5%,但显著低于Mixtral 8x7B的27.6%。

这一设计并非讯飞独有。2024-2025年,MoE已成为前沿大模型的"既定默认架构"。DeepSeek-V3以671B总参数/37B激活参数的组合,仅约560万美元训练成本就达到GPT-4级竞争力;Qwen3系列则同时提供235B-A22B和30B-A3B两种MoE变体。星火X2.5的差异化在于:它没有追求DeepSeek-V3式的671B极限规模,而是在293B这个更可控的体量上,将算力效率、国产适配和场景能力做到极致。

模型

总参数

激活参数

激活比例

架构特征

星火X2.5

293B

30B

~10.2%

全国产算力训练

DeepSeek-V3

671B

37B

~5.5%

256专家+1共享,Top-8

Qwen3-235B

235B

22B

~9.4%

无共享专家

Mixtral 8x7B

46.7B

12.9B

~27.6%

8专家,Top-2


代码与智能体:从"能聊"到"能干"的能力跃迁

星火X2.5的发布说明反复强调两个关键词:代码和智能体。这并非随意的功能列表——它指向大模型从"问答工具"向"任务执行系统"的范式转移。

在代码能力上,端侧模型Spark-X2.5-4B在SWE-Bench Pro评测中取得44.4分,超越参数量2-3倍更大的Qwen3.5-9B(33.8分)和Gemma4-12B(21.9分);在AIME 2026数学评测中达到90.7分,同样领先于更大的同类模型(HuggingFace模型卡)。在智能体维度,4B端侧模型在τ³-bench(2026年3月发布的最新版智能体基准,含知识检索和语音评测维度)取得30.4分,大幅领先参数量两倍多的Qwen3.5-9B(9.3分);BrowseComp取得40.9分,同样显著超越2-3倍体量的竞品。

不过,媒体实测也暴露了短板。智东西的实测显示,星火X2.5在HTML枪战游戏开发任务中首次生成的版本缺失了"敌人"这一核心元素,经补充提示后才修复;3D创作任务"鹈鹕骑自行车"则多次运行未能成功交付;网页前端搭建虽能完成基本结构,但排版和产品质感"与成熟的商业购物网站仍有一定差距"。一位AIGC开放社区分析人士指出,截至发布时"暂未看到一份针对293B-A30旗舰模型的完整技术报告"和"覆盖主流代码和智能体基准的详细成绩表","能力提升"目前仍主要停留在官方产品描述层面。

X系列演进:四代迭代的技术逻辑

星火X系列的迭代节奏堪称密集,每一代都承载着明确的技术命题:

X1(2025年1月):中国首个基于全国产算力平台训练的深度推理模型。它用"更少的算力实现业界一流效果",多项指标国内第一,中文数学能力国内第一。这一代确立了讯飞"全国产+深度推理"的技术路线。

X1.5(2025年11月):首次引入MoE架构,总参数293B/激活30B,推理效率相比X1提升100%。覆盖130+语种,整体性能达GPT-5的95%以上。讯飞在此攻克两大难题:据官方发布,深度推理训练效率从30%提升至84%以上,以及MoE模型全链路训练效率大幅提升。

X2(2026年2月):继承293B MoE架构,但通过权重量化、低精度KVCache、VTP(Virtual Tensor Parallel)、分层通信等工程创新,实现了国产大EP(Expert Parallelism)并行部署,推理性能较X1.5再提升50%,量化后单台昇腾服务器即可运行。

X2.5(2026年9月):延续293B-A30B架构,未做参数规模扩张,而是"持续打磨底座",将代码与智能体能力列为重点提升方向。256K上下文、200+语言覆盖,端侧模型原生支持100万Token上下文。

值得注意的是,从X1.5到X2.5,总参数和激活参数始终保持在293B/30B不变。这意味着讯飞选择了"参数不增、能力优先"的路径——在架构不变的前提下,通过后训练优化(MOPD多目标偏好蒸馏)、数据质量提升和工程化创新来驱动能力增长(DataLearner;HuggingFace模型卡)。有分析认为,这反映了讯飞"赌的是效率和国产基础设施将胜过纯粹规模"的战略判断。

"大容量+小消耗"的设计哲学

星火X2.5的293B-A30B配置,是"大容量+小消耗"设计哲学的典型实践。MoE架构使模型知识容量与推理成本实现解耦:293B的总参数提供了足够大的"知识库",而30B的激活参数则确保了推理的经济性(AcingAI)。这一思路与DeepSeek-V3的671B/37B一脉相承,但讯飞选择了更适中的体量——既不像DeepSeek-V3那样需要约1.3TB FP16内存存储全部权重(AcingAI),又比Mixtral 8x7B的46.7B提供了更大的知识容量。

在端侧,这一哲学体现得更为极致。星火X2.5-4B采用1层全注意力与3层滑动窗口注意力交替的混合注意力架构,以极低计算开销原生支持100万Token上下文,据公开信息成为端侧模型中首个具备该能力的产品(DEV社区官方公告;HuggingFace模型卡)。其4B端侧模型在多项评测中以1/2至1/3的参数量匹敌更大模型,验证了"小消耗也能出大能力"的可行性(HuggingFace模型卡;DataLearner)。

2. 从30%到93%效率:全国产算力闭环的产业链突围

2023年10月24日,合肥南岗一栋占地7000平方米的机房楼内,632个机柜、3.5万根光电缆构建起总算力3200P的万卡集群——"飞星一号"正式点亮。这是中国首个全国产万卡算力集群,由科大讯飞与华为联合打造,标志着国产算力从"单卡可用"迈入"万卡级集群可用"的新纪元。

合作模式演进:从两方攻坚到三方共建

飞星一号的诞生并非传统的供应商采购关系,而是一种华为与讯飞深度协同的攻坚模式。2023年5月,华为董事杨超斌赴合肥参加星火1.0发布会后向任正非汇报,任正非随即点名成立专项工作组,派出三位董事和多位总裁前往讯飞,将原本的平台部门协作升级为公司高层牵头的战略合作(首个国产万卡智算集群是如何炼成的)。2024年飞星二号启动时,代表合肥国资的合肥市大数据公司入局,合资成立合肥智算算力科技有限公司(注册资本3.5亿元,股东为科大讯飞旗下安徽讯飞云创与合肥市大数据资产运营有限公司),由此形成"华为负责硬件底座、讯飞负责模型适配、地方国企负责运营"的三方合作架构。双方在"百日攻坚"期间天天蹲在机房调参数、改代码,而非仅签合同交付。这种深度融合模式成为后续国产算力生态建设的范本。

2024年10月24日,在飞星一号基础上拓展的"飞星二号"正式启动,计划扩展智算集群规模并持续适配新模型新算法,首批算力于2025年交付试用。从飞星一号到飞星二号,不只是算力规模的扩容,更是从"万卡可用"向"超大规模智算可用"的跃迁。

技术栈构成:昇腾芯片与CANN软件栈

后续升级的昇腾910C于2025年第一季度量产商用,随后在Atlas 900超节点上实现规模部署。市场分析称910C可能采用Chiplet封装技术整合两颗910B、基于中芯国际第二代7nm工艺制造、集成约530亿晶体管,但上述工艺细节、FP16算力区间(市场推测约640-800 TFLOPS)及整体国产化率等参数均未经华为官方正式披露;产业链传闻称其生产良率约40%。

不过,昇腾910B与英伟达H200之间存在显著硬件差距:910B显存64GB、带宽1.6TB/s,而H200为141GB、带宽4.8TB/s,显存差距约2.2倍、带宽差距约3倍;在长上下文训练场景(超256K tokens),据科大讯飞官方称国产加速器效率最多可能比H200低约5倍。这些硬件限制是新模型训练过程中"算子差异、分布式策略、训练推理精度一致性对齐"等难题的根源。

训练效率跃升:从30%到93%的关键突破

飞星一号上线之初,国产算力集群的开箱训练效率仅为同规模英伟达集群的约30%。经过算子优化、分布式策略调整和工程调优,训练效率逐步攀升。

科大讯飞在投资者互动平台披露了关键数据:通用大模型训练效率从最初对标A100的30%-50%优化至85%-95%以上;2025年以来攻克了两座"大山"——长思维链强化学习训练效率从对标A800的30%提升至84%以上,MoE模型全链路训练效率从2025年3月对标A800的30%提高到93%。业绩说明会PPT进一步展示了MoE训练效率的逐步爬升路径:从开箱基线约20%起步,经FuseOP、数据排布、FA Slice、CP通算融合、算子库升级、MC2、Select-RC、TensorOffload、多流通信等约25个优化步骤逐步提升,最终达到93%。

飞星一号万卡集群的负载率均值达84.59%、峰值91.53%,持续稳定运行支撑了星火大模型的多次重要迭代。这一效率跃升的意义在于:它证明国产算力不仅"能用",而且经过深度工程优化后可以达到与英伟达集群相当的有效算力水平。

央国企市场双第一:商业化验证

训练效率的突破直接转化为市场竞争力。据沙利文(Frost & Sullivan)发布的报告,2025年大模型市场披露中标金额达295.2亿元,科大讯飞以210个中标项目、23.16亿元披露金额蝉联中标数量和金额"双第一",披露金额占TOP6厂商的52%,超过第二名至第六名的总和(科大讯飞大模型中标数量与金额稳居全国第一 )。科大讯飞在央国企大模型招投标中连续两年蝉联第一,2025年中标金额超过第二名至第六名的总和(科大讯飞2025年度大模型中标数据)。

央国企是大模型招投标的核心采购方(沙利文报告称B端及G端客户贡献约89%的采购规模,其中央国企为核心采购群体),是国产替代的核心市场。科大讯飞能在此领域碾压手握十几万张英伟达显卡的头部大厂,关键在于全栈自主可控构筑的安全底座——对极度重视数据与供应链安全的央国企而言,这是"安心的选择"。

全闭环的产业价值:AI主权与数据安全

全国产算力的深层意义在于"训练→推理"全闭环对AI主权的保障。国家数研院专家指出,国产算力链的价值不仅是"更便宜",更是"更可控"——成本、数据、供应链三重可控,这才是真正的护城河(国产算力链价值不仅"更便宜"还"更可控")。国务院国资委2026年部署央企"AI+"专项行动时明确,央企要"切实当好我国智算基础设施的重要供给者",推动自主可控模型构建加速突破)。科大讯飞董事长刘庆峰多次在公开场合表述类似观点:"不能将自己的大楼建在别人的院子里,也不能在沙滩上建造大厦"。

这一全闭环的价值在能源等高敏感行业尤为凸显。中国石化携手天翼云完成DeepSeek-V4-Pro全栈国产化部署时,强调"核心AI模型与工业数据必须在安全隔离、全栈国产化环境运行",打造了"国云+国芯+国模"融合落地新典范。对于油气勘探、炼化工艺等涉及国家能源安全的场景,数据不出域、模型可审计、供应链可追溯的闭环能力,是任何性能指标都无法替代的刚性需求。

3. 约1/44定价与缺位跑分:竞争坐标、争议短板与端侧生态布局

星火X2.5发布会的一个反常细节比参数本身更值得琢磨:官方全程未公布一张基准跑分表,取而代之的是一张定价表和一批第三方实测。这场信息结构的变化,折射出大模型竞争正从"能力代差"转向"性价比代差"的产业座次重排。

攻击性定价:约1/44的输入价在赌什么

星火X2.5在讯飞星辰MaaS平台上线,限时五折后输入1.6元/百万Token、缓存命中0.24元/百万Token、输出6元/百万Token。按1美元≈7.1元人民币折算,输入价约合0.23美元——而OpenAI最新旗舰GPT-6 Astra的输入定价为10美元/百万Token、输出50美元/百万Token),星火X2.5的限时输入价约为其1/44、输出价约为其1/59。即使是原价(输入3.2元、输出12元),也只有GPT-6输出价的约1/30。

这场定价策略打出三张牌。第一张是"缓存经济":0.24元的缓存命中价仅标准输入的15%,梯度设计直指长会话与多轮Agent任务——上下文越长、重复越多,缓存省得越狠。智东西实测中,一项238.8万Token的游戏开发任务,缓存读取占227.9万(95.4%),0.24元的缓存价在真实任务中的杠杆效果比任何价格表都有说服力。第二张是"行业客户而非开发者极客":讯飞基本盘在教育、医疗、车载、办公,采购逻辑是"预算内可用"而非"榜单第一"。第三张是"国产算力的成本转译":全国产算力训练的意义此前多被表述为政治叙事,但这次第一次被直接翻译成了价格——没有先进制程禁运焦虑的成本结构,才能撑起1/59的输出定价。

竞争坐标:参数、激活与生态位的错位对比

将星火X2.5放入竞争坐标,其生态位呈现出明显的错位特征。293B总参数、30B激活的MoE架构,与DeepSeek-V3(671B总参数、37B激活)和Qwen3-235B-A22B相比,激活参数体量接近但总参数更小。DeepSeek-V3的API定价更低(输入约0.28美元、输出约1.13美元/百万Token,按1美元≈7.1元折算;注:截至2026年9月DeepSeek主力模型已迭代至V4,V3为旧款),而Qwen3.7-Max定价更高(输入约1.69美元、输出约5.07美元)且在多项共享基准上得分领先(LLM Stats对比)。但星火X2.5的差异化不在参数规模或榜单排名,而在"全国产算力闭环+端侧开源"的组合——这是DeepSeek和Qwen均未具备的属性。

值得注意的是,与Qwen3.7-Max的直接对比显示,星火X2.5在"全国产自主可控+端侧1M上下文"维度具有独特优势,而Qwen在多模态融合与长周期自治Agent方面更强。这种错位意味着星火X2.5并非在争夺"最强模型"的席位,而是在争夺"自主可控+足够便宜+足够好用"的行业落地席位。

争议与短板:缺位跑分与透明度之困

星火X2.5最大的争议在于:官方全程未公布任何公开第三方权威基准跑分——无MMLU、无HumanEval、无SWE-Bench Verified排名。能力提升全部为官方自述,缺乏可比较的量化锚点。智东西的实测呈现了相当"诚实"的能力画像:HTML枪战游戏首版7分钟完成但缺少敌人,一轮反馈后补齐核心功能,可玩性较高;网页前端6分钟搭起基本框架但排版粗糙、缺手机质感;数学推理正确解答AIMO参考题;3D创作("鹈鹕骑自行车")则多次运行失败、最终未交付(智东西一手实测)。

第二个争议在于国产算力细节不透明。"全国产算力训练"极具战略意义,但芯片型号、集群规模、训练时长、算力利用率等关键细节全部未公开。此前讯飞的国产算力体系以华为昇腾为主,但本次发布会未点名具体芯片型号。有分析指出,五折是营销手段,原价12元/百万Token仍只有GPT-6的1/30,这才是真实成本结构的表达——但价格优势能否守住,取决于未来两个季度国产芯片的供应稳定性与软件栈成熟度。

对于端侧模型,官方GitHub仓库发布了一张完整的智能体与推理基准测试表,但需注意:"这些数据全部由厂商自行报告且未经复现"(注:上述端侧模型benchmark数据均由厂商自行报告,截至发布时未经独立第三方复现)。在厂商自报数据中,Spark-X2.5-4B在SWE-Bench Pro得分44.4(官方评测表所列模型中最高)、BFCL-V4函数调用65.1、AIME 2026达90.7,需注意benchmark版本差异:在τ³-bench(2026年3月发布的最新版智能体基准)上,Spark-X2.5-4B以30.4分大幅领先Qwen3.5-9B(9.3分);而在较早的τ²-bench及GPQA上,Spark-X2.5-4B得分低于参数量两倍多的Qwen3.5-9B——它在智能体新基准上表现突出,但在传统推理基准上仍有差距(HuggingFace官方模型卡;DataLearner)。

端侧布局与生态兼容:从协议适配到硬件闭环

星火X2.5的端侧布局是其生态闭环的关键一环。9月1日开源的X2.5-4B和1.7B两款端侧模型,原生支持最长100万Token上下文——据公开信息成为端侧模型中首个具备此能力的产品)。1.7B版本在Domux智能家居测试集上实现90.3%的端到端控制指令正确率、平均响应0.85秒。0.85秒的延迟数字比正确率更重要——用户对音箱说"关灯",等三秒才响应,体感就是坏了。

生态兼容策略上,星火X2.5 API原生支持Anthropic和Responses协议,开发者可快速接入OpenClaw、Claude Code、Codex、Hermes、Grok Build、Pi Agent等第三方Harness框架,原有工作流完全不用改即可替换讯飞后端。端侧模型则支持英伟达、华为昇腾、海光、后摩等多元硬件平台,兼容vLLM、SGLang、llama.cpp框架,可通过Ollama、LM Studio快速部署,并支持LLaMA-Factory增量训练,采用Apache 2.0开源协议。

这套"云端旗舰256K+端侧原生1M"的分工设计逻辑清晰:基座293B-A30B覆盖绝大多数工程与Agent会话,端侧4B/1.7B塞进手机、车机、办公设备本地跑,对应隐私敏感与离线场景。云上省钱、端上管饱,两条线的商业化逻辑各自成立。配合讯飞已推出的桌面级智能助理Loomy及AI智能体产品矩阵,讯飞正在构建从底座模型到端云协同的完整生态闭环。

结论

星火X2.5的产业意义,不在于它是否在某一榜单上登顶,而在于它用一条完整的"全国产算力训练→MoE架构→攻击性定价→端侧开源"闭环,重新定义了中国大模型的竞争维度。

第一,全国产算力闭环的价值已从"战略叙事"转化为"经济事实"。训练效率从30%攀升至93%,成本优势直接体现为1/44的输入定价。央国企大模型市场23.16亿元的中标金额连续双第一,证明"成本、数据、供应链三重可控"的闭环价值已获市场用脚投票。

第二,"参数不增、能力优先"的路径获得验证。从X1到X2.5,总参数始终维持在293B/30B,但代码与智能体能力持续提升,4B端侧模型以1/2-1/3参数量匹敌2-3倍竞品(HuggingFace模型卡;DataLearner)。MoE架构"大容量、小消耗"的解耦设计,正在成为行业共识。

第三,透明度短板仍是闭环叙事的阿喀琉斯之踵。官方全程缺位第三方权威跑分,智东西实测暴露3D创作失败、网页排版粗糙等能力盲区(智东西一手实测)。国产算力细节——芯片型号、集群规模、训练时长——全部未公开。

未来研究应聚焦两点:一是推动国产算力训练大模型参与国际标准化基准评测,以可比较数据消除"自说自话"质疑;二是持续追踪昇腾910C等国产芯片的供应稳定性与CANN软件栈成熟度,这将决定约1/44的定价优势能否守住)。全国产算力闭环不是终点,而是一场仍在进行中的产业实验。

责编: 爱集微
来源:爱集微 #科大讯飞# #星火X2.5# #MoE架构# #训练效率# #攻击性定价#
THE END

*此内容为集微网原创,著作权归集微网所有,爱集微,爱原创

关闭
加载

PDF 加载中...