摩尔线程携手趋境科技建AI Token工厂,国产异构算力性价比领先
9月3日,国产全功能GPU企业摩尔线程与AI基础设施公司趋境科技签署战略合作协议,宣布围绕国产算力与高品质AI Token工厂展开深度合作。双方将以摩尔线程MTT S5000智算卡、MUSA软件平台,与趋境科技自研的国产PD异构推理系统、ATaaS平台及Token Pod超节点为基础,推出软硬一体化的联合解决方案。

所谓PD异构,指的是把大模型推理的Prefill(预填充)与Decode(解码)两个阶段解耦,分配到不同类型的算力上执行。摩尔线程MTT S5000凭借高密度AI算力与原生FP8精度,承担Prefill阶段的输入计算与KV Cache生成,与负责Decode的高带宽GPU协同,既减少对高成本资源的占用,也避免按峰值需求堆砌基础设施。依托共享KV Cache、流量感知配置与弹性扩展,Token Pod可适配国产及国际主流硬件组合。

据双方披露,该方案已正式投产,承接头部模型厂商官方业务的真实Token流量。在国产头部大模型业务场景中,实测实现平均超50TPS的生成速度、90%以上KV Cache命中率与99.9%的服务稳定性,同时保障低首Token时延。在同等生产服务标准下,整体性价比优于国际先进算力方案,标志着国产PD异构推理率先进入规模化生产应用阶段。
随着大模型进入规模化商业落地期,算力竞争已从单卡性能转向系统级Token生产效率——每枚高品质AI Token的综合生产成本,成为衡量方案价值的核心。此前,腾讯与甲骨文签署70亿美元算力租赁协议,折射出行业对先进算力的旺盛需求;而DeepSeek联合华为开源CUDA替代方案,则代表了另一条国产算力自主路径。在外部供给承压的背景下,国产异构路线正试图用架构级优化而非单纯堆硬件,为万亿参数大模型的推理提供兼顾性能与成本的本土技术路径。
读者评论 (3)
想参与讨论?请 登录 后发表评论。
别急着吹性价比,先看看Token单价能不能压到国际大厂一半
PD解耦真能跑通生产流量就赢了,别光吹参数
终于把PD解耦搞出真产品了,国产推理成本这块算终于有点真东西