国产算力第一次把万亿参数级的模型稳稳托住了。海光信息宣布,已完成 Kimi K3在其 DCU 平台上的全栈适配与性能验证——这意味着,跑动这类庞然大物的,不再只是少数几款海外旗舰芯片。
海光 DCU 从底层算子一路优化到推理引擎,模型代码无需任何改动就能直接跑起来,迁移成本几乎压到零,开发者拿到算力即可上线部署,兼容性相当从容。针对 KDA 注意力与896专家组成的 MoE 架构,海光做了算子级的定制打磨;哪怕896个专家同时并行,在百万级上下文的重载场景下,推理依旧高效稳定,不会卡顿。

落到场景上,K3在海光 DCU 上能撑起长程智能体工程、视觉闭环创作乃至自主芯片设计这类前沿玩法,国产算力用户也终于能亲手跑通万亿级的开源模型。值得补一笔的是,月之暗面在发布 K3之前,便已联合海光与中科曙光完成了完整的兼容性调优:曙光基于海光 DCU 硬件栈,打通了 Kimi MoE 架构的分布式训练与多卡并行推理链路;海光 DCU 则靠底层硬件与软件栈的协同优化,在曙光8000集群上让长文本推理稳稳运行。
官方实测给出了一颗定心丸:国产卡的性能折损被控制在12% 以内,已经达到商用部署的门槛。当万亿模型与国产 GPU 之间的那道墙被推开一道缝,智能时代的算力版图,正悄悄挪动。
