- 技术 :
- 应用 :
国产算力龙头,最新词元加速方案将发布
2000年,诺兰拍了一部电影叫《记忆碎片》,主角患了顺行性遗忘症,记不住任何新东西,每做一件事,都要把前面的全部重推一遍,活得极其辛苦。
26年后的今天,全球最聪明的AI大模型有时也会重蹈《记忆碎片》中主角的“失忆症”,会重复计算。
为了解决推理过程中的重复计算问题,就在今天,中科曙光相关人士透露,公司将发布面向大模型推理的新一代词元加速方案。
GPU崇拜
过去三年,谈AI必谈卡。谁的GPU多,谁就是赢家。
但这个逻辑正在被优化。在十万卡规模的集群里,数据供给往往比芯片更早变成吞吐的瓶颈。中科曙光副总裁魏振国指出,在高并发推理场景下,瓶颈来自数据搬运、存储I/O、网络时延、散热能耗和任务调度,"Token效率的关键不在于单一芯片,而在于系统级协同"。
卡堆得越多,墙撞得越早。

如今,Token需求端在疯狂增长。第三方平台OpenRouter的数据显示,仅OpenClaw一家智能体,单周词元消耗量就相当于2025年第四季度全平台周均的60%。智能体每完成一次任务,要来回调用成百上千次模型,每一次调用,都是一次真金白银的算力消耗。
而大模型每生成一个新词,都要回头参考前面所有词的信息。前面已经算过的东西被反复重算,是推理延迟里很大的一块损耗。你跟AI聊到第100句话,它把前99句的计算翻来覆去一遍又一遍。
这正是中科曙光即将发布的词元加速方案要动刀的地方,重点处理推理过程中的重复计算和数据调度问题。据财联社报道,该方案将在2026数博会期间发布,依托存算协同理念,提高大模型词元处理效率与算力利用率。
把“记忆”放在GPU身边
中科曙光解题思路就是,既然AI记不住,那就替它记。
中科曙光开发的国内首个全国产十万卡AI超算集群曙光8000(登峰)已经在做这件事。它通过KVCache卸载、GDS(GPU直通存储)等技术,把注意力计算的中间结果就近存放、随用随取,让GPU少做无用功。
目前曙光8000已支持超过400个主流模型的在线推理,并对Prefill-Decode分离、KVCache等关键环节做了高通量优化。
这套打法的地基,是已经在十万卡上跑过真实场景的ParaStor分布式存储,F9000全闪节点单节点带宽220GB/s、IOPS破千万,可为scaleX40的每张GPU卡提供超5GB专属带宽。在典型推理场景下,同卡数规模的推理吞吐性能较传统8卡机提升4倍以上。
中科曙光高级副总裁李斌指出,AI基础设施正从"算力工厂"变成"Token工厂",有效词元成本将成为算力产业的关键竞争指标。赛迪顾问的报告显示,中科曙光在AI、教育、具身智能、自动驾驶四个行业位居中国市场第一,其中AI存储连续三年居首。
尾声
《记忆碎片》的男主角最终学会了用纹身和便签对抗遗忘。大模型产业未来趋势,也是要学会把「记忆」提高,从而更高效的利用算力。
最新活动更多
扫码关注公众号
发表评论
登录
手机
验证码
手机/邮箱/用户名
密码
立即登录即可访问所有OFweek服务
还不是会员?免费注册
忘记密码其他方式
请输入评论内容...
请输入评论/评论长度6~500个字
暂无评论
暂无评论