订阅
    纠错
    加入自媒体

    国产算力龙头,最新词元加速方案将发布

    2000年,诺兰拍了一部电影叫《记忆碎片》,主角患了顺行性遗忘症,记不住任何新东西,每做一件事,都要把前面的全部重推一遍,活得极其辛苦。

    26年后的今天,全球最聪明的AI大模型有时也会重蹈《记忆碎片》中主角的“失忆症”,会重复计算。

    为了解决推理过程中的重复计算问题,就在今天,中科曙光相关人士透露,公司将发布面向大模型推理的新一代词元加速方案。

    GPU崇拜

    过去三年,谈AI必谈卡。谁的GPU多,谁就是赢家。

    但这个逻辑正在被优化。在十万卡规模的集群里,数据供给往往比芯片更早变成吞吐的瓶颈。中科曙光副总裁魏振国指出,在高并发推理场景下,瓶颈来自数据搬运、存储I/O、网络时延、散热能耗和任务调度,"Token效率的关键不在于单一芯片,而在于系统级协同"。

    卡堆得越多,墙撞得越早。

    国产算力龙头,最新词元加速方案将发布

    如今,Token需求端在疯狂增长。第三方平台OpenRouter的数据显示,仅OpenClaw一家智能体,单周词元消耗量就相当于2025年第四季度全平台周均的60%。智能体每完成一次任务,要来回调用成百上千次模型,每一次调用,都是一次真金白银的算力消耗。

    而大模型每生成一个新词,都要回头参考前面所有词的信息。前面已经算过的东西被反复重算,是推理延迟里很大的一块损耗。你跟AI聊到第100句话,它把前99句的计算翻来覆去一遍又一遍。

    这正是中科曙光即将发布的词元加速方案要动刀的地方,重点处理推理过程中的重复计算和数据调度问题。据财联社报道,该方案将在2026数博会期间发布,依托存算协同理念,提高大模型词元处理效率与算力利用率。

    把“记忆”放在GPU身边

    中科曙光解题思路就是,既然AI记不住,那就替它记。

    中科曙光开发的国内首个全国产十万卡AI超算集群曙光8000(登峰)已经在做这件事。它通过KVCache卸载、GDS(GPU直通存储)等技术,把注意力计算的中间结果就近存放、随用随取,让GPU少做无用功。

    目前曙光8000已支持超过400个主流模型的在线推理,并对Prefill-Decode分离、KVCache等关键环节做了高通量优化。

    这套打法的地基,是已经在十万卡上跑过真实场景的ParaStor分布式存储,F9000全闪节点单节点带宽220GB/s、IOPS破千万,可为scaleX40的每张GPU卡提供超5GB专属带宽。在典型推理场景下,同卡数规模的推理吞吐性能较传统8卡机提升4倍以上。

    中科曙光高级副总裁李斌指出,AI基础设施正从"算力工厂"变成"Token工厂",有效词元成本将成为算力产业的关键竞争指标。赛迪顾问的报告显示,中科曙光在AI、教育、具身智能、自动驾驶四个行业位居中国市场第一,其中AI存储连续三年居首。

    尾声

    《记忆碎片》的男主角最终学会了用纹身和便签对抗遗忘。大模型产业未来趋势,也是要学会把「记忆」提高,从而更高效的利用算力。

    声明: 本网站所刊载信息,不代表OFweek观点。刊用本站稿件,务经书面授权。未经授权禁止转载、摘编、复制、翻译及建立镜像,违者将依法追究法律责任。

    发表评论

    0条评论,0人参与

    请输入评论内容...

    请输入评论/评论长度6~500个字

    您提交的评论过于频繁,请输入验证码继续

    暂无评论

    暂无评论

      人工智能 猎头职位 更多
      扫码关注公众号
      OFweek人工智能网
      获取更多精彩内容
      文章纠错
      x
      *文字标题:
      *纠错内容:
      联系邮箱:
      *验 证 码:

      粤公网安备 44030502002758号