8月28日,2026中国国际大数据产业博览会在贵阳开幕。大会期间,曙光信息产业股份有限公司(以下简称“中科曙光”)发布新一代词元加速方案——ParaCache高效管理方案。实测显示,该方案可将模型单轮对话的首词元时延(TTFT,即用户提问后到AI吐出第一个字的时间)最高降低98.5%,高并发场景下的词元吞吐量最大提升27倍。
在今年7月份落成的全国首个国产十万卡AI超集群“曙光8000”上,ParaCache已扛住生产级考验。
推理越来越慢“记忆”越来越贵
随着大模型应用大规模落地,算力消耗的重心已从训练转向推理,但推理环节正遭遇双重瓶颈。
一是推理越来越慢。在多轮对话中,AI每次回答都要重新计算所有历史内容,计算量呈平方级增长——处理一段16K的长文本,单次推理就要执行2.56亿次键值对计算。
二是“记忆”越来越贵。为避免重复计算,业界普遍采用KVCache(键值缓存)技术,把已经算好的结果存在GPU(图形处理器)显存里,下次直接调用。但显存容量有限、价格高昂,模型越大、对话越长,硬件成本就攀升得越快。更麻烦的是,传统KVCache只能在单次对话、单台机器内部复用,一旦到了跨对话、跨机器的大集群场景,加速效果就大打折扣。

博览会上的中科曙光展台企业供图
“业界‘以存换算’已经成为共识,但如果把缓存只放在显存里,长上下文一来很快就把显存撑满。”中科曙光分布式存储产品部总经理石静对《证券日报》记者表示,“这就需要把缓存逐层卸载到内存、SSD(固态硬盘)和分布式存储上,但业界一直缺少一套全局的管理方案。”
一次计算多次复用
ParaCache的思路,是给KVCache建一套“四级房子”:热数据放显存,温数据放内存,冷数据放SSD和分布式存储,按数据的“冷热”程度自动流转。
石静介绍,这套方案有三大基本逻辑:先把各级存储池化共享,让缓存不再被锁死在某台机器上;再对元数据(描述数据位置和状态的信息)做全局统一管理,打破以往的“元数据迷雾”;最后是智能调度,系统可根据每段缓存的访问热度决定何时预取、何时下沉、何时淘汰,甚至可以按应用目录设置不同的保留策略,有的应用缓存留几分钟,有的可以留几个月。
几个关键技术让这套架构真正“跑得动”。在L3层级,中科曙光首次将集中式全闪存存储FlashNexus纳入缓存体系,实测延迟和吞吐量较本地SSD提升2倍;在L4层级,基于ParaStorF9000分布式存储,通过追加写替代覆盖写、轻量化分布式锁等定向优化压低了延迟;自研的XDS(中科曙光首创的存储智能加速技术)直通技术还能让AI芯片“越过”内存和SSD,直接与分布式存储交互,实现显存与存储间的快速卸载和回迁。
效果是直观的,120K长文本下,单轮对话首词元时延最高降低98.5%,仅400毫秒;多轮会话下仍降低超80%;高并发场景词元吞吐量最大提升27倍;由于冷热分层大幅降低了对高端内存的依赖,企业用中低配硬件的成本,就能跑出高配硬件的上下文长度,集群总拥有成本大幅优化。
此次,石静还分享了落地案例:某银行信用卡中心引入超节点加ParaCache后,并发吞吐量提升约3倍;在高校科研知识库问答场景中,并发度可提升15到20倍。
从存数据到存智能
AI数据工厂快速落地
“ParaCache并非改写GPU的性能上限,而是通过减少重复计算和数据搬运,让既有算力得到更充分的利用。”石静说。
在她看来,这次发布背后是推理架构的一次范式转变,过去GPU是推理架构的绝对中心,KVCache只是用完即弃的临时数据;而现在,KVCache成了可反复调用的数据资产,存储也从被动的IO响应,转变为推理链条上的主动参与者。
“以前建AI集群,遇到瓶颈就堆GPU,但GPU成本高、供给也受限。现在的规划思路已经变成算力、存储、网络、缓存一体化设计。”石静判断,存算协同不是短期技术改良,而是大规模训练推理走向规模化生产的必然趋势。
这也是中科曙光“AI数据工厂”理念的最新落地。存储能力从单纯的数据读写,延伸到优化词元产出。对于正处在“词元经济”门槛上的AI行业而言,ParaCache提供了一条让智能更便宜、更快速的可行路径。
(文章来源:证券日报)