词元经济催生AI基础设施新需求 国内厂商以存算协同破局
来源:证券时报网作者:郭博昊2026-08-28 17:28
字号
超大
标准

2026中国国际大数据产业博览会将“词元经济”作为重要议题,折射出中国AI产业正从参数规模竞赛转向应用价值落地的深层变革。随着大模型推理服务、智能体应用在千行百业规模化铺开,以Token(词元)为核心单位的交互调用量呈指数级增长,AI基础设施的建设逻辑正在发生根本性转向:行业关注点不再局限于单纯的算力芯片堆叠,而是进一步向推理效率优化、存算协同调度与系统级场景适配能力延伸。

词元经济重构AI基础设施底层逻辑

当前AI产业的价值重心正加速从训练侧向推理侧迁移。根据赛迪顾问《中国分布式存储市场研究报告(2026)》,2025年国产大模型完成从“技术追赶”到“商业引领”的关键跨越,DeepSeek、通义千问等头部模型在多行业实现规模化落地,企业客户数突破万家,带动存储需求从“辅助支撑”升级为“核心瓶颈”。与此同时,智能体应用普及使得多轮对话、工具调用成为常态,Token消耗量与重复计算量同步攀升,推理环节的算力效率与成本控制成为产业共同挑战。

过去行业应对性能压力的主流思路是堆砌GPU算力与高带宽显存,但这一路径正遭遇明显的困境。比如,大模型的“自回归”推理回答方式,像得了“健忘症”,需要大量的重复计算,导致出现推理越来越慢的问题。具体来看,每生成一个新字,模型要重复计算所有历史内容的键(Key)和值(Value)向量,计算量的平方级增长导致计算速度越来越慢。例如,处理16K长度的序列,单次推理需要执行2.56亿次键值对计算。

为解决大模型推理变慢的问题,业界采用KV Cache(键—值缓存机制)加速技术,加速模型思考速度。具体来看,是把已经算好的键(Key)和值(Value)向量,缓存在显存里(GPU HBM)。生成新字时,模型只需计算新字的向量,避免重复计算历史内容(直接从缓存中读取)。

但KV Cache对显存的高消耗,直接推高了硬件成本,随着模型变大、上下文变长,导致显存成本变得极高。同时KV Cache只能消除单对话、单节点内的重复计算,在跨对话、跨节点的大集群计算场景,对推理的加速效用衰减严重。

在这一背景下,存算协同不再是前沿技术概念,而是破解效率与成本双重困境的重要路径。国家发展改革委、工业和信息化部联合发布的《算力基础设施高质量发展行动计划》明确将“存力规模”“存力效能”“存力利用率”纳入算力枢纽节点考核指标体系,要求枢纽节点在算力建设的同时同步规划存力配套,实现存算协同发展。赛迪顾问数据显示,2025年新建智算中心存算分离架构采用率大幅提升,存储战略定位从“计算配套”升级为“数据资产核心载体”,分布式存储凭借高效I/O(输入/输出)、弹性扩展等优势成为AI基础设施核心底座。

十万卡级集群验证,存算协同走向规模化实践

随着智算中心建设从“试点探索”进入“批量落地”阶段,万卡乃至十万卡级集群的集中部署,对存算协同能力提出了前所未有的要求。赛迪顾问报告显示,截至2025年底,全国已建成万卡智算集群42个,FP16(半精度浮点数)智算规模超1590 EFLOPS(每秒可执行一百亿亿次浮点运算)。万卡集群对存储的要求早已超越“容量大”的基础范畴,延伸至数十PB级数据集高并发读取、CheckPoint(数据库系统中用于确保数据一致性的内部事件机制)秒级快照恢复、KV Cache低时延调度等综合能力。

以曙光8000为代表的全国产十万卡AI超集群,为大规模存算协同提供了典型产业验证样本。其搭载的新一代词元加速方案ParaCache,通过全局原数据统一管理与智能调度机制,实现KV Cache在不同存储层级间的自动流转与跨节点、跨对话共享。

中科曙光北京公司总裁助理、分布式存储产品部总经理石静向记者指出,ParaCache的核心逻辑并非单纯提升存储硬件性能,而是通过“以存代算”减少无效重复计算,让GPU算力更多聚焦于增量Token生成。实测数据显示,基于ParaCache高效管理系统,在120K输入长度的单轮对话场景下,首Token时延最高降低98.5%;多轮会话下降低超80%,高并发场景下Token吞吐量可提升近26倍,同时可降低对高端显存的依赖,优化集群整体拥有成本。

事实上,分级缓存与存算协同正在成为全行业共同探索方向。以LMCache为代表的开源技术推动了KV Cache在推理引擎内的高效管理,国内厂商进一步将其拓展至跨节点、跨层级的分布式共享池化场景。赛迪顾问报告指出,KV Cache与CheckPoint等AI原生存储场景正快速成熟,推动存储技术从“通用型资源”向“场景定制化组件”深度转型,全闪存+液冷、存算一体架构等技术路线同步演进,共同支撑智算基础设施效能升级。

体系化竞争成AI基础设施新赛道

随着词元经济向垂直行业渗透,AI基础设施竞争正在从单点产品性能比拼,进入算力、存储、网络体系化协同的新阶段。赛迪顾问报告认为,中国分布式存储市场正经历从“爆发式扩张”向“高质量增长”的阶段转换,厂商竞争逻辑已从单一硬件参数比拼,转向全栈技术能力与行业场景适配能力的综合较量。

需求端差异化特征日益凸显。金融行业侧重推理低时延与高并发承载,医疗行业需要承载海量影像数据与长周期医学知识库,教育行业则面临多校区资源共享与教学AI的混合负载。石静指出,不同行业在数据规模、访问方式、安全合规方面的需求差异,推动基础设施厂商从“卖硬件产品”向“卖场景化解决方案”转型。

整体来看,词元经济的兴起正在重塑AI基础设施价值链条。如果说上一阶段产业主题是算力规模的快速扩张,那么下一阶段的核心命题将是存算协同下的效率革命。从政策端存力与算力同权,到产业端十万卡集群验证,再到技术端分级缓存与智能调度,存算协同正从后台技术走向产业前台,成为支撑AI规模化落地、释放词元经济价值的重要底座。

责任编辑: 王智佳
校对: 李凌锋
声明:证券时报力求信息真实、准确,文章提及内容仅供参考,不构成实质性投资建议,据此操作风险自担
下载"证券时报"官方APP,或关注官方微信公众号,即可随时了解股市动态,洞察政策信息,把握财富机会。
为你推荐
用户评论
登录后可以发言
网友评论仅供其表达个人看法,并不表明证券时报立场
发表评论
暂无评论
时报热榜
换一换
    热点视频
    换一换