智能体时代加速到来,AI推理业务规模快速扩张,推理占比持续走高。在大模型与Agent(智能体)业务场景下,KVCache(加速大模型推理生成的关键技术)已经成为推理环节的核心生产数据,传统节点本地缓存模式资源割裂,难以实现跨会话、跨节点复用,制约大模型推理整体效能。
针对上述行业痛点,曙光信息产业股份有限公司(以下简称“中科曙光”)在2026年CCF全国信息存储技术学术会议上正式发布全新迭代升级的AI推理原生存储FNNeo(新一代AI推理原生存储解决方案),依托池化共享架构,实现集群级KVCache资源调度,为AI推理规模化落地提供全新存力底座。

AI推理原生存储 企业供图
集中式存储同样适配AI推理新场景
行业内长期存在“集中式存储不适合AI推理”的固有认知,不少从业者认为推理业务更依赖本地盘的性能表现。事实上,集中式存储的池化共享架构,早已在金融、通信等对稳定性要求严苛的关键业务中经过大规模实践验证,这套成熟能力同样可以迁移到AI推理领域。
随着大模型上下文越来越长、并发用户数量激增,本地缓存受单卡、单机硬件边界束缚,极易出现GPU显存溢出、资源浪费的问题。
据了解,FNNeo立足集中式全闪架构,跳出单节点硬件局限,用统一存储池承接推理业务各类数据诉求,证明集中式存储完全可以胜任高并发、低时延的AI推理复杂负载。
打通大模型推理性能优化的关键一环
在传统推理部署方案中,KVCache属于计算节点的私有资源,不同会话之间无法互通,大量宝贵缓存数据被闲置,算力资源难以充分释放。FNNeo核心突破在于集群级KVCache池化共享能力,将原本绑定在各个计算节点内部的私有缓存,转变为整个推理集群可调度的共享资源。
这意味着推理缓存不再依附于单台服务器,不同模型会话、不同计算节点之间能够灵活读取、复用KV Cache数据。集中式存储的价值也由此拓展,从过去主要承载模型权重、业务文件等传统数据,进一步延伸到推理运行时缓存这一动态高频场景,打通大模型推理性能优化的关键一环。
FNNeo延续了中科曙光高端集中式存储的高性能基因,实测数据显示,其单阵列带宽可达160GB/s、亚毫秒级时延,延迟表现、吞吐量和多请求并发数相比传统本地方案均有约2倍提升。
作为专为AI推理打造的集中式全闪存储,这套方案更可实现模型首词元响应时间缩减73%,整体词元吞吐能力提升150%,显著改善用户交互体验。
面向生产级AI业务,仅有性能突破远远不够,稳定可靠与生态适配同样不可或缺。FNNeo具备99.999%高可靠运行保障,通过慢盘自动隔离、故障无损重构等机制,保障推理业务7×24小时不间断运行。
同时,产品打造SAN/NAS/KV三重协议一体化开放生态,可无缝对接主流推理框架,企业无需大规模改造现有推理环境即可完成接入。通过存力资源池化,减少多节点重复存储开销,提升GPU等昂贵计算硬件的整体利用率。
业内人士认为,FNNeo的推出,补齐了AI推理场景下集中式存储的能力拼图,为Agent、长上下文大模型等业务的大规模落地,提供了一套经过工程验证的存力新选择。
智能体时代加速到来,AI推理业务规模快速扩张,推理占比持续走高。在大模型与Agent(智能体)业务场景下,KVCache(加速大模型推理生成的关键技术)已经成为推理环节的核心生产数据,传统节...[详细]
作为年内重要的“H回A”项目,力勤资源已启动申购;同样“先H后A”的越疆科技创业板IPO于7月22日过会,时隔两个月至今仍未提交注册。越疆科技停滞背后,市场传言机器人IPO门槛将收紧;IPO上...[详细]
隐私争议后,智谱开源自证。9月20日深夜,智谱MaaS(模型即服务)平台宣布,将上线数据内容不留存功能;该功能生效后,用户输入和输出的数据仅用于完成当次模型调用,不会进行静态存储。9月2...[详细]