大模型竞争进入深水区,词元效率正成为衡量人工智能算力系统实力的重要指标。近日,曙光信息产业股份有限公司(以下简称“中科曙光”)发布词元加速技术体系,以自研scaleFabric(高端网络技术)原生无损RDMA高速网络为底座,构建“算—存—传”一体化的词元加速通道。其中,支持图形处理器直通网络的IBGDA技术(先进通信技术)实现国内首次规模化落地。
中科曙光高速网络互联产品部总工程师万伟接受记者采访时表示,当前大模型基本基于Transformer架构(一种主流神经网络架构)按词元进行处理,词元是当前人工智能工厂最重要的产出,也是衡量人工智能效能和经济效益的重要指标。随着模型规模持续膨胀,单块图形处理器已难以容纳完整模型,分布式推理成为必然选择,词元相关数据需要在不同图形处理器之间频繁传递,网络通信效率由此成为决定系统性能的关键瓶颈。
在这一背景下,通过系统级创新提升多卡协同效率,正成为国产人工智能计算产业突破单卡性能限制、实现整体效能跃升的重要路径。
词元效率成大模型竞争关键变量
据了解,词元是大模型处理和输出内容的基础单元,其生成效率直接影响模型的响应速度和服务能力。传统路径中,通信任务的发起和元数据处理仍需中央处理器参与,一旦出现调度拖累或网络抖动,就会造成图形处理器空转等待,直接拉低集群算力利用率。
中国工程院院士郑纬民表示,我国词元消耗两年间增长千倍,但当前人工智能算力基础设施还无法高效生产词元,陷入高耗能、低产出的困局。
“算力”不等于“产出”。如何打通算、存、传之间的数据流转堵点,让硬件算力真正转化为模型的实际输出能力,提升效率,已成为行业亟待解决的现实难题。中科曙光基于自研的scaleFabric词元加速技术体系,正是瞄准这一痛点的全链路解决方案。
这一网络技术的核心思路,是在网络层面与计算、存储紧密协同,让词元在大模型训练、推理到存储复用的全链路中实现高速流转。
万伟解释,传统图形处理器直接远程内存访问技术虽然优化了数据面,但通信任务的下发和元数据处理仍然需要中央处理器参与。IBGDA通过减少中央处理器参与关键通信路径,大幅提升混合专家模型并行通信效率。“在效果较好的场景中,处理器整体性能提升可达20%至30%。”他说。
元禾半导体科技有限公司首席专家李科奕在接受记者采访时表示,当前国内算力发展面临单卡性能与国际先进水平存在差距的现实,通过集群化和多卡互联来弥补单卡短板,已成为行业共识。国产计算产业走全栈式创新的道路,除了在关键环节先进制程自研之外,还应促进高带宽内存、先进封装等多种技术的组合创新,进一步夯实国产人工智能计算的系统级基础。
实现关键补位迈出规模应用重要一步
此前,IBGDA这一通信技术的规模化落地始终由国际厂商主导,国产高速网络网卡与图形处理器直通的案例极为罕见。目前,中科曙光IBGDA技术已在十万卡级大规模集群中完成验证,实现了这一领域的关键补位。
生态适配方面,中科曙光北京公司scaleFabric产品经理纵瑞博表示,scaleFabric已完成与深度专家并行等通信框架的对接。对于上层应用而言,只要基于深度专家并行框架,就不需要修改业务代码或上层框架,可以直接运行。在底层适配层面,其与其他国产图形处理器厂商的适配合作也在推进中。
万伟坦言,制约国产算力发展的一个重要因素是单卡算力与国外产品存在差距。“国内算力发展正在依靠集群和多卡互联,通过增加计算卡数量、改善多卡通信效率来满足大模型发展所需的算力要求。在这一路径下,IBGDA技术在scaleFabric中的规模化应用,将成为提升多卡协同效率的重要支撑。”他认为。
据悉,中科曙光还计划于9月中下旬发布大规模预填充与解码分离推理场景的测试报告,在相同图形处理器、相同架构和相同400G网络带宽条件下,对比scaleFabric与融合以太网远程内存访问方案的词元性能差异。
李科奕认为,scaleFabric此次以网络通信为突破口,将图形处理器直接发起网络通信的能力规模化落地,是系统级创新思路的具体实践,为国产算力集群提升整体效率提供了可复制、可推广的技术路径。
大模型竞争进入深水区,词元效率正成为衡量人工智能算力系统实力的重要指标。近日,曙光信息产业股份有限公司(以下简称“中科曙光”)发布词元加速技术体系,以自研scaleFabric(高端网络技...[详细]
国际数据公司(IDC)最新发布的《全球可穿戴设备市场季度跟踪报告》显示,2026年第二季度,全球腕戴设备市场出货量为4801万台,同比下滑4.3%。其中,智能手表出货量3708万台,同比下滑4.2%;...[详细]
近期,民生垂直配送领域数字化探索再获进展。针对桶装水配送普遍存在的运力闲置、区域供需错配、双向物流履约难度大等行业痛点,成都燕基空间科技有限公司(简称“燕基空间”)携手哈尔滨工...[详细]