行业资讯  /  News

首页 行业资讯

中科曙光发布Token加速技术体系

发布日期:2026-09-14 16:17:40  浏览次数:13 来源:C114通信网

Token是大模型处理和输出内容的基础单元,其生成效率直接影响模型的响应速度和服务能力。

从模型训练时的梯度同步,到推理阶段KV Cache跨节点迁移,海量数据需要在多块GPU之间分发汇总,一旦出现CPU调度拖累、存储访问卡顿、网络链路抖动,就会造成GPU空转等待,直接拉低集群算力利用率,推高AI业务运行成本。

针对这一行业痛点,中科曙光近日发布Token加速技术体系,该体系以scaleFabric原生无损RDMA为核心网络传输底座,构建算-存-传三级紧耦合的Token加速超级通道。其中,支撑GPU直通网络的IBGDA技术实现国内首次规模化落地,补齐国产智算高速互连领域关键短板。

算存传三级协同,打通Token高速流转全链路

中科曙光scaleFabric通过构建“算存传”三级紧耦合的Token加速通道,在网络层面和计算、存储紧密协同,加速token吞吐效率,实现Token在大模型训练、推理到存储复用全链路的高速流转。

在计算环节,GDR技术允许网卡直接读写GPU显存,绕过CPU内存中转;在GDR基础上演进的IBGDA技术,则进一步将通信控制交给GPU,使GPU能够直接驱动网卡并管理数据传输,彻底消除传统路径CPU在协调通信时产生的延迟和瓶颈,让GPU集群间的通信,尤其是高频、小包的场景变得更加高效和可扩展,让计算与通信衔接得更加紧密。目前scaleFabric国内首批规模化应用IBGDA,并完成DeepEP等框架的适配使用,有效提升了通信效率。

在存储环节,scaleFabric围绕Token的存储访问瓶颈,构建了完整的存储直通技术体系——NVMe over RDMA、XDS和NFS over RDMA三项技术,分别用于加快远端NVMe存储访问、支持GPU直接访问远端存储,以及提升传统文件存储的传输效率,共同打造存储与算力之间的高速网络通道,大幅缩短TTFT(首Token时延),提升推理时的token吞吐能力,减少单token的生成成本。

在网络传输环节,大模型分布式集群的多级转发时延是核心性能损耗点。以行业主流两层CLOS架构为例,一枚Token从源GPU发出,需经过接入、汇聚、目标接入三层交换机三跳转发,时延逐级累加。在万卡级大规模分布式训练中,网络通信耗时可占整体任务耗时的30%至50%。

对此,scaleFabric通过极致的单跳性能优化与端到端全链路调优,实现Token传输“每跳提速、全程低延迟”。实测数据显示,该体系单跳转发时延低至260纳秒,网卡端到端时延不足1微秒,性能比肩英伟达NDR方案;在三跳基准时延测试中,端到端时延较主流RoCE方案降低63%,有效抑制多级网络的时延累积效应,让计算、存储的路径优化成果可充分赋能十万卡级大规模集群。

IBGDA技术实现国产突破,落地十万卡级超大规模集群

中科曙光高速网络互联产品部高性能计算产品事业部总工程师万伟近日在接受媒体采访时特别介绍了GPU加速技术:GDR与IBGDA,这是两项旨在打破CPU瓶颈、实现高效GPU间通信的关键技术——GDR与IBGDA。

GDR技术的核心在于,它允许InfiniBand网卡直接读取或写入GPU显存,完全绕过主机CPU和系统内存,极大地降低了通信延迟并减少了CPU开销。

而IBGDA则是GDR的“二次进化”。GDR虽然实现了数据的直接传输,但其通信操作的发起,如创建工作队列条目、写门铃通知网卡仍需要CPU的参与。IBGDA更进一步,它允许GPU内核直接驱动和控制InfiniBand网卡,使得GPU可以不依赖CPU,完全自主地发起和管理节点间的通信。

万伟进一步介绍,IBGDA主要应用于MoE通信,特别是MoE All-to-All场景。这类场景中,Token分发与合并会产生大量并发小消息,由CPU作为“中介”参与转发调度会带来显著的延迟与CPU开销,而IBGDA则通过减少CPU参与关键通信路径,大幅提升了MoE专家并行通信效率。

此前,IBGDA的规模化落地始终由国际厂商主导,国产RDMA网卡与GPU直通的落地案例极为罕见。依托scaleFabric原生RDMA无损高速网络,中科曙光自研IBGDA技术已在十万卡级大规模集群中完成验证,实现了这一领域的关键补位。

目前,中科曙光scaleFabric Token加速技术体系已完成DeepEP等主流通信框架的适配,补齐大模型场景下的软件生态能力,让IBGDA等核心技术可快速融入现有产业应用环境,加速技术商业化、规模化落地。

随着IBGDA技术全面进入规模化部署阶段,中科曙光这套国产Token加速体系,将持续提升多GPU集群的数据交换效率,为MoE等主流大模型提供高性能、可替代的国产高速互连方案。同时,通过算存传一体化的系统级优化,全面释放国产智算基础设施的算力潜能,为国产AI算力集群的性能升级、降本增效提供核心支撑。

下一篇:中兴通讯深化“连接+算力”双引擎战略

AI
问答

业务
咨询

客服热线

客服
热线

7*24小时服务热线

18986158343
7*24小时服务热线

关注微信

关注
微信

微信二维码 关注官方微信
返回顶部 顶部