分享好友 资讯首页 频道列表

中科曙光scaleFabric Token加速技术体系:存算网协同提升AI集群效能

2026-09-12 01:2720420

中科曙光近日宣布推出scaleFabric Token加速技术体系,该体系以原生无损RDMA高速网络为核心,通过计算、存储与网络的深度协同,显著提升大模型运行效率。这一创新成果标志着国内AI基础设施在全链路数据流转效率领域取得重要突破,尤其在十万卡级集群中实现规模化应用。

在分布式AI架构中,Token作为模型处理和输出的基本单元,其生成效率直接决定系统响应速度。中科曙光高性能计算产品事业部总工程师万伟指出,Token数据需在不同GPU间频繁传递,数据流转效率已成为制约集群计算性能的关键因素。训练阶段需同步梯度数据,任何单卡延迟都会导致整体计算利用率下降;推理阶段则涉及大量缓存数据搬运,用户感知的"首字延迟"和"输出速度"均与数据传输速率密切相关。

随着MoE架构的普及,模型运行产生的高频并发小消息通信对传统网络构成严峻挑战。研究显示,在大规模训练中,网络通信耗时占比已达30%-50%,传统路径的CPU开销更成为性能瓶颈。这种背景下,AI产业竞争已从单卡算力比拼转向全链路效率优化,算力、网络、存储的协同能力成为系统性能上限的决定性因素。

针对行业痛点,中科曙光研发的InfiniBand GPUDirect Async(IBGDA)技术实现重要突破。该技术允许GPU直接控制网卡通信,绕过CPU中转环节,使小消息通信延迟降低60%以上。在MoE模型场景中,这项创新相当于为数据传输开辟专用通道,经多场景测试显示,结合全链路优化后系统整体性能提升20%-30%。

存储环节的协同优化同样关键。当前行业正构建多层次存储加速方案,针对模型加载、缓存读写等不同场景,通过减少数据搬运环节提升计算单元访问效率。这些技术共同构建起存算网协同的技术底座,使系统资源利用更加高效。

在算力生态建设方面,中科曙光采用开放架构策略。北京公司scaleFabric产品经理纵瑞博表示,该体系已实现与多家国产厂商产品的适配优化,在RoCE和NVIDIA InfiniBand之外,提供高性价比的国产原生无损RDMA网络方案。这种自主可控的底层网络技术,为国产算力生态协同发展奠定坚实基础。

目前,基于scaleFabric的自研IBGDA技术已在超大规模集群中完成验证,其性能表现达到国际先进水平。这项突破不仅弥补了国产单卡性能差距,更通过系统级创新开辟出提升集群效能的新路径,为国内AI基础设施发展提供重要技术支撑。

反对 0
举报 0
收藏 0
打赏 0
评论 0
2026vivo开发者大会:全球用户近6亿 蓝心智能战略升级新系统登场
2026vivo开发者大会:全球用户近6亿 蓝心智能战略升级新系统登场

0评论2026-09-16629

第二届淘宝丑东西艺术展启幕,500余款创意展品颠覆传统审美认知
第二届淘宝丑东西艺术展启幕,500余款创意展品颠覆传统审美认知

0评论2026-09-122951

福龙马携手华为:借具身智能之力,共绘智慧环卫新蓝图
福龙马携手华为:借具身智能之力,共绘智慧环卫新蓝图

0评论2026-09-121993

300余台机器人齐聚杭州余杭 技能大展解锁智能上岗新未来
300余台机器人齐聚杭州余杭 技能大展解锁智能上岗新未来

0评论2026-09-122651

蚂蚁集团韩歆毅:智能体商业迈入新阶段,AI支付成关键“承诺引擎”
蚂蚁集团韩歆毅:智能体商业迈入新阶段,AI支付成关键“承诺引擎”

0评论2026-09-122614

王潜解读GPT-6与具身智能:数据是核心,通用模型难“跨界碾压”
王潜解读GPT-6与具身智能:数据是核心,通用模型难“跨界碾压”

0评论2026-09-122276

外滩大会“绿色星球”展区:AI对话能耗可视化,科技与自然和解新探索
外滩大会“绿色星球”展区:AI对话能耗可视化,科技与自然和解新探索

0评论2026-09-102601

陆朝阳:量子计算非万能 国内部分公司宣传“量子养猪”等说法荒诞不经
陆朝阳:量子计算非万能 国内部分公司宣传“量子养猪”等说法荒诞不经

0评论2026-09-101501

为什么AI还没有真正发现新的科学?普林斯顿王梦迪:答案可能不在模型里
为什么AI还没有真正发现新的科学?普林斯顿王梦迪:答案可能不在模型里

0评论2026-09-101786

苹果AI新进展:新Siri“懂”你,手表“听”世界,“中枢”iPhone来了
苹果AI新进展:新Siri“懂”你,手表“听”世界,“中枢”iPhone来了

0评论2026-09-102665