算力正在取代电力成为数字经济的核心驱动力。ChatGPT等大模型的爆发,将海量数据配合大算力与大规模参数推至人工智能发展的标配位置,算力规模每增长一个百分点就能带动数字经济增长0.4个百分点。但算力的释放并非无条件,计算与网络长期作为独立系统运行,二者的性能反转问题日益凸显,算网融合正从可选项变为必答题。
算力经济正在重塑产业格局。从互联网、软件和信息服务到金融、能源、科研,算力的渗透率持续攀升。AIGC的爆发让公众对算力的认知从幕后基础设施跃升为核心生产要素。中国数据量预计在2025年达到48.6ZB,其中适合东数西算的温冷数据占比高达95%。海量数据跨广域网传输、异地上云、云间迁移等场景的规模呈指数级增长,对网络带宽、时延和可靠性提出了前所未有的要求。
但一个根本性矛盾始终未能解决,计算和网络是独立设计的两个系统,算的负载状态与网的拥塞信息彼此割裂。云边调度中频繁出现的性能反转现象,边缘节点在计算负载高企和网络队列深度大的条件下平均时延及尾时延反而大于中心云,揭示了算网协同的深层困境。
现有的网络侧调度策略(如ECMP)无法适应智算网络差异化的流量特性,导致链路负载严重不均衡;端侧方案同样受限于难以动态调度。通信开销已成为分布式AI模型训练的性能瓶颈。以GPT-3模型为例,其参数规模已达1750亿,训练预估需要5000张GPU卡,大模型训练中节点间通信时间已接近总处理时间的50%。传统的加带宽、配专线思路不仅成本高昂,更难以从根子上解决算网割裂的结构性问题。
算网一体正是为破解这一结构性矛盾而生的技术体系。它在网络基础设施层面重建了计算与网络的耦合关系,以网强算、以算赋网,最终实现融合贯通多要素的一体化服务。中国企业在全球率先提出算力网络理念,并系统化推进算网一体技术的攻关与验证,形成了四大核心方向的技术体系。
算力路由是算网一体的核心突破口。基本思路是在路由域引入计算信息,使路由系统在寻址选路时同时感知计算资源的负载和网络拥塞,进行联合动态调度。经过四年攻关,中国企业在IETF发起成立了算力路由工作组CATS(Computing-Aware Traffic Steering),这是IETF路由域近十年来由中国公司牵头成立的两个工作组之一,与美欧主导的传统路由标准形成对位竞争。CATS已完成场景和需求立项,聚焦于架构、需求和计算指标定义,在广东珠海完成现网试点验证,业务承载量提升30%以上,算网综合资源利用率提升32%以上。从集中式组网方案起步,分阶段向分布式和混合式演进,算力路由系统正从实验室走向现网。
在网计算面向AI大模型训练中的通信瓶颈问题,提出网络参与计算的解法。核心逻辑是利用交换机Tbps级别的线速处理能力,在网络内部完成数据聚合与消冗,将通信复杂度从O(logN)降至O(1),从传输路径这一根源上缩短通信时间。中国企业提出的NACA架构,通过统一通用的在网计算通信库,实现了分布式应用逻辑与物理通信的高效映射。
实测表明,相比参数服务器架构BytePS,在网计算在通信密集型任务中最高可提升60%以上的训练速度;相比环形架构Horovod,可降低智算集群网络带宽占用约一倍。当然,现有在网计算领域仍面临挑战,竖井式设计、封闭化和开发不友好,基于特定协议栈和硬件的方案成本昂贵,亟需通用化突破。当前在网计算已在CCSA TC3 WG3完成首个行业标准立项,正在从学术研究走向产业落地。
原生RDMA对丢包极其敏感,丢包率仅达0.5%时有效吞吐即趋近于零,广域网的低质量信道恰好触发了这一软肋。更棘手的是,TCP吞吐与传输距离和丢包率成反比,时延从1ms增加到10ms时吞吐下降十倍,这意味着传统的端到端传输方案在大规模数据迁移场景中几近失效。广域RDMA技术通过新型拥塞控制算法、丢包快速恢复算法、精确重传机制和数据安全加密协议四大关键技术,实现了高吞吐、高可靠、低时延、低算力损耗的两高两低目标。
在此基础上构建的数据快递服务,支持专线传输(几十TB/小时)、聚合传输(几百GB到TB/小时)和错峰传输(几十TB/小时)三种业务模式,覆盖通算、智算、超算等多种场景。自动驾驶训练数据上云单日达几TB至十几TB、综艺素材一年达500PB、基因测序年数据100PB,这些现实场景正在检验广域RDMA的工程价值。中国企业联合12家单位牵头制定了CCSA行标《承载RMDA的广域网技术要求》,正在推进省市现网应用。
算网数字孪生为算网一体的规建维优营提供了虚拟试炼场。通过三层三域双闭环系统架构,物理网络层、孪生网络层、网络应用层构成三层,数据域、模型域和管理域构成三域,内闭环完成配置变更前的仿真验证,外闭环完成对网络应用的控制反馈,实现了算网资源可视、状态实时监控和策略闭环验证。DTN的原型系统已在算力网络的运维管理场景中落地,支持多层级物理网络高保真呈现、多类别异厂商设备兼容和多场景流量智能调配。中国企业作为数字孪生网络的首倡者,2019年在ITU-T SG13完成DTN首个标准立项,2022年发布全球首个DTN标准Y.3090。在CCSA牵头成立的数字孪生网络子工作组,联合多家厂商推进11个在研项目,相关学术论文已入选2022年度领跑者5000顶尖论文。从标准制定到原型验证,算网数字孪生正加速技术闭环。
算网一体是信息基础设施的一次底层重构。它让网络从被动管道进化为可感知计算负载、可参与计算任务、可自我仿真优化的智能载体。面对中国庞大的数字经济规模和持续增长的算力需求,算网一体提供的不只是技术路线,计算在哪里网络就适配到哪里,网络在哪里计算能力就延伸到哪里。这扇门一旦推开,影响将远超通信行业本身。
在此环境下,分享一套解决方案:《智算数据中心建设解决方案》值得参考借鉴~
























