随着自动驾驶技术从L2辅助驾驶向L4自动驾驶跨越,算法模型正经历从CNN(卷积神经网络)到Transformer的架构变革,参数量也呈指数级增长。文远知行WeRide作为全球领先的自动驾驶科技公司,已经在全球7国30城开展自动驾驶研发、测试及运营,是业内唯一同时拥有中国、美国、阿联酋、新加坡四地自动驾驶牌照的企业,业务覆盖智慧出行、智慧货运和智慧环卫三大领域,日均产生路测数据早已达到PB级别。面对海量数据清洗、标注及大模型训练的算力“洪峰”,原有基础设施捉襟见肘。为此,紫光股份旗下新华三集团协助其构建了基于AMD EPYC处理器的超200台H3C UniServer R5350服务器、搭载近2000块GPU的超大规模智算集群,以高带宽、低延迟的AI基座,破解“算力焦虑”,助力研发效率跃升。 在追求“数据驱动”的自动驾驶2.0时代,算力基础设施的瓶颈日益凸显,文远知行在推进技术迭代时面临三大核心技术挑战: 算力密度与扩展性难题 亟需超强算力 随着BEV(鸟瞰图)+Transformer架构成为主流,单一感知模型参数量突破亿级,训练算力需求每3-4个月翻一番。文远知行原有的小规模集群难以支撑千卡级并行训练,且传统服务器在支持多卡互联时存在PCIe带宽瓶颈,限制了GPU性能的极致释放,亟需具备高扩展性与强并行能力的AI服务器底座。 通信墙制约 分布式训练呼唤网络 在大模型分布式训练中,多节点间的梯度同步(All-Reduce)对网络带宽极其敏感。千卡集群若网络配置不当,通信延迟甚至可能占据训练周期的50%以上,导致“GPU空转、等待数据”的算力空耗现象。文远知行迫切需要构建一套能够承载百亿级参数高频交互的高速无损网络架构。 TCO 追求极致性价比 自动驾驶研发属于典型的“算力密集型”投入,硬件采购成本与后期电力运维成本构成了巨大的资金压力。如何在保障模型训练精度的前提下,选择高能效比、高性价比的硬件组合,成为文远知行平衡技术领先与商业落地的关键考量。 针对上述技术痛点,新华三为文远知行量身定制了“高算力、高通量、高能效”的智算平台解决方案: 澎湃算力底座 打造异构计算集群 方案部署了超200台R5350 AI服务器,每台服务器搭载8块高性能GPU,总计近2000块GPU形成超大算力矩阵。 H3C…



