首页 > 教育知识 > 教育知识 > 华为创造AI算力新纪录:万卡集群训练98%可用度,秒级恢复

华为创造AI算力新纪录:万卡集群训练98%可用度,秒级恢复

发布时间:2025-06-11 12:54:54
 大模型的落地能力,核心在于性能的稳定输出,而性能稳定的底层支撑,是强大的算力集群。其中,构建万卡级算力集群,已成为全球公认的顶尖技术挑战。
 
  但是,在华为,昇腾万卡算力集群,已经可以做到近乎“永不罢工”了:
 
 
  或许有小伙伴要问了:AI算力需要如此24小时不间断的运作吗?
 
  答案是肯定的,需要,且有必要。
 
  因为小到我们用手机导个航,背后都会有几十个AI模型在发力来分析路况、预测拥堵;再如医院用AI辅助诊断癌症,系统得在瞬间处理掉成百上千的CT照片。
 
  这些看似简单的智能应用,其实都离不开如 “超级大脑” 般的AI算力集群,需要它们全天候不停歇地运转着。
 
  而要保证有这样的能力,高训练可用度、高线性度、快速消除故障,就相当于给AI发动机上了一份强有力的保险。
 
  更严格来说,AI推理的可用度甚至还需要达到99.95%的程度。
 
  那么华为又是如何做到这点的?
 
  关于这一切背后的秘密,华为在今天首次把技术给公开了出来。
 
  AI大集群出问题时,定位故障特别麻烦;毕竟系统规模庞大,软件和硬件组成的技术栈错综复杂,而且调用链条还很长。
 
  要解决问题,首先得确定故障出在哪个大的领域,接着再在这个领域内部一步步排查,确定具体的故障位置。在整个故障诊断过程中,面临的挑战非常大。
 
  以往技术人员进行故障定位时,短则需数小时,长则可能耗时数天。这一过程不仅对技术人员的专业技能要求颇高,且往往难以快速锁定故障设备及根本原因。
 
  为此,华为团队针对AI大集群面临的复杂挑战,构建了三大基础能力。
 
  首先是全栈可观测能力。
 
  它像是给集群装了一套“火眼金睛”监控系统(故障感知),主要包含这几部分:
 

教育知识更多>>

有溜背轿跑还有行政豪车,华为多个汽车“外观设计”专利图公布 苹果iPhone在印度市场逆势增长,2025年出货量达1400万部刷新纪录 Meta开年猛投算力,小扎亲征筹建数十GW 小米17被曝将支持eSIM、vivo X300 Ultra第一季度发布 爆料称苹果大幅优化供应链,iPhone 17e的价格将不受冲击 纳德拉懂张一鸣,未来的 AI 竞争,本质上就是一场关于Token 工厂的效率战争 ChatGPT也开始内测广告,AI们集体变身“首席卖货官” 告别“ID.4”,大众热门纯电SUV有望更名“ID.途观” 苹果iPhone 18标准版前瞻:A20芯片、12GB内存、三星传感器 破千亿!MiniMax也创造了属于自己的时刻 消息称奇鋐科技、安费诺供应苹果折叠屏iPhone铰链,两家各占50% TikTok与国际足联达成合作,将上线2026世界杯独家幕后内容 纯电续航最高210km!比亚迪2026款海豹05、海豹06DM-i加推长续航版:8.98万起 韩国LG新能源2025年Q4由盈转亏 亏损达1220亿韩元 王腾新公司已收到上百份简历:重点组建研发团队,薪资对标大厂 特斯拉官方上线Model S/3/X/Y全系车型车衣模板 赵长江:智界V9保守估计三年内没有对手 鸿蒙智行首款MPV智界V9亮点公布:车长5米3,搭载华为雪鸮智能增程系统 华为昇腾AI生态开发者数量达400万+,发展合作伙伴3000+ 魔视智能再获奇瑞汽车多款主流车型定点 佛瑞亚海拉任命新CEO 同源共链赋能产业融合,机器人头部企业释放30个核心部件需求,寻求深度合作 曝特斯拉要求供应商在美产车型中避免使用中国零部件;现代汽车将在韩国投资860亿美元 上海两款外企大模型通过国家备案 保时捷中国总裁潘励驰回应在华发展规划 因汽车及数据中心芯片需求强劲,格芯预计Q4利润和营收将超预期 埃安的双车暗战,能否奏效? 为什么需要一台旗舰四座MPV?岚图梦想家山河上市 铂智7广州车展亮剑,广汽丰田撕掉“纯电落后生”标签? 比BBA更圈粉 岚图“三旗舰”亮相广州车展 成为“新主角”