AI 领域现在最缺什么? 算力,一定是算力。 在国内,算力几乎是制约几家大模型厂商发展的最重要的环节。训练需要算力,国产大模型都陆续迈进几万亿的参数了;模型练好了有了用户,越好的模型用户越多,越需要算力,算力跟不上,体验就变差。 高端的英伟达算力卡不卖给我们,低端的也要多花钱、排队来。 所以国产算力卡即使不如英伟达的那么好用成熟,国内的大模型也不敢一根筋的吊在英伟达身上,华为昇腾、寒武纪、壁仞都在国产算力上有自己的一席之地。 要说现在算力领域最时髦的词儿,一定是 “ 超节点( SuperPod ) ”。在国产显卡领域,这个词儿并不让人陌生,但这种形态的产品其实是英伟达第一个做出来的。 早在 2019 年以前,虽然那时候还没有大模型,但语音识别、图像识别之类的服务,也已经催生了大算力的需求了。 单卡能力有限,人们很容易就想到把多张显卡拼起来的方式获得更大算力。 人们以为用 100 张卡拼在一起能得到 100 张卡的算力,结果能用出来 3 - 4 成就不错了。究其原因,粗暴的把这些卡连在一起,但通信协议带宽差,数据流通起来太差,另一个是各家攒起来的服务器没有标准化,模块适配度和稳定性也差。 所以英伟达推出了一套 自研 NVLink 高速互联协议、再加上 InfiniBand 组网、给服务器里适配专属硬件和软件 。 16 张 V100 GPU 拼成了一个超节点,最多把 96 台超节点服务器里的 1536 张卡通过组网互拼,这种显卡打包套装就是超节点集群( SuperPOD )。 业内说英伟达把原来的显卡利用率从 4 成提升至了 8 成,而且因为整体性很高,企业几乎开箱即用,有效算力高,所以大家特别买账。 英伟达在超节点上的演进 而咱们国产显卡,要说单卡性能,相比英伟达的最新显卡肯定是远远不如。但超节点给了我们一个思路,单卡不太行,但是如果组合成超节点,只要系统开销能稳定住,拼数量的话,我们没问题啊,咱不最擅长大力出奇迹嘛。 去年华为 CloudMatrix 384 出来的时候,国内显卡终于算在超节点上迈出去了。正巧遇到 DeepSeek 横空出世,推理训练火得一塌糊涂,不同于预训练对于算力的庞大需求,384 超节点恰好能满足推理需求,就也把它带火了。 今年上半年,昇腾 950 的组成的超节点也开始交付了,单机柜 64 卡,16 个机柜,共 1024 张显卡为统一编址的超节点。作为对比,英伟达由 NVLink 连接的单一高速互联超节点 NVL72 里是 72 张 GB200。 如果不考虑 CUDA 生态,从超节点的某些纸面参数来看,昇腾 950 超节点已有和英伟达最新的超节点有一战之力。 上周华为全连接大会上,华为把基于昇腾 960 的单一超节点规模推向了 4096 张显卡( 明年一、三季度交付 )。 昇腾 960 本来就比 950 性能提升一倍,而整体的互联架构相比 950 的更进一步,时延、统一内存池的优化都又有提升。 华为超节点里昇腾的名字大家最熟知,但让 它发挥出超节点魅力的其他关键技术,反而大家很少知道。 在我看来,排头的必须是华为 “ 灵衢协议 ( UnifiedBus ) ” 。就像我前面说到的,制约服务器算力发展的,最重要的就是数据互通,其实也就是协议问题。 以前不同零件、模块、节点、集群都有自己一套协议,非常碎片化,数据需要不停的反复转换,不仅延迟极高,还浪费算力。英伟达因此弄出来 NVLink+InfiniBand 协议来解决它。 咱也知道,华为是靠通信起家,来重新给设计一套互联协议这不是手拿把掐,不管是服务器内部、节点之间、集群之间都可以用灵衢来通信,相比英伟达节点内外分层传递数据的方式,灵衢显然更加统一。 而且为了让更多厂家跟进这个灵衢,华为还把这个给开源了。在华为超节点的发展上, 我愿称【 灵衢协议 】是其灵魂技术 ,有了它打底,才让其他技术发挥了更大的作用。 协议部分打通了,这次华为在硬件上也搞了一个大新闻,他们刚发布了业内第一个基于 NPO 的光互联产品 Hi-One。 2026 A 股最火的是啥,不就是光模块嘛,为啥这么火,就是因为在训练大模型的时候,为了能顺利的保证柜间通信稳定,必须用光模块来把信号相互传递出去。 为什么不用电缆来传信号呢?因为不仅长距离高速电信号的电磁问题和衰减问题根本解决不了,而且功耗也会夸张到离谱,用光信号才能保证速率和功耗。 一般英伟达万卡级别的超节点集群配备 4.5 万~5 万颗光模块,可想而知行业对光模块的需求。 大家可以看到底下这张图左边就是传统光模块的样子,放在机柜背部密密麻麻的,其实这样排布,光模块离显卡芯片还有几十到 100cm 距离,这部分必须走电信号,为了保证电信号无误,需要专门的 DSP 进行时钟恢复和信号重整,功耗很大。 但华为的这个 Hi-One 不同,