文章总结: 本文介绍央视纪录片《超级工程—曙光8000》,聚焦十万卡超级计算机的协同挑战、超智融合路线及科研应用,强调算力价值在于解决实际问题,未来算力将成基础设施。 综合评分: 85 文章分类: 产品介绍,解决方案
花了6年造出的十万卡机器,最后拿来干什么?
原创
wljslmz瑞哥 wljslmz瑞哥
网络技术联盟站
2026年9月29日 14:33 江苏
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
9月25日,《超级工程—曙光8000》在央视开播。
《超级工程》这个系列过去拍过港珠澳大桥、中国高铁,这一次镜头没有对准桥梁和轨道,而是进入了一个普通人几乎看不见的世界——超级算力中心。
曙光8000最容易让人记住的,是“十万卡”。
十万张国产智能计算芯片、一万余个计算节点、超过十亿个零部件,这样的数字看起来足够震撼。但看完这部纪录片,我最大的感受反而不是“十万张卡有多厉害”,而是终于有人把一个容易被忽略的问题讲清楚了:
算力真正有价值的那一刻,不是机器开机,而是科研人员开始用它解决以前解决不了的问题。
2026年7月,曙光8000正式落成投用,并接入国家超算互联网。上线首周,系统就实现满载运行,日均处理作业数突破15万个,单日峰值超过50万个。
这其实非常有意思。
因为它意味着,十万卡并不是建完以后摆在那里展示的“超级设备”,而是一套真正进入科研和产业流程的基础设施。
十万卡最难的地方,不是“卡”,而是“协同”
如果把一台服务器理解成一个人,那么十万张卡意味着十万个人同时干活。
问题也就来了:这么多人怎么分工?数据怎么传?任务怎么调度?有人出故障怎么办?某个环节慢了,会不会拖住整个系统?
到了这个规模,单张计算卡跑得多快已经不是唯一问题。
真正决定集群效率的,是网络、存储、调度、散热、软件生态能不能一起工作。
这也是我觉得《超级工程—曙光8000》比较有价值的地方。它没有把超级算力简单拍成“堆硬件”,而是把背后的工程问题摊开给观众看。
十万张芯片必须组成一个整体。
CPU、AI加速芯片、高速网络、存储系统、调度平台,以及液冷、电力等基础设施,都必须围绕同一个目标协同起来。
特别是到了十万卡级别,网络已经不再只是“把机器连起来”这么简单。
大量节点之间需要持续交换数据,如果通信出现拥堵,计算卡再快也只能等着。中科曙光公开资料也提到,超大规模集群的瓶颈正在从单卡性能逐渐转向互联、存储、调度和系统效率。
这其实和我们平时做网络运维很像。
100台设备的时候,一个交换机问题可能只是局部故障;到了几万、十万规模,任何一个环节出现问题,都可能被放大成系统级问题。
超级算力,本质上已经不是“买多少卡”的问题,而是一个超级复杂的系统工程。
更关键的一步,是让不同科研任务“跑得起来”
还有一个容易被忽略的问题。
计算资源有了,科研人员就一定能直接使用吗?
还真不是。
传统科学计算与AI计算,本身就是两套不同的计算逻辑。
天气预报、流体模拟、航空航天仿真等任务,对计算精度要求很高;大模型训练、推理等AI任务,则更多依赖大规模并行计算。
如果把所有任务都用同一种方式处理,很多算力其实发挥不出来。
曙光8000采用的“超智融合”路线,核心就是希望把高精度科学计算和智能计算放到同一个体系里,让一套基础设施同时承载不同类型的任务。人民日报对曙光8000的报道也特别提到,它试图把高精度科学计算与低精度智能计算统一到同一系统。
我认为这比单纯追求“十万卡”更值得关注。
因为科研计算从来不是一场单纯的算力竞赛。
真正的问题是:给我这么多算力,我到底能不能把科学问题算出来?
这中间还隔着软件移植、算法优化、编译环境、通信效率、任务调度等一大堆工作。
很多科研软件甚至并没有为十万卡规模做好准备。于是,工程师需要进入科研现场,和科学家一起调整程序,一起寻找瓶颈。
这时候,工程师的角色已经不再是传统意义上的“设备维护人员”,而更像科研团队的一部分。
科学家提出问题,工程师负责把问题变成计算任务,再把计算结果重新交还给科学家。
这条链路真正打通,算力才开始有意义。
最让我印象深刻的,是那些“以前根本算不起”的问题
比如黄河水沙模拟。
黄河里的水、泥沙、河床变化之间存在复杂耦合关系。过去受计算能力限制,模型的空间分辨率很难做到足够精细。
当算力规模被进一步拉高以后,科研人员开始尝试更高分辨率的数字模型。
这时候,算力就不再只是让原来的程序跑得更快,而是在改变“能不能做这项研究”的边界。
气象预测也是类似的逻辑。
9月15日,中国气象局地球系统数值预报中心与中科曙光发布成果,基于曙光8000,国产MCV数值模式可以在1小时内完成全球5公里分辨率、未来10天的预报计算,并达到国际主流业务时效标准。
这件事真正有价值的地方,不只是“1小时”这个数字。
而是以前需要大量时间完成的计算,现在开始具备更强的业务化能力。
对于天气预报来说,算出来只是第一步,更重要的是能不能在需要的时候准时算出来,而且每一次都稳定、可重复。
这也是超级算力和普通高性能计算最大的区别之一:
科研不是只需要峰值性能,而是需要稳定、持续、可使用的性能。
再比如复旦大学的数字孪生脑研究。
相关团队已经构建了具备约860亿神经元规模、百万亿突触的全人脑尺度模拟平台。
这种任务最大的难点之一甚至不是“算得不够快”,而是不同节点之间需要交换海量数据。
换句话说,有时候计算速度再快,网络通信跟不上,也没有意义。
这让我对“算力”这个词有了一个新的理解。
算力从来不是一个孤立的数字,而是一整个系统的综合能力。
十万卡之后,真正值得关注的是“谁能用上”
过去,人们谈超级计算机,首先想到的是科研院所、大型实验室和少数顶尖科研团队。
这很正常,因为超级计算资源太昂贵,也太复杂。
但未来真正有意义的变化,是超级算力逐渐从“少数人的专属设备”变成一种公共基础设施。
曙光8000已经接入国家超算互联网。
这意味着算力开始向网络化服务方向发展。
就像今天大多数企业并不会自己建设发电厂,而是直接使用电力;未来很多科研团队可能也不需要自己拥有庞大的计算集群,而是通过网络直接调用计算资源。
到了那个阶段,科研人员面对的将不再是一排排服务器,而是一个计算服务。
提交任务、运行模型、获取结果。
至于后面的芯片、网络、存储、调度和散热,由基础设施负责。
我觉得这才是“算力基础设施”真正成熟的标志。
看完《超级工程—曙光8000》,我最大的感受是:
十万卡本身并不是故事的结尾,甚至可能只是故事真正开始的地方。
硬件规模可以被不断刷新,从千卡到万卡,再到十万卡,未来可能还会继续增长。
但机器越大,系统越复杂。
计算、网络、存储、能源、散热、软件、算法乃至科研协作方式,都必须一起进化。
所以接下来真正值得关注的,可能已经不是“下一套集群有多少张卡”,而是这些算力到底改变了多少科研流程,解决了多少过去解决不了的问题,又诞生了多少新的研究方法。
过去三十多年,中国先进计算一直在解决“有没有”的问题。
而现在,问题正在逐渐变成“怎么用”。
当超级算力真正走进气象、脑科学、材料、能源、生命科学、航空航天等领域,当科研人员不再需要关心底层到底用了多少芯片,只需要关心模型能不能算出来、结果够不够快,那个时候,算力才真正从一项顶尖技术,变成社会运行的基础设施。
十万卡只是一个数字。
真正决定曙光8000价值的,是这个数字背后究竟能跑出多少新的科研成果。
而未来三十年,或许才是超级算力真正开始改变世界的阶段。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:网络技术联盟站 wljslmz瑞哥 wljslmz瑞哥《花了6年造出的十万卡机器,最后拿来干什么?》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。







评论