演讲摘要
本次演讲的核心思想是,计算行业正经历一场由人工智能(AI)驱动的根本性重塑。黄仁勋指出,行业正同时面临两大平台转型:应用构建于AI之上,以及软件开发方式从编程转变为训练。这一转变正推动着万亿美元级别的产业现代化和研发预算转移。
英伟达将自身定位为这场革命的核心推动者,其战略贯穿从芯片到应用的整个技术栈。关键要点包括:
1. 智能体AI(Agentic AI)的兴起:AI正从单一模型演变为能够推理、使用工具并协同多个模型解决复杂问题的智能体系统。这种多模型、多模态、多云的架构正在重塑企业软件,并成为未来的应用框架。
2. 物理AI(Physical AI)的突破:通过结合训练、推理和仿真三大计算平台,英伟达正在让AI理解并与物理世界互动。核心技术包括用于合成数据生成的Cosmos世界基础模型和Omniverse数字孪生平台,这标志着“物理AI的ChatGPT时刻”已经到来。首个“会思考、能推理”的自动驾驶AI——Alpa Mayo的开源,以及与西门子等工业巨头的合作,预示着物理AI将彻底变革汽车、机器人和工业制造领域。
3. Vera Rubin平台的发布:为应对AI模型规模和计算需求呈指数级增长的挑战,英伟达推出了下一代AI超级计算机平台Vera Rubin。该平台通过“极限协同设计”,同时革新了包括Vera CPU、Rubin GPU、NVLink 6交换机和Bluefield-4 DPU在内的六款核心芯片。其关键创新(如MVFP4 Tensor Core和Dynamo KV Cache存储架构)旨在将训练效率、数据中心吞吐量和能效提升至全新水平,相较于前代产品,其训练相同模型仅需1/4的系统,而Token生成成本则降低至1/10。
总之,英伟达的愿景是成为一个全栈AI系统公司,通过构建开放的、从底层硬件到顶层模型的完整平台,赋能每个行业、每家公司和每个国家参与并引领这场AI革命。
核心主题分析
1.计算产业的重塑:AI平台转型
黄仁勋指出,计算行业大约每10到15年经历一次平台重置。当前,行业正面临两大同时发生的平台转型,其核心均为人工智能。
双重平台转型
AI作为应用平台:应用程序不再是独立编写的,而是构建在AI模型之上。
AI驱动开发模式:软件的开发和运行方式被彻底颠覆。软件不再是“编程”出来的,而是通过数据“训练”出来的;其运行也从CPU转向了GPU。
计算模式的根本变革
传统计算:应用程序是预先录制、预编译并在设备上运行。
现代AI计算:应用程序能够理解上下文,并实时、从头开始生成每一个像素和每一个Token。
巨大的经济区动力
现代化:过去十年价值约10万亿美元的计算基础设施正在向新的AI计算方式现代化。
风险投资:每年数百亿美元的风险投资正涌入这一新世界的发明与创造中。
研发预算转移:全球价值百万亿美元的产业正在将其研发预算从传统方法转向人工智能方法。
2.AI的演进与英伟达的开源模型战略
过去一年,AI领域取得了多项重大突破,而英伟达通过其开放模型战略,在其中扮演了关键角色。
近期AI技术突破
推理模型:以ChatGPT的“0.1模型”为例,引入了“测试时扩展”(Test-time Scaling)的概念,即AI的实时“思考”过程。
智能体系统 (Agentic Systems):2024年出现,2025年普及。这类模型具备推理、信息检索、使用工具和规划未来的能力。
物理AI (Physical AI):理解自然法则并能与物理世界互动的AI。
AI物理学 (AI Physics):理解物理定律本身的AI。
开放模型 (Open Models):以DeepSeek R1为代表的开源推理系统,激活了全球的创新浪潮。开放模型的下载量呈爆炸式增长,因为初创公司、大企业、研究人员和各个国家都希望参与AI革命。
英伟达的开放模型生态系统
英伟达将自己定位为“前沿AI模型构建者”,并选择完全开放的模式,以赋能全球各行各业。公司运营着价值数十亿美元的DGX AI超级计算机,用于开发自己的前沿开放模型。
| 模型/库 | 领域 | 描述 |
| La Protina / OpenFold 3 | 数字生物学 | 用于合成、生成和理解蛋白质结构。 |
| Earth 2 / Forecast Net | AI物理学 | 理解物理定律,彻底改变天气预报等领域。 |
| Neotron 3 | 大语言模型 | 首个混合Transformer SSM模型,速度极快,回答智能。 |
| Cosmos | 世界模型 | 理解世界如何运作的前沿开放世界基础模型。 |
| Groot | 机器人学 | 用于人形机器人的运动、移动和定位模型。 |
| Alpa Mayo | 自动驾驶 | 开源模型和训练数据,用于“会思考”的自动驾驶汽车。 |
| Nemo / Clara / BioNemo | AI生命周期管理 | 提供数据处理、训练、评估、护栏和部署的全套开源库。 |
英伟达的开源模型不仅是开放的,而且在多个领域(如PDF文档理解、语音识别、语义搜索)的性能排行榜上均名列前茅,证明了开放模型同样可以达到世界顶级水平。
3.智能体(Agentic AI)的兴起与应用
智能体AI是当前AI发展的最前沿领域,它彻底改变了AI的应用方式。
核心能力:推理与工具使用
智能体AI通过推理能力克服了早期模型的“幻觉”问题。它在回答问题前,能判断是否需要进行研究、是否需要使用工具,并将复杂问题分解为一系列已知步骤来解决。
这种能力使得AI能够处理从未被专门训练过的全新场景。
架构突破:多模型协同
受Perplexity等公司的启发,智能体AI的核心突破在于能够同时调用世界上所有优秀的AI模型来协同解决问题。
未来的AI应用将具备以下特征:
多模态 (Multi-modal):理解文本、语音、图像、视频、3D图形等多种信息。
多模型 (Multi-model):根据任务需求,调用最合适的模型。
多云 (Multi-cloud):模型分布在不同云端。
混合云 (Hybrid cloud):同时在云端、企业数据中心或边缘设备(如机器人、基站)运行。
应用与集成
现场演示:通过一个简单的例子,展示了如何利用DGX Spark、前沿模型API、本地开源模型和意图路由器,快速构建一个能管理日历、收发邮件并控制机器人的个人助理。黄仁勋强调,几年前这还不可想象,但“现在已变得极其简单”。
企业级应用:这种智能体框架正被集成到世界领先的企业平台中,包括Palantir、ServiceNow、Snowflake、CrowdStrike等。智能体系统正在成为这些平台的新用户界面,取代传统的电子表格和命令行,使用户能以更自然的方式进行交互。
4.物理AI(Physical AI):连接数字智能与物理世界
英伟达已在该领域深耕八年,旨在让AI跳出屏幕,理解并作用于物理世界。
三大计算平台
训练计算机:用于训练AI模型。
推理计算机:运行在汽车、机器人或工厂等边缘设备上的机器人计算机。
仿真计算机:用于模拟物理世界,让AI在数字孪生环境中学习、测试和评估其行为。
英伟达物理AI技术栈
Omniverse:基于物理的数字孪生仿真世界。
Cosmos:世界基础模型,预训练于海量视频、驾驶和机器人数据,能生成符合物理规律的逼真视频,被誉为“物理AI的ChatGPT时刻”。其核心作用是“将计算转化为数据”,通过合成数据生成来解决真实世界训练数据稀缺且昂贵的问题。
核心应用领域
1. 自动驾驶:
▪ 发布了Alpa Mayo,全球首个“会思考、能推理”的自动驾驶AI。它采用端到端训练,不仅能控制车辆,还能解释其决策原因。
▪ 这种推理能力旨在解决自动驾驶的“长尾问题”,即通过将罕见场景分解为已知的基本情况来应对。
▪ 英伟达与梅赛德斯-奔驰合作,打造了从芯片(Dual Orin)到模型(Alpa Mayo)的全栈系统。搭载该系统的梅赛德斯-奔驰CLA被NCAP评为全球最安全的汽车。
▪ 系统采用双堆栈安全冗余设计:Alpa Mayo AI堆栈与一个经典的、可完全追溯的AV堆栈并行运行,由安全评估器决定何时使用哪个系统。
2. 机器人技术:
▪ 自动驾驶的技术同样适用于各类机器人系统。英伟达通过Isaac Sim和Isaac Lab等仿真工具,为机器人开发提供了强大的平台。
▪ 生态系统正在迅速扩张,合作伙伴包括波士顿动力、Agility等众多知名机器人公司。
3. 新工业革命:
▪ 英伟达正与西门子(Siemens)、铿腾(Cadence)和新思科技(Synopsys)等工业软件巨头合作,将CUDA X、物理AI、智能体AI和Omniverse深度集成到其设计、仿真和数字孪生平台中。
▪ 未来愿景:在计算机中设计芯片和系统(由智能体设计师辅助),在计算机中设计和运营制造这些产品的工厂(巨型机器人),实现从设计到生产运营的全生命周期数字化。
5.Vera Rubin平台:为下一代AI打造的极限计算
为应对AI计算需求“飞速飙升”的挑战,英伟达推出了Vera Rubin平台。
计算需求的驱动因素
模型规模每年增长10倍。 “测试时扩展”使推理变成一个计算密集型的“思考”过程。 强化学习大幅增加了后训练(Post-training)的计算量。 生成的Token数量每年增长5倍。 激烈的技术竞赛导致前沿模型的Token成本每年下降10倍。
极限协同设计(Extreme Co-design)
由于摩尔定律放缓,单个芯片的晶体管数量增长(约1.6倍)已无法满足性能需求。英伟达的对策是同时对系统中的所有六款关键芯片进行重新设计和协同创新。
Vera Rubin平台关键组件与创新
| 组件 | 关键创新 |
| Vera CPU | 定制设计的CPU,功耗受限下的性能/瓦特是顶尖CPU的2倍。 |
| Rubin GPU | 浮点性能是Blackwell的5倍,而晶体管数量仅为其1.6倍。核心技术是MVFP4 Tensor Core,一种能自适应调整精度的处理单元,实现了性能的巨大飞跃。 |
| ConnectX-9 NIC | 为每个GPU提供1.6Tbps的横向扩展带宽。 |
| Bluefield-4 DPU | 卸载存储、安全和虚拟化任务。更重要的是,它被用于创建一种全新的存储类别Dynamo KV Cache。 |
| NVLink 6 Switch | 拥有史上最快的SerDes(400 Gbps),使72个Rubin GPU能像一个巨型GPU一样协同工作,交换带宽是全球互联网总和的两倍。 |
| Spectrum X 光子交换机 | 全球首款采用共封装光学的以太网交换机,专为AI优化。 |
系统级突破
Dynamo KV Cache:一种全新的机架内高速上下文内存存储。它利用Bluefield-4 DPU,为每个GPU额外提供16TB的快速KV缓存,解决了因模型上下文窗口增大而导致的内存和网络瓶颈问题。
能效:系统采用100%液冷,且冷却水温可达45°C,这意味着数据中心无需昂贵且耗电的冷水机组,可节省全球数据中心约6%的电力。
机密计算:所有数据在传输、静止和计算过程中均被加密,确保模型和数据的安全。
电源平滑:系统能平滑处理瞬时功率尖峰,避免了25%的电力过度配置,提高了能源利用率。
性能飞跃
训练速度:训练一个10万亿参数的前沿模型,Vera Rubin系统所需数量仅为Blackwell系统的1/4。
工厂吞吐量:在同等功耗下,数据中心的有效计算吞吐量比Blackwell高出约10倍。
Token成本:生成Token的成本效率是Blackwell的10倍,即成本仅为其1/10。
结论
黄仁勋在演讲的最后总结道,英伟达已不再仅仅是一家芯片公司,而是一家完整的系统公司。AI是一个全栈问题,英伟达正在从芯片、基础设施、模型到应用等各个层面进行重塑和创新。公司的使命是创建整个技术栈,为全球开发者和各行各业提供强大的基础平台,让他们能够利用这个平台创造出改变世界的精彩应用。