AI 的前沿流派:超越 Scaling 的探索者们
在20251127_Ilya Sutskever访谈宣告“Scaling 时代终结”之前,其实已经有几位顶尖科学家在布局“下一代 AI”的架构。他们不相信单纯靠堆砌文本数据能通向 AGI,并各自提出了不同的突围路径。
1. Yann LeCun (Meta 首席科学家):世界模型派
核心主张: “LLM 对物理世界一无所知,我们需要世界模型。”
LeCun 是目前大语言模型(LLM)最激烈的批评者之一。他认为现在的 GPT 只是在操纵符号,并不理解符号背后的物理实体。
1.1 他的批评 (The Critique)
-
文本带宽太低: 他有一个著名的论断:“一个 4 岁的孩子在醒着的每一秒钟,通过视觉感知到的数据量,就超过了所有互联网文本的总和。”
-
预测像素是错误的: 他反对现在的视频生成模型(如 Sora),因为它们在预测每一个像素的颜色(Generative),这太浪费算力且容易产生幻觉。人类不预测像素,人类预测“状态”。
1.2 他的方案:JEPA (Joint Embedding Predictive Architecture)
-
核心逻辑:不要让 AI 画出下一帧的画面(像素),而是让 AI 预测下一帧的“抽象特征” (Representation)。
-
比喻:当你扔出一把钥匙,你的大脑不会在视网膜上逐个像素地渲染钥匙的轨迹,而是直接预测“钥匙会落在桌子上”这个结果状态。
-
目标:让 AI 获得“常识” (Common Sense)和“物理直觉”,而不是语言能力。
2. Demis Hassabis (DeepMind 创始人):仿真与游戏派
核心主张: “游戏是 AGI 的终极测试场,因为它是唯一允许无限试错的地方。”
DeepMind 的基因就是游戏(AlphaGo, AlphaStar)。Hassabis 认为,现实世界太危险、数据太贵,而高保真的游戏世界是完美的训练皿。
2.1 他的逻辑 (The Logic)
-
交互产生智能: 只有通过与环境的交互(Interactive),AI 才能学会因果律。文本是静态的,游戏是动态的。
-
从专用到通用:以前的 AI 只能玩一个游戏(如下围棋),现在的目标是玩所有游戏。
2.2 代表作:SIMA (Scalable Instructable Multiworld Agent)
-
发布时间: 2024 年
-
做什么:SIMA 不是为了“赢”或“拿高分”,而是为了“像人一样听懂指令”。
-
指令:“去把那辆红色的车开到悬崖边。”
-
跨游戏泛化:它在《模拟山羊》里学会了“开车”,到了《无人深空》里依然会开,尽管操作按键完全不同。
-
-
意义:这证明了 AI 可以通过视觉和语言指令,跨越不同的物理法则进行概念泛化。
3. Jim Fan (NVIDIA 高级科学家):具身智能派
核心主张: “Foundation Agent (基础智能体) 将取代 Foundation Model (基础模型)。”
Jim Fan 致力于将 GPT 的大脑装进机器人的身体(无论是虚拟的还是实体的)。
3.1 他的愿景 (The Vision)
-
从 Chatbot 到 Agent:未来的 AI 不应该只是陪你聊天,而应该能帮你干活。
-
元宇宙即训练场: 他极其推崇在 Minecraft(我的世界)里训练 AI。因为 Minecraft 拥有近乎无限的开放性和复杂的合成表(逻辑链)。
3.2 代表作:Voyager & Eureka
-
Voyager (Minecraft AI):
-
这是一个会写代码来控制自己的 AI。它不是靠鼠标点击,而是靠写 Python 脚本来挖掘、打怪、造房子。
-
**核心突破:它通过“终身学习”**机制,不断积累自己的代码库(Skill Library)。这解决了 AI “学了就忘”的问题。
-
-
Eureka (奖励设计):
- 也就是我们之前讨论的“AI 教练”。它利用 GPT-4 来编写奖励函数,训练笔转机器手,表现比人类专家写的代码还好。
4. 总结:殊途同归
这三位科学家虽然切入点不同,但都在解决同一个问题——“文本数据的局限性”。
| 科学家 | 核心关键词 | 解决什么问题? | 理想的终极形态 |
| Ilya Sutskever | Reasoning (推理) | 解决“数据枯竭”,让 AI 学会思考 | 超级科学家 (能发现新知识) |
| Yann LeCun | World Model (世界模型) | 解决“物理幻觉”,让 AI 理解现实 | 全能管家 (懂物理常识,不犯蠢) |
| Demis Hassabis | Simulation (仿真) | 解决“试错成本”,让 AI 掌握因果 | 通用决策者 (在任何环境下生存) |
| Jim Fan | Agent (智能体) | 解决“只说不做”,让 AI 具备行动力 | 数字工匠 (在虚拟/现实中干活) |
这里带来的启示: 当我们在谈论 AI 进步时,不要只盯着“ChatGPT 又更新了什么模型”,而要关注这些**“非语言模型”的突破。未来的 Scaling Law 2.0,很可能就诞生在这些实验室的“游戏画面”和“机器人手臂”**之中。