AI 的前沿流派:超越 Scaling 的探索者们

20251127_Ilya Sutskever访谈宣告“Scaling 时代终结”之前,其实已经有几位顶尖科学家在布局“下一代 AI”的架构。他们不相信单纯靠堆砌文本数据能通向 AGI,并各自提出了不同的突围路径。

1. Yann LeCun (Meta 首席科学家):世界模型派

核心主张: “LLM 对物理世界一无所知,我们需要世界模型。”

LeCun 是目前大语言模型(LLM)最激烈的批评者之一。他认为现在的 GPT 只是在操纵符号,并不理解符号背后的物理实体。

1.1 他的批评 (The Critique)

  • 文本带宽太低: 他有一个著名的论断:“一个 4 岁的孩子在醒着的每一秒钟,通过视觉感知到的数据量,就超过了所有互联网文本的总和。”

  • 预测像素是错误的: 他反对现在的视频生成模型(如 Sora),因为它们在预测每一个像素的颜色(Generative),这太浪费算力且容易产生幻觉。人类不预测像素,人类预测“状态”。

1.2 他的方案:JEPA (Joint Embedding Predictive Architecture)

  • 核心逻辑:不要让 AI 画出下一帧的画面(像素),而是让 AI 预测下一帧的“抽象特征” (Representation)

  • 比喻:当你扔出一把钥匙,你的大脑不会在视网膜上逐个像素地渲染钥匙的轨迹,而是直接预测“钥匙会落在桌子上”这个结果状态

  • 目标:让 AI 获得“常识” (Common Sense)“物理直觉”,而不是语言能力。

2. Demis Hassabis (DeepMind 创始人):仿真与游戏派

核心主张: “游戏是 AGI 的终极测试场,因为它是唯一允许无限试错的地方。”

DeepMind 的基因就是游戏(AlphaGo, AlphaStar)。Hassabis 认为,现实世界太危险、数据太贵,而高保真的游戏世界是完美的训练皿。

2.1 他的逻辑 (The Logic)

  • 交互产生智能: 只有通过与环境的交互(Interactive),AI 才能学会因果律。文本是静态的,游戏是动态的。

  • 从专用到通用:以前的 AI 只能玩一个游戏(如下围棋),现在的目标是玩所有游戏。

2.2 代表作:SIMA (Scalable Instructable Multiworld Agent)

  • 发布时间: 2024 年

  • 做什么:SIMA 不是为了“赢”或“拿高分”,而是为了“像人一样听懂指令”

    • 指令:“去把那辆红色的车开到悬崖边。”

    • 跨游戏泛化:它在《模拟山羊》里学会了“开车”,到了《无人深空》里依然会开,尽管操作按键完全不同。

  • 意义:这证明了 AI 可以通过视觉和语言指令,跨越不同的物理法则进行概念泛化

3. Jim Fan (NVIDIA 高级科学家):具身智能派

核心主张: “Foundation Agent (基础智能体) 将取代 Foundation Model (基础模型)。”

Jim Fan 致力于将 GPT 的大脑装进机器人的身体(无论是虚拟的还是实体的)。

3.1 他的愿景 (The Vision)

  • 从 Chatbot 到 Agent:未来的 AI 不应该只是陪你聊天,而应该能帮你干活

  • 元宇宙即训练场: 他极其推崇在 Minecraft(我的世界)里训练 AI。因为 Minecraft 拥有近乎无限的开放性和复杂的合成表(逻辑链)。

3.2 代表作:Voyager & Eureka

  • Voyager (Minecraft AI):

    • 这是一个会写代码来控制自己的 AI。它不是靠鼠标点击,而是靠写 Python 脚本来挖掘、打怪、造房子。

    • **核心突破:它通过“终身学习”**机制,不断积累自己的代码库(Skill Library)。这解决了 AI “学了就忘”的问题。

  • Eureka (奖励设计):

    • 也就是我们之前讨论的“AI 教练”。它利用 GPT-4 来编写奖励函数,训练笔转机器手,表现比人类专家写的代码还好。

4. 总结:殊途同归

这三位科学家虽然切入点不同,但都在解决同一个问题——“文本数据的局限性”

科学家核心关键词解决什么问题?理想的终极形态
Ilya SutskeverReasoning (推理)解决“数据枯竭”,让 AI 学会思考超级科学家 (能发现新知识)
Yann LeCunWorld Model (世界模型)解决“物理幻觉”,让 AI 理解现实全能管家 (懂物理常识,不犯蠢)
Demis HassabisSimulation (仿真)解决“试错成本”,让 AI 掌握因果通用决策者 (在任何环境下生存)
Jim FanAgent (智能体)解决“只说不做”,让 AI 具备行动力数字工匠 (在虚拟/现实中干活)

这里带来的启示: 当我们在谈论 AI 进步时,不要只盯着“ChatGPT 又更新了什么模型”,而要关注这些**“非语言模型”的突破。未来的 Scaling Law 2.0,很可能就诞生在这些实验室的“游戏画面”和“机器人手臂”**之中。