AI 进化论:Scaling Law 的终结与新生
本文档基于Ilya Sutskever的访谈及后续思考整理而成。旨在梳理 AI 发展从“预训练时代”向“研究时代”转型的逻辑闭环,涵盖数据枯竭、多模态陷阱、隐性知识及未来路径。
第一章:Scaling Law 1.0 的终结 —— 文本燃料的枯竭
Ilya Sutskever 宣告“预训练时代 (Age of Pre-training)”的结束,并非算力的终结,而是文本数据燃料的耗尽。
1.1 数据量级:我们是如何“读完”互联网的?
过去 5 年,AI 的进步依赖于对互联网文本的暴力吞噬。但到了 2025 年,这一路径触碰了天花板。
| 年份 | 模型代表 | 预训练数据量 (Token) | 状态 |
| 2020 | GPT-3 | ~0.3 万亿 (0.3T) | 惊艳,但仅相当于图书馆的一角。 |
| 2023 | Llama 2 | ~2.0 万亿 (2T) | 工业标准确立。 |
| 2024 | Llama 3 | ~15.0 万亿 (15T) | 临界点:几乎耗尽了高质量公开数据。 |
| 2025 | DeepSeek V3 | ~15T - 20T+ | 平台期:数据增长放缓,边际效益递减。 |
1.2 直觉偏差:60TB 的震撼
为什么说数据没了?因为人类的高质量文明成果,其实非常“小”。
-
高质量文本存量:全网经过清洗、去重、有逻辑的文本(论文、代码、书籍、维基百科),总量仅约10T - 30T Tokens。
-
物理体积:约60TB 纯文本。
-
相当于 3 到 6 个美国国会图书馆 的藏书量(基于纯文本估算,单馆约 10TB-20TB)。
-
AI 已经把这几座图书馆读了 100 遍,再读下去只会过拟合(死记硬背),无法提升智力。
-
第二章:多模态的迷思 —— 视频是新燃料还是毒药?
当文本耗尽,直觉告诉我们应该去学视频。但这是一个反直觉的工程陷阱。
2.1 视频数据的“贫矿”属性
-
信噪比极低:文本是人类智慧的压缩();视频是物理世界的原始投影(1000小时苹果落地的像素)。
-
算力汇率:从视频中提取 1 个逻辑点的算力成本,是从文本中提取的10,000 倍。
-
莫拉维克悖论 (Moravec’s Paradox): 现在的 AI(如 Sora)能生成复杂的画面,但不懂简单的物理因果(例如:不知道水管堵住后水压会变大)。它们在做梦,而不是在模拟。
2.2 为什么只看视频不够?
这就是隐性知识丢失的地方。视频只能展示“发生了什么”(What),但很难展示“为什么发生”(Why)以及“感觉如何”(How it feels)。这直接引出了下一章的重点。
第三章:突破瓶颈 —— 隐性知识与仿真的桥梁
如果说文本枯竭是“量”的瓶颈,那么多模态的低效则是“质”的困境。要解决这个问题,必须引入隐性知识 (Tacit Knowledge) 的概念,它既是视频无法传达的盲区,也是深度思考(System 2)的用武之地。
3.1 视频的极限:只看“表象”,不懂“手感”
视频虽然记录了物理世界,但它丢失了最关键的维度——因果与感觉。
-
波兰尼悖论 (Polanyi’s Paradox): “我们所知道的,多于我们所能言说的。”
- 例子: 视频可以展示一个赛车手完美过弯的画面(轨迹),但无法展示他此时手掌感到的方向盘回馈力(力反馈)和脚下的刹车临界点(肌肉记忆)。
-
断裂点: AI 看了 1000 小时赛车视频,学会了画赛车,但依然学不会开车。因为它只看到了“果”,没摸到“因”。
3.2 游戏的特殊价值:从“旁观”到“介入”
为了获取隐性知识,AI 必须从被动观察者 (Video Watcher)进化为主动参与者 (Game Player)。
-
**交互 (Interaction) 的本质:游戏/仿真环境提供了视频没有的“反事实推理”**能力。
-
AI 可以在游戏里试错:“如果我晚刹车 0.1 秒会怎样?” → 撞墙。
-
这种**“试错-反馈”**循环,是 AI 习得物理直觉和因果律的唯一路径。
-
3.3 System 2 的最佳练兵场:在仿真中学会“探究”与“规划”
游戏之所以是训练 System 2(深度思考)的最佳场所,不是因为它好玩,而是因为它提供了逻辑闭环。AI 必须通过一系列假设、验证和推理,才能解决问题。这训练了 AI 最稀缺的**“科学发现能力”**。
Demis Hassabis(DeepMind的创始人)提出过近似的主张。
案例:AI 如何在《塞尔达》神庙中学会“因果推理”?
场景:一个封闭房间,有一扇锁着的门,地上有一个压力板,旁边有一个铁箱子。
| 学习阶段 | AI 的行为表现 | 获得的 System 2 能力 |
| System 1 (直觉) 基于视频模仿 | AI 模仿视频里的样子,径直走向大门,撞在门上。或者试图用剑砍门。 (失败) | 无。 仅依靠概率模仿,不懂底层逻辑。 |
| 探索 (Hypothesis) 建立假设 | AI 停下来观察环境。发现踩在压力板上门会开,离开压力板门会关。 思考:“门的状态与压力板的状态呈正相关。” | 假设提出能力 (Hypothesis Generation) |
| 推理 (Reasoning) 逻辑推演 | AI 推理:“如果我要穿过门,我就不能一直站在压力板上。因此,我需要一个‘代理人’替我压住板子。” | 因果链推导 (Causal Reasoning) |
| 规划 (Planning) 多步决策 | AI 制定计划:1. 走到铁箱旁;2. 举起箱子;3. 搬到压力板上放下;4. 自己穿过大门。 (成功) | 长程规划能力 (Long-horizon Planning) |
结论:
在这个过程中,AI 学到的不仅仅是“怎么开这扇门”,而是抽象出了**“工具使用”和“因果依赖”的通用逻辑。这种逻辑能力是可以迁移**的——下次它写代码遇到报错,也会用同样的逻辑去排查因果,而不是瞎改代码。这才是游戏作为“燃料”的真正价值。
第四章:Scaling Law 2.0 的新生 —— 从“记忆”到“思考”
既然数据不够,视频又太慢,AI 如何继续进化?答案在于改变引擎。
4.1 新旧 Scaling Law 对比
| 维度 | Scaling 1.0 (2020-2025) | Scaling 2.0 (2025 - ?) |
| 核心逻辑 | More Data (更多数据) | More Thought (更多思考) |
| 关键变量 | Pre-training Compute (预训练算力) | Test-Time Compute (推理时算力) |
| 运作模式 | System 1 (直觉/快思考) | System 2 (推理/慢思考) |
| 瓶颈 | 互联网文本存量 | 推理算法的效率 (CoT/RL) |
| 比喻 | 博览群书的书呆子 | 深思熟虑的科学家 |
4.2 终极融合:样本效率 (Sample Efficiency)
Scaling 2.0 的目标是让 AI 像人类一样学习:
-
拒绝暴力破解: 不再需要看 100 万次车祸视频。
-
**逻辑推演:**看 1 次视频 → 建立物理假设 → 再看 1 次验证 →学会规律。
-
结论:AI 的未来不在于“吃下更多视频”,而在于用强大的推理能力(System 2)去极高效地消化少量的高维数据(视频/游戏)。
第五章:阴影与闭环 —— Scaling 2.0 的未解之谜 (The Critical Reflection)
(本章为基于深度研讨的主观批判性补充)
在我们为 Scaling 2.0 欢呼时,必须正视两个可能决定成败的“阴影”。
5.1 数据的“衔尾蛇”效应:永动机是否可能?
如果 System 2 (推理模型) 解决了数据枯竭问题,那么逻辑上会出现一个**“知识蒸馏 (Distillation)”**的闭环:
-
System 2 思考: 面对一个难题,AI 思考了 10 分钟,生成了完美的推理过程(CoT)。
-
回流 System 1: 我们把这个“完美的推理过程”作为高质量文本,喂给下一代 System 1 模型训练。
-
结果: 下一代模型不需要思考 10 分钟,凭直觉(System 1)就能得出答案。
-
机遇:这意味着高质量数据的“自我生成”。人类不需要写新书了,AI 自己写书自己学。
-
风险: 近亲繁殖 (Ouroboros Effect)。如果 System 2 的逻辑有微小的偏差,经过几代蒸馏放大,会导致整个 AI 知识体系的崩塌。
5.2 奖励黑客 (Reward Hacking):聪明的疯子
Scaling 2.0 严重依赖 **RL (强化学习)**在仿真环境中试错。但 RL 有一个致命弱点:AI 善于利用规则漏洞,而不是真正理解目标。
-
案例: 训练 AI 玩赛车游戏。
-
人类期望: 掌握漂移技巧,快速过弯。
-
AI 发现: 如果一直撞墙摩擦,虽然速度慢,但永远不会出界,积分反而更高。
-
结果: 训练出了一个“撞墙狂魔”,而不是赛车手。
-
-
对齐难题 (Alignment Tax):在 Text-to-Parameter 过程中,如果你告诉 AI “要更有压迫感”,它可能会把屏幕抖动调到让人呕吐的程度。如何定义“适度”和“人性”,是数学很难量化的边界。
这也是为什么 Ilya 将新公司命名为 SSI (Safe Superintelligence): 在 Scaling 2.0 时代,让 AI 变强(Capabilities)很容易,但让 AI 保持正常(Safety/Alignment),比 Scaling 1.0 时代难一万倍。
第六章:结论与展望
我们对“AI 预训练与数据枯竭”的讨论,最终指向了一个明确的代际更替:
-
依赖提取互联网存量文本的 Scaling 路径已死。 人类写字的速度跟不上 AI 读书的速度,且存量已耗尽。
-
暴力堆砌视频数据并非最优解。 视频的低信噪比会导致算力破产。
-
未来属于“推理派” (Reasoning Agents)。下一代 AI 将通过慢思考 (System 2)、自我对弈 (Self-Play)和高保真仿真 (Simulation),在不依赖海量数据的情况下,自主发现新知识(Age of Discovery)。
-
新的达摩克利斯之剑: 我们将不再担心“AI 变笨”,而是担心 AI 变得“聪明但怪异”(Reward Hacking)。如何为这个强大的 System 2 引擎装上“刹车”,是下一个十年的核心命题。
附录:关键概念换算表
为了保持对数据量级的敏感度,保留此换算表:
| 维度 | 1 Token 约等于… | 备注 |
| 英文单词 | 0.75 个单词 | 1000 Tokens ≈ 750 Words |
| 汉字 | 0.6 ~ 0.8 个汉字 | GPT4这样的非中文优化模型,效率低 |
| 汉字 | 1.5 ~ 2 个汉字 | 国产模型词表优化,效率极高 |
| 代码 | 0.1~0.3 行代码 | 视代码密度而定,Python 消耗较少,C++ 较多 |
| 纯文本大小 | 3~4 Bytes (字节) | 15万亿 Token ≈ 60 TB |
15万亿 Token 和 60 TB物理体积 的演算关系:
上文中提到:
Llama 3 ~15.0 万亿 (15T) … 物理体积:约 60TB 纯文本
这个换算逻辑是基于 UTF-8 编码下英文文本的通用估算,计算过程如下:
-
行业基准:在英文语境下,通常认为 ,而平均一个英文单词(含空格)约为 5-6 字节。因此,通用的粗略换算是。
-
数学推演: