2026 年中审视 Scaling Law

这篇是对 20251201_ScalingLaw的终结与新生 的更新版。旧文抓住了一个真实转向:单纯依赖互联网文本预训练的红利在变窄,推理、强化学习、仿真和交互环境会变得更重要。但旧文也把这个转向写得过于像一次“时代断裂”:文本已经耗尽、视频是毒药、Scaling 1.0 终结、Scaling 2.0 等于 System 2。

2026 年中更稳的判断是:

Scaling Law 没有终结,它从单轴规模化变成了多轴规模化。

过去的主轴是参数、预训练 tokens 和训练算力。现在的主轴扩展成了训练算力、数据质量、后训练、可验证任务上的 RL、推理时计算、长上下文、工具使用、agent 工作流、合成数据、世界模型、真实/仿真经验,以及推理服务的单位经济模型。AI 进步仍然在吃 scale,只是 scale 的对象变多了。

旧判断里需要修正的地方

1. “文本燃料耗尽”应改成“高价值文本约束变强”

旧文里写“全网高质量文本存量只有 10T-30T tokens”,这个口径偏低。Epoch AI 对公开人类文本的估计更接近:质量和重复调整后的有效公开文本约 300T tokens,90% 区间为 100T-1000T,并预测在 2026-2032 年之间被充分利用。

所以问题不该写成“互联网已经被读完”。更精确的说法是:

可合法取得、可去重、可清洗、足够高信号、能继续提升 frontier model 的文本数据正在变成约束。

这和“没有数据了”是两回事。公开文本还很多,但高边际价值的数据越来越难找;模型也越来越需要代码、数学、科学、工具轨迹、真实用户反馈、交互经验和多模态数据。

2. “视频是毒药”应改成“视频的价值取决于行动与反馈”

旧文把视频写成低信噪比“贫矿”,方向上有道理,但“毒药”太重。OpenAI 对 Sora 的表述其实更微妙:Sora 作为 simulator 仍有大量物理限制,但继续 scale video models 可能是通向物理世界与数字世界模拟器的一条路。

视频对世界建模有潜力,但它的学习价值取决于训练目标和数据结构。

裸视频只告诉模型“画面如何连续变化”,它不一定告诉模型:

  • 行动是什么;
  • 行动前后的状态差异是什么;
  • 失败的反事实路径是什么;
  • 目标函数是什么;
  • 触觉、力反馈、控制延迟和长期后果是什么。

所以视频作为视觉世界的压缩材料有价值;但如果目标是 agent、机器人或游戏智能体,只看第三人称视频不够。更有价值的是 video + action + state + reward + tool trace + memory。

3. “Scaling 2.0 = Test-Time Compute”太窄

OpenAI 从 o1 到 GPT-5,再到 GPT-5.5,确实把“什么时候快速回答,什么时候深度思考”做成了产品结构。Anthropic Claude 4 系列也把 extended thinking、工具使用、effort control 和长任务执行变成显性能力。DeepSeek-R1 则证明,在数学、代码、STEM 这类可验证任务上,RL 可以诱发自我反思、验证和策略调整。

但 test-time compute 只是新 scaling 的一条轴。2026 年中看,至少有七条轴同时在扩展:

扩展的对象代表信号
预训练规模FLOP、tokens、模型容量Epoch AI 仍观察到 frontier 训练算力约 5x/year 增长
数据质量高信号数据、专用数据、许可数据数据从“更多网页”转向“更可用的学习信号”
后训练SFT、RLHF、RLAIF、偏好、宪法式反馈Claude / GPT / DeepSeek 都把后训练视为核心能力来源
可验证 RL数学、代码、STEM、工具调用DeepSeek-R1 的核心价值在可验证任务
推理时计算thinking、search、verifier、parallel computeGPT-5.5 Pro 使用更多 test-time compute,Claude 提供 effort control
推理经济token 价格、缓存、路由、fast mode推理价格下降很快,但 reasoning premium 仍明显
经验与世界仿真、游戏、机器人、视频世界模型Era of Experience、SIMA、Sora、Cosmos 等方向

因此,“Scaling 2.0”不应被理解成“模型多想一会儿”。它更像一套新的资源分配问题:哪些问题值得用训练算力解决,哪些值得用推理算力解决,哪些需要环境反馈,哪些需要外部工具,哪些只能靠真实经验校正。

2026 年中新增的关键信息

1. Frontier scaling 仍在继续,而且基础设施没有停

Epoch AI 的趋势页显示,frontier language model 的训练算力自 2020 年以来约 5x/year 增长;预训练算力效率约 3x/year 改善;LLM 在固定能力水平下的推理价格下降极快,但不同任务差异很大。

这说明“Scaling 走不动了”这个判断站不住。继续 scale 的代价已经从“买更多 GPU”升级成了“电力、数据中心、芯片供应、网络、数据、延迟和财务回报”的综合工程约束。

Epoch AI 2024 的 2030 报告认为,2e29 FLOP 级训练运行在技术上大概率可行;最先形成约束的可能是电力和芯片制造能力。

所以 2026 年中要避免一个误判:看到某一代模型的感知提升不够大,就说 Scaling Law 死了。真实情况更像是,规模化从模型论文问题变成了基础设施、能源、供应链、资本开支和产品收入共同决定的问题。

2. GPT-5.5 / Claude Opus 4.8 / Gemini 3 / Llama 4 都在把模型变成系统

2025-2026 的前沿模型发布有一个共同趋势:厂商宣传的重点从“base model 更大”,转向“系统能做更长的任务”。

OpenAI GPT-5 把 fast model、thinking model 和 router 做成统一系统;GPT-5.5 进一步强调 agentic coding、computer use、online research、data analysis、document/spreadsheet creation 和跨工具完成任务。OpenAI 的 GPT-5.5 system card 还明确提到 GPT-5.5 Pro 使用 parallel test-time compute。

Anthropic Claude 4 系列强调 hybrid reasoning、extended thinking with tool use、parallel tool use、memory 和长时间自主编码。Claude Opus 4.8 进一步提供 effort control,并把 Claude Code 的 dynamic workflows 推向大规模代码库任务。

Google Gemini 3 则把 reasoning、multimodal、coding、agentic capability 和 Deep Think mode 放在一起;Gemini API 的 changelog 显示 Gemini 3 Pro Preview、Gemini 3 Flash Preview、Computer Use tool、Deep Research Agent 等能力都在 2025 年底到 2026 年初进入开发者侧。

Meta Llama 4 则在延续 open-weight 路线的同时,重点转向 natively multimodal、MoE、长上下文,并用 Behemoth 作为 teacher model 支撑 Scout / Maverick。

这个变化很关键:前沿产品的单位正在变成“模型 + 路由 + 工具 + 记忆 + 长上下文 + 推理预算 + 安全策略 + 价格层级”。

3. DeepSeek 的启示:可验证反馈 + 工程效率

DeepSeek-V3 使用 14.8T tokens 预训练,并通过 MoE、FP8、通信优化、多 token prediction 等方式降低训练和推理成本。DeepSeek-R1 的核心则是用 RL 激励 reasoning,在可验证任务上诱发自我反思、验证和动态策略调整。

这对 Scaling Law 的启示有两层:

第一,预训练 token 数只是解释变量之一。模型架构、激活参数、训练精度、通信效率、数据配比、post-training 和 distillation 都会改变“同样 FLOP 能买到多少能力”。

第二,RL 的价值首先出现在“反馈清晰”的任务里。数学题、代码测试、STEM 题、工具调用结果,都能提供相对明确的奖励信号。开放式写作、审美、战略判断、游戏设计和人类偏好则麻烦得多,因为 reward 很难写对。

所以 DeepSeek-R1 支持的是一个更精确的判断:

推理能力可以通过 RL 被放大,但这种放大最先发生在可验证世界里。

这也解释了为什么 coding agent、数学、科学辅助、网络安全和数据分析会成为 reasoning model 的第一批高价值场景。

4. 合成数据的关键资产是验证器

旧文写过“AI 自己写书自己学”的衔尾蛇效应。2026 年看,这个方向必须拆开。

一方面,合成数据和蒸馏确实有效。DeepSeek-V3 把 R1 的 long-CoT 能力蒸馏到普通模型,显著提升数学和代码表现。Meta Llama 4 也明确用更大的 teacher model 支撑更高效的 released models。

另一方面,Nature 的 model collapse 研究提醒:如果递归训练主要依赖模型生成内容,且缺乏真实数据分布锚点,模型会逐代丢失分布尾部,最终误感知现实。

这里的结论可以写得更精确:

合成数据的价值取决于验证闭环。

可用的闭环包括:

  • 代码能不能跑;
  • 数学证明能不能验;
  • 工具结果是否返回真实状态;
  • 实验是否复现;
  • 用户是否持续采用;
  • 仿真环境是否足够接近真实约束;
  • 人类数据是否保留了分布尾部和审美差异。

没有验证器,合成数据只是更便宜的回声;有验证器,它才可能成为新的 scaling fuel。

5. “经验时代”比“视频时代”更适合作为下一阶段命名

David Silver 和 Richard Sutton 在 2025 年提出 Era of Experience,核心意思是:下一代 agent 会主要从经验中学习,减少对人类既有文本和示范数据的依赖。

这比“视频是新燃料”更准确。

视频是观察数据;经验是带行动和反馈的数据。游戏、仿真、机器人、工具使用、在线实验、代码执行、用户交互,都可以产生经验。经验的关键在于闭环:

状态 行动 后果 评价 记忆 策略更新。

这也是游戏对 AI 的特殊价值。游戏的重要性来自状态、规则、行动、反馈、目标、反事实和可重复实验。对 AI 原生游戏来说,这个判断很重要:未来真正有价值的游戏环境,可能同时是给玩家玩的内容,也是让 AI 学习、评估和暴露能力边界的实验场。

2026 年中的结论

结论一:Scaling Law 仍然成立,但旧的低风险路线结束了

从 2020 到 2024,行业最舒服的叙事是:更多参数、更多 tokens、更多 GPU,会稳定换来更强模型。2026 年看,这条路线仍然有效,但已经不再低风险。

风险来自四个地方:

  • 数据越来越贵,也越来越难合法和高质量;
  • frontier training 的能源、芯片和数据中心开支变成巨型资本工程;
  • benchmark 提升不一定等价于现实工作流提升;
  • 推理能力越强,运行成本、安全风险和 reward misspecification 越突出。

因此,Ilya 所说的“回到研究时代”可以理解为:继续 scale 仍有回报,但不能只靠扩大同一套配方。研究重新变重要,是因为每一单位计算、每一条数据、每一次推理、每一个验证器的效率都开始决定胜负。

结论二:AI 能力增长的中心从“模型知识”转向“任务闭环”

早期 LLM 的核心想象是“它知道多少”。2026 年中的核心问题是“它能不能把任务做完”。

这包括:

  • 能否判断问题难度并分配推理预算;
  • 能否调用工具并理解工具结果;
  • 能否保持长上下文和长期目标;
  • 能否检查自己的输出;
  • 能否在失败后修正策略;
  • 能否把一次任务中的经验沉淀到下一次任务。

这也是 GPT-5.5、Claude Opus 4.8、Gemini 3、DeepSeek-R1 等模型共同指向的地方:下一阶段的 frontier 会从聪明回答推进到可靠执行。

结论三:可验证任务会最先吃到新 scaling 红利

数学、代码、科学计算、工程调试、数据分析、网络安全、自动化办公,是 reasoning scaling 最先兑现的地方。原因很简单:它们有外部反馈。

游戏设计、叙事、审美、组织判断、产品战略也会受益,但不会像代码一样线性起飞。因为这些任务的 reward 更软,评估更依赖人类语境、文化品味和长期效果。

这对游戏设计师的启发是:AI 的高价值用法,是围绕可验证的中间任务组织工作流:生成玩法变量、跑模拟、检查约束、找反例、比较版本、总结玩家反馈、提出可测试假设。让 AI 在明确闭环里变强,减少它在开放审美里自说自话的空间。

结论四:推理成本会塑造产品形态

推理价格在下降,但高级 reasoning 仍然有溢价。OpenAI GPT-5.5 Pro、Claude effort control、fast mode、cached input、long context pricing、batch/flex/priority 这类设计,都说明“思考”已经变成可计价资源。

未来 AI 产品的设计问题会变成:

  • 哪些请求值得深度推理;
  • 哪些请求应该用便宜模型;
  • 哪些上下文应该缓存;
  • 哪些任务适合异步完成;
  • 哪些能力应该在端侧运行;
  • 哪些体验不能让用户感到账单压力。

这和 20260609_LLM时代商业模式展望 是同一个问题:AI 产品的边际成本不再接近零。越 agentic,越要管理 runtime economics。

结论五:下一阶段的关键词是“更强反馈”

如果只留一句 2026 年中的判断,我会写成:

AI 继续进步的关键,是建立更多高质量反馈闭环。

文本、视频、代码、游戏、仿真、用户交互、机器人数据、工具轨迹、科学实验,都可以成为燃料。但它们的价值不由体量决定,而由反馈质量决定。

能验证,就能放大。

不能验证,就容易变成幻觉、模式坍缩或过度优化指标。

对 AI 原生游戏的启发

AI 原生游戏最值得抓住的,是游戏可以成为可交互、可验证、可记忆、可重复的经验环境。

一个真正有价值的 AI 游戏环境,应该能提供:

  • 清晰的世界状态;
  • 可执行的行动空间;
  • 玩家和 AI 都能理解的目标;
  • 失败和成功的反馈;
  • 可回放的决策轨迹;
  • 可比较的版本差异;
  • 能沉淀到角色、世界或系统记忆里的长期后果。

这样游戏会从内容容器扩展为经验引擎。它既能服务玩家体验,也能服务 AI 的能力评估和持续学习。

这可能是游戏行业在新 Scaling 时代的独特位置:游戏会被 AI 改造,也可能成为训练和评估下一代 agent 的重要场域。

参考来源