视频资产分层与 OmnimatteZero

核心判断

OmnimatteZero 这一类工具最有价值的地方,不是让游戏在 runtime 里实时生成一场完整战斗,而是把 AI 生成视频进一步变成可复用、可重组的游戏资产。

对 AI 原生游戏来说,这个方向真正解决的是一件事:把一段视频拆成“角色本体、特效、阴影、反射、环境后果、背景”等层,让视频不再只是一次性播放的成片,而是可以进入游戏系统调度的素材库。

这对 谁说我大夏无神明 有启发,但不应该成为第一版 Demo 的核心技术依赖。第一版更稳的做法是从生产源头就按层生成:神明本体、法宝、神格效果、敌神压迫、擂台背景、国运结算分别做成素材。OmnimatteZero / Generative Omnimatte 更适合作为离线补救工具:当手里只有一段完整 AI 视频时,再尝试把它拆成可复用层。

这个方向在解决什么

原始 Omnimatte 的问题意识很清楚:视频里的“对象”不只是对象本体,还包括它造成的视觉后果,比如影子、倒影、烟尘、水波和环境扰动。

传统 matting 往往只关心 alpha 边界,Omnimatte 关心的是“对象及其关联效果”能不能被分离出来。这个抽象对游戏很有价值,因为游戏里的角色技能也不是孤立的模型动作,而是角色、技能特效、环境反馈和战斗后果的组合。

后续仓库大致沿着三条线推进:

  • 从 2D 优化走向 3D 背景建模,解决相机运动和真实场景重建问题。
  • 从单视频训练走向 diffusion / generative prior,利用视频生成模型理解对象和效果。
  • 从拆层走向合成,让不同层重新放在一起时能生成新的交互效果。

仓库谱系

项目主要作用当前价值判断
OmnimatteCVPR 2021,分离对象及其影子、倒影等关联效果概念源头和 baseline。工程是单视频优化,依赖 mask / flow / homography,更适合研究复现。
Omnimatte-SPNeurIPS 2022,用 coordination games 重新建模对象与效果关联研究价值高,JAX/Haiku 管线偏重,不是优先尝试的生产工具。
FactorMatte面向 re-composition 的视频 matting / layering可以作为重组任务的参考,但训练流程重,不是大夏第一阶段需要的工具。
OmnimatteRFICCV 2023,2D 前景层 + 3D 背景模型适合移动相机和真实拍摄,但依赖 flow、mask、COLMAP/RoDynRF pose,工程成本明显高。
Generative OmnimatteCVPR 2025 Highlight,用视频 diffusion 做 object-effect removal,再优化 omnimatte 层质量路线更强,但公共版不是原论文 Lumiere-based Casper,README 明确说效果接近但不等同原版;硬件和时间成本偏高。
OmnimatteZerotraining-free,用预训练视频 diffusion 做 object removal、foreground extraction、layer composition最适合作为当前试验入口。优点是不用任务专训;限制是推荐 32GB+ VRAM,license 明确限制非商业使用。
EasyOmnimatteCVPR 2026,2-step diffusion,目标是无后处理优化的 end-to-end 分层方向值得跟踪,但 README 仍显示 inference code 未释放,短期不能当可用工具。
VideoMaMaCVPR 2026,mask-guided video matting with generative prior更像稳定视频抠像工具,已放 Hugging Face checkpoint;适合做高质量 alpha matte,但不是完整的 object-effect attribution。
Over++生成式视频合成,处理 layer interaction effects和 Omnimatte 方向互补:Omnimatte 负责拆层,Over++ 更像把层重新放进场景时补交互效果。对游戏资产重组很有启发。

对游戏资产管线的启发

AI 视频资产要进入游戏,关键不是“生成一段更好看的视频”,而是让视频资产有可调度结构。

以神战为例,一段完整战斗视频至少可以拆成几类资产:

  • 神明本体层:孙悟空、哪吒、杨戬等角色动作与姿态。
  • 神格效果层:火眼金睛、石猴本相、三头六臂、天眼、司法神性。
  • 法宝层:金箍棒、混天绫、乾坤圈、风火轮。
  • 敌神压迫层:石化凝视、蛇发、战神冲锋、火焰领域。
  • 环境后果层:擂台破裂、石化蔓延、云气翻涌、国运流动。
  • 背景层:天道擂台、敌国神域、大夏气运场。

这样一来,游戏系统不需要每次都重新生成完整神战。它可以根据天道裁定结果选择不同层:这局玩家的“石猴本相”被判为 S 级成立,就调用更高规格的抗石化神格效果;如果只被判为 B 级,就调用弱化版本,并保留部分石化压迫层。

这里的体验重点是让玩家看到:我的解释不是只变成一行文本,而是改变了战斗画面里的某一层。

对大夏的落地方式

大夏当前最适合的落地顺序是:

  1. 先做手工分层的视频资产库。

    • 每位神明至少有登场、常规攻击、受击、核心神格、反制、终结几个片段。
    • 每个片段从生产时就尽量保持角色、特效、背景分离,而不是事后强拆。
  2. 再用 OmnimatteZero 做已有成片的拆层实验。

    • 选一个明确样例,比如“孙悟空 vs 美杜莎”。
    • 目标不是验证论文指标,而是看能否把孙悟空、金光、石化、擂台背景拆成可重用素材。
  3. 用 Generative Omnimatte / VideoMaMa 作为质量补充。

    • Generative Omnimatte 更适合尝试“对象及关联效果”分层。
    • VideoMaMa 更适合做稳定 mask 和 alpha matte。
  4. 用 Over++ 关注“重组后的交互效果”。

    • 当角色层、法宝层、背景层被重新组合后,最大问题是它们看起来互不影响。
    • Over++ 的方向正好是生成 layer interaction effects,可以作为后续合成阶段的参考。
  5. runtime 只做选择和编排,不做重型生成。

    • 天道裁定输出结构化结果:神明、神格侧面、法宝、强度等级、代价、结算。
    • 视频系统根据结果选择素材层和镜头段落。
    • 离线工具负责生产和补救,runtime 负责播放、组合和解释。

风险

这个方向现在还不能被当作稳定生产管线。

主要风险有四个:

  • 算力和延迟:很多工具仍然是离线研究管线,A6000 / A100 级别 GPU 才比较现实。
  • 商业授权:OmnimatteZero license 限制非商业使用;VideoMaMa 相关 checkpoint 受 Stability AI Community License 约束;Generative Omnimatte 还依赖 CogVideoX / Wan2.1 等上游模型许可。
  • 可控性:工具能拆出一层,不代表这层一定干净、稳定、可重复进入游戏。
  • 风格一致性:大夏的问题不只是分层,还有中国神话角色、法宝、神格效果的统一美术风格,这不是 matting 工具能自动解决的。

因此,短期判断是:这些 repo 值得跟踪和小样验证,但不要把它们设为 Demo 成败前提。

我的结论

OmnimatteZero 这一类工具真正提示的是一种资产观:AI 视频不应该只被当作短片,而应该被组织成“可被系统调用的视觉层”。

如果大夏继续走 AI 视频资产驱动的 PVE 神明构筑 RPG,这条路线很值得保留。玩家的 build 不只改变数值,也改变画面层:神格层、法宝层、环境后果层和国运结算层都可以因为裁定结果而不同。

第一阶段要验证的不是“能不能自动拆干净所有视频”,而是一个更小的问题:

一段神战视频能不能被拆成若干可复用层,并在另一场裁定结果里重新组合出可信的战斗反馈?

如果这个问题成立,AI 视频资产就不再只是宣传材料,而会变成游戏系统的一部分。

参考来源