视频资产分层与 OmnimatteZero
核心判断
OmnimatteZero 这一类工具最有价值的地方,不是让游戏在 runtime 里实时生成一场完整战斗,而是把 AI 生成视频进一步变成可复用、可重组的游戏资产。
对 AI 原生游戏来说,这个方向真正解决的是一件事:把一段视频拆成“角色本体、特效、阴影、反射、环境后果、背景”等层,让视频不再只是一次性播放的成片,而是可以进入游戏系统调度的素材库。
这对 谁说我大夏无神明 有启发,但不应该成为第一版 Demo 的核心技术依赖。第一版更稳的做法是从生产源头就按层生成:神明本体、法宝、神格效果、敌神压迫、擂台背景、国运结算分别做成素材。OmnimatteZero / Generative Omnimatte 更适合作为离线补救工具:当手里只有一段完整 AI 视频时,再尝试把它拆成可复用层。
这个方向在解决什么
原始 Omnimatte 的问题意识很清楚:视频里的“对象”不只是对象本体,还包括它造成的视觉后果,比如影子、倒影、烟尘、水波和环境扰动。
传统 matting 往往只关心 alpha 边界,Omnimatte 关心的是“对象及其关联效果”能不能被分离出来。这个抽象对游戏很有价值,因为游戏里的角色技能也不是孤立的模型动作,而是角色、技能特效、环境反馈和战斗后果的组合。
后续仓库大致沿着三条线推进:
- 从 2D 优化走向 3D 背景建模,解决相机运动和真实场景重建问题。
- 从单视频训练走向 diffusion / generative prior,利用视频生成模型理解对象和效果。
- 从拆层走向合成,让不同层重新放在一起时能生成新的交互效果。
仓库谱系
| 项目 | 主要作用 | 当前价值判断 |
|---|---|---|
| Omnimatte | CVPR 2021,分离对象及其影子、倒影等关联效果 | 概念源头和 baseline。工程是单视频优化,依赖 mask / flow / homography,更适合研究复现。 |
| Omnimatte-SP | NeurIPS 2022,用 coordination games 重新建模对象与效果关联 | 研究价值高,JAX/Haiku 管线偏重,不是优先尝试的生产工具。 |
| FactorMatte | 面向 re-composition 的视频 matting / layering | 可以作为重组任务的参考,但训练流程重,不是大夏第一阶段需要的工具。 |
| OmnimatteRF | ICCV 2023,2D 前景层 + 3D 背景模型 | 适合移动相机和真实拍摄,但依赖 flow、mask、COLMAP/RoDynRF pose,工程成本明显高。 |
| Generative Omnimatte | CVPR 2025 Highlight,用视频 diffusion 做 object-effect removal,再优化 omnimatte 层 | 质量路线更强,但公共版不是原论文 Lumiere-based Casper,README 明确说效果接近但不等同原版;硬件和时间成本偏高。 |
| OmnimatteZero | training-free,用预训练视频 diffusion 做 object removal、foreground extraction、layer composition | 最适合作为当前试验入口。优点是不用任务专训;限制是推荐 32GB+ VRAM,license 明确限制非商业使用。 |
| EasyOmnimatte | CVPR 2026,2-step diffusion,目标是无后处理优化的 end-to-end 分层 | 方向值得跟踪,但 README 仍显示 inference code 未释放,短期不能当可用工具。 |
| VideoMaMa | CVPR 2026,mask-guided video matting with generative prior | 更像稳定视频抠像工具,已放 Hugging Face checkpoint;适合做高质量 alpha matte,但不是完整的 object-effect attribution。 |
| Over++ | 生成式视频合成,处理 layer interaction effects | 和 Omnimatte 方向互补:Omnimatte 负责拆层,Over++ 更像把层重新放进场景时补交互效果。对游戏资产重组很有启发。 |
对游戏资产管线的启发
AI 视频资产要进入游戏,关键不是“生成一段更好看的视频”,而是让视频资产有可调度结构。
以神战为例,一段完整战斗视频至少可以拆成几类资产:
- 神明本体层:孙悟空、哪吒、杨戬等角色动作与姿态。
- 神格效果层:火眼金睛、石猴本相、三头六臂、天眼、司法神性。
- 法宝层:金箍棒、混天绫、乾坤圈、风火轮。
- 敌神压迫层:石化凝视、蛇发、战神冲锋、火焰领域。
- 环境后果层:擂台破裂、石化蔓延、云气翻涌、国运流动。
- 背景层:天道擂台、敌国神域、大夏气运场。
这样一来,游戏系统不需要每次都重新生成完整神战。它可以根据天道裁定结果选择不同层:这局玩家的“石猴本相”被判为 S 级成立,就调用更高规格的抗石化神格效果;如果只被判为 B 级,就调用弱化版本,并保留部分石化压迫层。
这里的体验重点是让玩家看到:我的解释不是只变成一行文本,而是改变了战斗画面里的某一层。
对大夏的落地方式
大夏当前最适合的落地顺序是:
-
先做手工分层的视频资产库。
- 每位神明至少有登场、常规攻击、受击、核心神格、反制、终结几个片段。
- 每个片段从生产时就尽量保持角色、特效、背景分离,而不是事后强拆。
-
再用 OmnimatteZero 做已有成片的拆层实验。
- 选一个明确样例,比如“孙悟空 vs 美杜莎”。
- 目标不是验证论文指标,而是看能否把孙悟空、金光、石化、擂台背景拆成可重用素材。
-
用 Generative Omnimatte / VideoMaMa 作为质量补充。
- Generative Omnimatte 更适合尝试“对象及关联效果”分层。
- VideoMaMa 更适合做稳定 mask 和 alpha matte。
-
用 Over++ 关注“重组后的交互效果”。
- 当角色层、法宝层、背景层被重新组合后,最大问题是它们看起来互不影响。
- Over++ 的方向正好是生成 layer interaction effects,可以作为后续合成阶段的参考。
-
runtime 只做选择和编排,不做重型生成。
- 天道裁定输出结构化结果:神明、神格侧面、法宝、强度等级、代价、结算。
- 视频系统根据结果选择素材层和镜头段落。
- 离线工具负责生产和补救,runtime 负责播放、组合和解释。
风险
这个方向现在还不能被当作稳定生产管线。
主要风险有四个:
- 算力和延迟:很多工具仍然是离线研究管线,A6000 / A100 级别 GPU 才比较现实。
- 商业授权:OmnimatteZero license 限制非商业使用;VideoMaMa 相关 checkpoint 受 Stability AI Community License 约束;Generative Omnimatte 还依赖 CogVideoX / Wan2.1 等上游模型许可。
- 可控性:工具能拆出一层,不代表这层一定干净、稳定、可重复进入游戏。
- 风格一致性:大夏的问题不只是分层,还有中国神话角色、法宝、神格效果的统一美术风格,这不是 matting 工具能自动解决的。
因此,短期判断是:这些 repo 值得跟踪和小样验证,但不要把它们设为 Demo 成败前提。
我的结论
OmnimatteZero 这一类工具真正提示的是一种资产观:AI 视频不应该只被当作短片,而应该被组织成“可被系统调用的视觉层”。
如果大夏继续走 AI 视频资产驱动的 PVE 神明构筑 RPG,这条路线很值得保留。玩家的 build 不只改变数值,也改变画面层:神格层、法宝层、环境后果层和国运结算层都可以因为裁定结果而不同。
第一阶段要验证的不是“能不能自动拆干净所有视频”,而是一个更小的问题:
一段神战视频能不能被拆成若干可复用层,并在另一场裁定结果里重新组合出可信的战斗反馈?
如果这个问题成立,AI 视频资产就不再只是宣传材料,而会变成游戏系统的一部分。