AI 生成的视频为什么总违反物理?这篇 2026 年新论文把「牛顿」塞进了 Agent 工具箱

AI 生成的视频为什么总违反物理?这篇 2026 年新论文把「牛顿」塞进了 Agent 工具箱

过去两年,文生视频赛道把「像不像」卷到了近乎恐怖的水平——Sora、Veo、Kling、Wan2.2、HunyuanVideo,单帧截图发到朋友圈,没人看得出是 AI 生成的。

但只要你把问题从「像不像」换成「对不对」,裂缝就冒出来了:一个球没有接触任何物体,却突然加速;啤酒往杯子里倒,液面纹丝不动,泡沫却在凭空生长;刀「划过」木头,切口没有凹槽、木屑从不出现;自由落体可以无视重力加速度。

你以为这是生成器的「渲染能力不行」,等下一代模型更大一点就好了。但 2026 年 5 月挂在 arXiv 上的一篇论文给出了一个完全不同的判断:问题不在生成器,而在输入端——你给它的那句话,从来就不足以描述一个物理世界。

这篇论文叫 NEWTON: Agentic Planning for Physically Grounded Video Generation,作者来自浙江大学、香港理工大学、树根科技和三一集团。它没有继续在「把模型做得更大」上堆赌注,而是停下来问了一句:文本 Prompt 到底漏掉了什么,以至于再大的生成器也补不回来?

一、先看数据:最强的模型,物理常识也只有三分之一

论文引用了一个非常扎心的基准:VideoPhy-2,目前最严格的物理常识评测基准。在上面,即便最强的视频生成模型,Joint 准确率也只有 32.6%——意思是:同时做到语义贴合(SA≥4,做对 prompt 要求的事)且物理合理(PC≥4,遵守物理规律)的视频,占比不到三分之一。

这不是 bug,这是架构层面的必然。

二、核心诊断:规格瓶颈(Specification Bottleneck)

NEWTON 的核心论点是:文本是对物理世界的有损压缩。

考虑这句看似无懈可击的 prompt:”A ball rolls off the edge of a table.”(一个球从桌沿滚落)。这句话省略了什么?

  • 球的质量、半径、转动惯量
  • 桌面摩擦系数
  • 桌面高度
  • 球的初始水平速度
  • 地面材质(弹性恢复系数)
  • 空气阻力近似
  • 以及所有这些量之间的耦合关系

这些参数联立起来才能唯一确定一条轨迹。生成器拿到的却只有一句自然语言,然后被要求「交出一段物理自洽的连续视频」。

于是它只能做一件事:在信息严重欠定的条件下,用统计先验做幻觉式补全。单帧好看,时间维度上一塌糊涂——因为这个问题本身就是 ill-posed 的。

论文里有一句值得刻在墙上的话:

“No amount of model scaling can recover what was never specified.”
——缩放永远补不回输入端从未给过的信息。

把物理硬塞进生成器权重(端到端训练)、加更多 ControlNet 条件、做 test-time search——方向都对,但层级都错了。它们治的是症状,不是病因。病因在规格层:你没有告诉它这个世界是什么,就指望它渲染出这个世界

三、解法:视频生成不是输出,而是 Agent 的一个工具

NEWTON 的架构思路极其干脆:把视频生成器「降级」为 Agent 可调用的一个 Action。整个系统由三个角色加一个循环组成:

Planner(规划器)——整个系统唯一可学习的部分,用一个 9B 的 VLM(Qwen3.5-9B)做策略网络。每一轮它读入「原始 prompt + 历史工具调用 + 验证器反馈 + 前序推理轨迹」,然后输出一个结构化动作:生成关键帧、跑 Python 物理计算、改写 prompt、触发视频生成,或者跳过。

Executor(执行器)——三类物理感知工具,各攻一个维度的规格缺口:

  • Keyframe Generation:用 T2I 模型生成锚定帧(首/中/尾),比如「球在抛物线顶点」的中间帧,强制生成器插值经过合法状态;
  • Python Computation:在沙盒里算抛体运动、弹性碰撞、旋转动力学,把数值结果写回记忆;
  • Prompt Refiner:显式补写 “rubber ball, coefficient of restitution=0.7” 这类材料属性和因果链。

Verifier(验证器)——给每段生成视频打两个标量:SA(语义贴合 1-5)和 PC(物理常识 1-5),得分追加回记忆,下一轮 Planner 据此重新规划。系统最多跑 5 轮,最终返回验证分数最高的视频。

关键点:生成器全程冻结,不碰权重,不插 adapter。 物理能力从生成器内部被抽出来,变成了可组合的 Agent 行为。

四、训练:为什么要让 Planner「在活流里吃自己的后果」

第二个极具方法论味的地方是训练方式。

为什么不直接用专家轨迹做 SFT?论文引用 AgentFlow 的发现:在 agentic 设定下,用专家轨迹做 SFT 甚至可能比冻结基线还差 19%——因为 Planner 学到的是模仿静态演示,从没体验到「调错工具 → 视频炸了 → 该怎么改」这种活的系统动力学。

NEWTON 用的是 Flow-GRPO:对每个 prompt 采样 8 条并行 rollout,每条完整跑完最多 5 轮,拿到一个轨迹级奖励(不是逐帧奖励,而是稀疏的终态质量信号),再做 group normalization 和 clipped surrogate + KL penalty 更新。Planner 学到的不是「哪个 token 更像专家」,而是「在什么状态下该算、该画、该改 prompt、该生成——以及看到坏分之后怎么翻盘」

五、结果:不改生成器,物理一致性照样推上去

  • VideoPhy-2 主表:LTX 从 21.4% 提到 29.7%;最难的 HARD 子集(守恒律、多体碰撞、铰接动力)从 4.44% 提到 12.22%,翻了 2.75 倍——恰恰是 Agent 工具调用最能发挥的场景。
  • 换更强的底座也能叠加:Veo-3.1 本身远比 LTX 强,但 NEWTON 的增益仍然叠加而非被挤压:30.7% → 37.4%。这说明它修复的不是「渲染能力不足」,而是「conditioning 规格不足」——这个瓶颈在不同强度的底座上都存在。
  • 跨基准泛化:同一个 Planner(只在 VideoPhy-2 train split 上训过),零重新训练迁到 PhyGenBench,增益集中在 Optics(+0.067)和 Material(+0.092)——恰好是「需要写清楚折射/透明属性」和「描述颗粒堆积/形变」的维度。

视觉对比更直观:倒盐,NEWTON 显示盐堆在盘子上逐渐隆起,基线要么产不出可见堆积、要么撒盐但不累积;削葡萄柚,NEWTON 渲染果皮逐段剥离露出果肉,基线要么起始就切好了、要么只做一个微小切片就停。

六、这篇论文真正的启发在哪

第一,「规格瓶颈」是通用框架,不限于视频。 分子动力学模拟(SMILES/文本 ≠ 完整构象+溶剂+温度场)、城市交通流预测(路网拓扑文本 ≠ 完整边界流量+信号时序)、机器人操作规划(”pick up the cup” ≠ 摩擦/质心/抓取刚度)——凡是 AI→真实世界的生成/预测/决策任务,都该问一句:我的输入信号,是否信息等价于这个问题的完整初值条件?

第二,Agent 的下一个前沿不是「更聪明的 LLM」,而是「可验证的工具编排」。 最近半年 Agent 文献里充斥着「LLM + 工具调用 = Agent」的叙事。NEWTON 用一个干净的实验事实提醒我们:一个 frozen 的 prompted LLM 调工具 ≠ 一个 trained Planner 在闭环里学调工具。差距不在「能不能调」,而在「知不知道调了之后怎么根据结果改下一次的调法」

第三,「冻结 backbone + 外挂 Agent」可能是性价比最高的扩展路线。 你不需要重训一个 14B/30B 的视频扩散模型让它「懂物理」,你需要的是一个 9B Planner + 3 个轻量工具 + 一个打分器,围着一个冻结的生成器转。训练成本、数据依赖、灾难性遗忘,这些痛点全绕开了。

局限

工具库目前只有 3 类(keyframe / python / prompt),扩展到流体求解器、物理引擎(MuJoCo/PhysX)是自然下一步;Verifier 目前只给标量分数,如果是语言形式的诊断(「违反了动量守恒在第 12 帧」),re-plan 可以更靶向;工具调用的正确性靠 Planner 训练隐含保证,没有形式化验证层——安全攸关场景(机器人/工业仿真)需要额外 guardrail。


一句话总结:与其赌下一代模型自发「涌现」出牛顿力学的理解,不如坦承——自然语言从来不是 ODE 的等价描述。把物理推理从生成器的权重里请出来,放进一个能看到自己错误、会调计算器、会重画关键帧的 Agent 手里,这才是让生成模型走向可信世界模拟器的务实路径。


数据说明:本文内容基于 arXiv 论文 NEWTON: Agentic Planning for Physically Grounded Video Generation(2026 年 5 月,浙大/香港理工/树根科技/三一集团)及智源社区论文解读(2026 年 6 月),文中 VideoPhy-2、PhyGenBench 等基准数据均来自论文原文,代码与项目页:newton026.github.io/newton。

文章摘自:https://www.cnblogs.com/badhope/p/23037437/ai-video-physics-newton-paper