这次我们来看一个近期在AI视频生成领域引发讨论的话题:Fable的AI幻觉与物理错误问题。这不是一个具体的开源项目,而是一个现象级的行业观察点,它直指当前AI视频生成模型在追求高保真度、长序列生成时面临的核心挑战——如何保持物理世界的合理性与逻辑一致性。对于开发者、研究者和内容创作者而言,理解这些“幻觉”和“错误”的成因、表现及潜在解决方案,远比单纯追求“一键生成”更有价值。
简单来说,“AI幻觉”在图像和视频生成中,指的是模型生成了不符合物理规律、逻辑或常识的内容。例如,物体违反重力悬浮、人物肢体扭曲、光影方向矛盾、物体凭空出现或消失等。Fable作为一家专注于AI叙事和视频生成的公司,其展示的技术成果在令人惊叹的同时,也难免暴露出这类问题,从而引发了业界对AI生成内容可靠性的新一轮审视。
本文将深入探讨AI视频生成中的“幻觉”与物理错误现象。我们会拆解其背后的技术原理,分析常见的错误类型,并基于当前的开源生态和工具链,提供一套用于检测、评估乃至尝试缓解这些问题的本地化测试方案。虽然无法提供Fable的专有模型,但我们可以利用Stable Video Diffusion、AnimateDiff等开源框架,在本地环境中复现类似问题,并探讨可能的优化方向。
如果你关心AI生成内容的真实性、逻辑一致性,或者正在开发或使用相关应用,需要评估其输出的可靠性,那么本文提供的分析框架和测试方法将对你有所帮助。
1. 核心能力速览:AI视频生成与“幻觉”检测
首先需要明确,本文讨论的“核心能力”并非某个单一工具,而是围绕“AI视频生成质量评估与错误分析”这一主题构建的认知与测试体系。下表概括了我们将要涉及的关键方面:
| 能力项 | 说明与定位 |
|---|---|
| 分析对象 | AI生成视频(特别是长序列、复杂场景)中的物理错误与逻辑“幻觉” |
| 技术焦点 | 生成模型的时空一致性、物理规则建模、常识推理能力 |
| 常用工具 | Stable Video Diffusion (SVD), AnimateDiff, ComfyUI 工作流,自定义评估脚本 |
| 硬件门槛 | 依赖具体模型。SVD-XT 可能需要 12GB+ 显存进行推理;测试小分辨率或使用 CPU 模式可降低要求。 |
| 启动方式 | 通过 ComfyUI 或 Diffusers 库加载模型,使用 Python 脚本进行批量生成与抽帧分析。 |
| 核心功能 | 1. 复现典型物理错误场景 2. 对生成视频进行逐帧或关键帧分析 3. 量化评估指标(如抖动程度、物体轨迹连续性) 4. 尝试通过提示词工程、ControlNet、模型融合等方法缓解问题 |
| 输出成果 | 错误案例集、分析报告、优化前后的对比视频、可复现的测试工作流 |
| 适合场景 | AI视频模型的研究评测、内容审核前的质量预检、应用开发中的可靠性测试、技术选型时的对比分析 |
2. 适用场景与使用边界
理解AI视频的“幻觉”问题,首要任务是明确我们在什么场景下需要关注它,以及当前技术的边界在哪里。
适用场景:
- 研究与开发评测:对于从事AI视频生成算法研究的团队或个人,系统性地检测和分类模型输出的物理错误,是衡量模型性能、指导模型改进的关键环节。例如,比较不同版本的SVD模型在“物体坠落”或“流体模拟”场景下的表现。
- 内容创作与审核:对于使用AI生成视频进行创意工作的团队,需要在成品发布前进行质量检查。自动化或半自动化的“幻觉”检测可以帮助快速定位视频中不合逻辑的片段,避免发布含有明显错误的内容。
- 产品化与合规:在将AI视频生成能力集成到产品中时(如营销视频生成、教育内容制作),必须评估其输出的稳定性和合理性。严重的物理错误可能导致用户困惑、产品可信度下降,甚至引发误导。
- 技术选型参考:当需要在多个开源或商业AI视频方案中做选择时,针对性地测试它们在特定类型场景(如多人交互、复杂光影变化)下的“幻觉”率,可以作为重要的决策依据。
使用边界与注意事项:
- 非通用解决方案:本文提供的测试方法和思路主要用于发现问题、分析问题,而非提供一个能彻底消除所有“幻觉”的万能工具。AI视频生成的可靠性提升是一个持续的研究课题。
- 依赖具体模型:测试结果严重依赖于所使用的基模型(如 SVD、AnimateDiff)、微调版本以及推理参数。不同模型在不同类型的错误上表现差异巨大。
- 主观与客观结合:目前对“物理错误”的判定,一部分可以通过算法量化(如光流不一致性),另一部分仍需依赖人工判断(如动作合理性、常识违背)。完全自动化的评估体系尚未成熟。
- 计算资源消耗:生成高质量、长序列的视频并进行多轮测试,需要可观的GPU算力和时间成本。
- 版权与合规:使用任何模型生成内容,尤其是涉及人脸、商标或特定风格时,必须确保你有权使用相关模型和数据,并遵守其许可协议。生成的内容也需符合法律法规和公序良俗。
3. 环境准备与前置条件
要搭建一个用于分析AI视频“幻觉”的本地测试环境,你需要准备以下基础条件。以下配置是一个通用性较强的起点,具体版本可根据你选择的模型进行调整。
操作系统:
- 推荐:Linux (Ubuntu 20.04/22.04 LTS) 或 Windows 10/11。Linux通常在深度学习环境配置上更顺畅。
- 备选:macOS (Apple Silicon 芯片性能更佳),但部分工具链的兼容性可能需要额外处理。
Python 环境:
- 版本:Python 3.8 - 3.10。这是主流深度学习框架支持较好的版本范围。
- 管理工具:强烈建议使用
conda或venv创建独立的虚拟环境,避免包冲突。
深度学习框架与CUDA:
- PyTorch:根据你的CUDA版本安装对应的PyTorch。例如,对于CUDA 11.8:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118 - CUDA Toolkit:版本需与PyTorch匹配,且显卡驱动支持。NVIDIA显卡用户需确保已安装正确版本的驱动和CUDA。可通过
nvidia-smi命令查看驱动支持的CUDA最高版本。 - 替代方案:如果你的显卡显存不足(如小于8GB),或者使用AMD/Intel显卡,可以优先考虑支持CPU推理或通过
--cpu-offload等方式运行的方案,但速度会显著下降。
核心Python库:
diffusers:Hugging Face的扩散模型库,是运行Stable Diffusion系列模型的核心。transformers:自然语言处理模型库,用于文本编码器。accelerate:简化分布式训练和混合精度推理。opencv-python/pillow:用于视频处理和图像操作。imageio或ffmpeg-python:用于视频文件的读写与编码。
可视化与管理工具(可选但推荐):
- ComfyUI:一个基于节点工作流的图形化界面,非常适合快速搭建、测试和可视化复杂的AI视频生成流程,也便于分享和复现测试案例。
- Jupyter Notebook:用于交互式地运行代码、实时查看生成结果和分析数据。
硬件资源:
- GPU:拥有至少8GB显存的NVIDIA GPU是获得可接受速度的起点。测试SVD等模型,12GB或以上显存更为稳妥。
- 内存:建议16GB系统内存以上。
- 存储:预留至少20GB的可用磁盘空间用于存放模型文件(单个模型可能达数GB)和生成的视频素材。
4. 安装部署与启动方式
我们将以Stable Video Diffusion (SVD)为例,结合diffusers库和ComfyUI,展示两种典型的本地启动与测试方式。SVD是当前开源生态中具有代表性的图像到视频生成模型,常被用来研究时序一致性问题。
方式一:使用 Diffusers 库进行脚本化测试
这种方式灵活性高,适合集成到自动化测试管道中。
创建环境并安装依赖:
# 创建并激活conda环境(示例) conda create -n svd_test python=3.10 conda activate svd_test # 安装PyTorch(请根据你的CUDA版本调整) pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118 # 安装diffusers及相关库 pip install diffusers transformers accelerate opencv-python imageio编写测试脚本: 创建一个Python脚本,例如
test_svd_hallucination.py。以下是一个基础示例,用于生成视频并保存,后续可人工或通过脚本分析其连贯性。import torch from diffusers import StableVideoDiffusionPipeline from diffusers.utils import export_to_video import PIL.Image # 1. 加载模型和Pipeline # 首次运行会自动从Hugging Face下载模型,请确保网络通畅 pipe = StableVideoDiffusionPipeline.from_pretrained( "stabilityai/stable-video-diffusion-img2vid-xt", torch_dtype=torch.float16, variant="fp16", ) # 将模型移至GPU pipe.to("cuda") # 启用内存高效注意力等优化(如果支持) pipe.enable_model_cpu_offload() # 2. 加载输入图像 input_image = PIL.Image.open("./test_input.jpg") # 调整图像尺寸以适应模型要求(通常为1024x576等) input_image = input_image.resize((1024, 576)) # 3. 生成视频 # 设置生成参数,这些参数会显著影响结果和“幻觉”程度 generator = torch.manual_seed(42) # 固定随机种子以便复现 frames = pipe( input_image, decode_chunk_size=8, # 解码块大小,影响内存使用 generator=generator, num_frames=25, # 生成帧数 num_inference_steps=25 # 推理步数,影响质量与速度 ).frames[0] # 4. 导出视频 export_to_video(frames, "./generated_video.mp4", fps=7) print("视频已生成: generated_video.mp4")运行脚本:
python test_svd_hallucination.py首次运行会下载模型(约数GB),请耐心等待。生成完成后,在
./generated_video.mp4查看结果。
方式二:使用 ComfyUI 进行可视化工作流测试
ComfyUI 通过节点图的方式组织流程,非常适合快速实验不同的参数组合和预处理/后处理步骤,直观地观察中间结果。
安装 ComfyUI:
git clone https://github.com/comfyanonymous/ComfyUI cd ComfyUI pip install -r requirements.txt下载并放置 SVD 模型:
- 从 Hugging Face 下载
stable-video-diffusion-img2vid-xt模型文件。 - 在 ComfyUI 目录下创建
models/checkpoints文件夹(如果不存在),将下载的模型文件(如svd_xt.safetensors)放入其中。 - 同样,可能需要下载相关的VAE和CLIP模型,ComfyUI通常会自动处理或给出提示。
- 从 Hugging Face 下载
启动 ComfyUI:
python main.py --listen 127.0.0.1 --port 8188在浏览器中访问
http://127.0.0.1:8188即可打开图形界面。加载 SVD 工作流: ComfyUI 社区有很多分享的工作流。你可以搜索 “ComfyUI SVD workflow” 找到
.json或.png工作流文件。在 ComfyUI 界面中,通常可以通过拖拽.json文件或加载.png文件(如果内嵌了工作流数据)来快速导入一个预设的SVD生成流程。 在导入的工作流中,你可以:- 替换输入图像节点。
- 调整采样器(Sampler)参数(步数、CFG强度等)。
- 修改视频帧数、尺寸。
- 添加ControlNet节点(如果工作流支持)以尝试约束生成内容,减少“幻觉”。
5. 功能测试与效果验证:构建“幻觉”测试集
现在,我们进入核心环节:如何系统性地测试和观察AI视频生成中的“幻觉”与物理错误。关键在于设计有针对性的测试案例。
5.1 测试案例设计原则
有效的测试案例应能暴露模型在时空推理和物理常识上的弱点:
- 简单物理运动:测试物体自由落体、抛物线运动、滚动、碰撞。例如,生成一个球从桌上掉落的视频,观察球是否匀速下落(不符合重力加速度)、是否穿透桌面、弹跳是否合理。
- 物体持久性与一致性:测试物体在帧间是否保持形状、颜色、纹理不变,是否会无故出现或消失。例如,生成一个包含特定图案杯子的视频,观察杯子上的图案是否闪烁或变形。
- 空间关系与遮挡:测试物体之间的前后遮挡关系是否一致。例如,一个人走过一棵树,被树干遮挡的部分在前后帧中应该连贯。
- 光影一致性:测试光源方向、阴影位置、高光反射在视频序列中是否稳定。例如,一个固定光源下的场景,阴影不应随意跳动。
- 复杂交互与因果关系:测试涉及多个物体交互或需要简单因果推理的场景。例如,“推倒一摞积木”,观察积木倒下的方向、顺序是否符合推力来源。
5.2 执行测试与观察记录
以下是一个结构化的测试流程,你可以为每个测试案例创建一个独立的脚本或ComfyUI工作流。
步骤一:准备输入为每个测试类别准备1-2张高质量的输入图片(test_input_gravity.jpg,test_input_persistence.jpg等)。图片内容应清晰,主体明确。
步骤二:批量生成修改之前的脚本,使其能遍历一个包含所有输入图片路径和对应参数配置的列表,进行批量生成。
test_cases = [ {"image_path": "./test_input_gravity.jpg", "prompt": "", "num_frames": 30, "output_name": "gravity_test"}, {"image_path": "./test_input_occlusion.jpg", "prompt": "", "num_frames": 25, "output_name": "occlusion_test"}, # ... 更多测试案例 ] for case in test_cases: input_image = PIL.Image.open(case["image_path"]).resize((1024, 576)) frames = pipe(input_image, num_frames=case["num_frames"]).frames[0] export_to_video(frames, f"./outputs/{case['output_name']}.mp4", fps=7)步骤三:人工复审与关键帧抽取使用视频播放器或OpenCV脚本逐帧播放生成的视频,重点关注:
- 物体运动轨迹:是否平滑?是否符合物理规律?
- 物体形变:是否有不合理的拉伸、扭曲或抖动?
- 边缘闪烁:物体的边缘或纹理是否在帧间高频闪烁?
- 逻辑错误:是否有物体违反常识地出现、消失或改变属性?
同时,可以编写脚本自动抽取视频的关键帧(如每隔N帧,或基于帧间差异检测),便于快速浏览和对比。
import cv2 video_path = "./outputs/gravity_test.mp4" cap = cv2.VideoCapture(video_path) frame_id = 0 while True: ret, frame = cap.read() if not ret: break # 每隔5帧保存一张,或根据其他逻辑 if frame_id % 5 == 0: cv2.imwrite(f"./keyframes/frame_{frame_id:04d}.jpg", frame) frame_id += 1 cap.release()步骤四:记录与分类为每个测试视频创建一个简单的记录文件(如Markdown或JSON),记录观察到的错误类型、严重程度(轻微、中等、严重)、出现的帧号范围等。
{ "test_case": "gravity_ball_drop", "model": "svd-xt-1.1", "parameters": {"num_frames": 30, "steps": 25}, "observed_errors": [ { "type": "unrealistic_motion", "description": "球在下落过程中出现两次不自然的横向微小抖动", "frames": "10-12, 18-20", "severity": "minor" }, { "type": "inconsistent_shadow", "description": "球的阴影在最后几帧突然变淡并位移", "frames": "25-30", "severity": "moderate" } ] }6. 量化分析与自动化检测探索
除了人工观察,我们可以尝试引入一些简单的量化指标来辅助评估,尽管它们不能完全替代人对“合理性”的判断。
6.1 基于光流的一致性检查
光流(Optical Flow)估计了相邻帧之间像素的运动矢量。在物理合理的视频中,光流场通常是平滑且连续的。剧烈的、不连贯的光流变化可能预示着“幻觉”区域。
import cv2 import numpy as np def calculate_frame_difference(video_path): """计算视频连续帧之间的平均绝对差异,作为抖动程度的粗略指标""" cap = cv2.VideoCapture(video_path) prev_frame = None diffs = [] while True: ret, frame = cap.read() if not ret: break gray = cv2.cvtColor(frame, cv2.COLOR_BGR2GRAY) if prev_frame is not None: diff = cv2.absdiff(prev_frame, gray) mean_diff = np.mean(diff) diffs.append(mean_diff) prev_frame = gray cap.release() return diffs # 使用示例 diffs = calculate_frame_difference("./outputs/gravity_test.mp4") print(f"平均帧间差异: {np.mean(diffs):.2f}") print(f"最大帧间差异: {np.max(diffs):.2f} (可能对应‘跳跃’或‘闪烁’的帧)")异常高的mean_diff或突变的max_diff可能指示视频中存在严重的不连贯性。
6.2 使用预训练模型进行异常检测
可以尝试利用在真实视频上训练的模型(如视频分类、动作识别模型)来检测生成视频中的“异常”。例如,将生成视频输入一个动作识别模型,如果模型对视频内容的分类置信度极低或产生荒谬的分类结果,这可能暗示视频内容不符合常规的物理规律。
# 伪代码示例,需安装 torchvision 并下载预训练模型 import torch import torchvision.models as models import torchvision.transforms as transforms from torchvision.io import read_video # 加载预训练的视频分类模型(如I3D, R3D) model = models.video.r3d_18(pretrained=True) model.eval() # 预处理视频帧 def preprocess_video_frames(frames): # 调整尺寸、归一化等 transform = transforms.Compose([...]) return transform(frames) # 读取并预处理生成的视频 frames, _, _ = read_video("./outputs/gravity_test.mp4", output_format="TCHW") processed_frames = preprocess_video_frames(frames) # 推理 with torch.no_grad(): output = model(processed_frames.unsqueeze(0)) # 增加batch维度 probabilities = torch.nn.functional.softmax(output[0], dim=0) top5_prob, top5_catid = torch.topk(probabilities, 5) print("模型认为视频最可能属于的类别:") for i in range(5): print(f" {top5_catid[i].item()}: {top5_prob[i].item():.4f}")如果模型对“打篮球”、“刷牙”等常见动作的置信度远高于对“物体下落”的置信度,或者 top5 类别都非常不合理,则生成视频可能包含令模型困惑的异常模式。
7. 资源占用与性能观察
在本地进行大量视频生成测试时,资源管理至关重要。
显存占用观察: 运行生成脚本时,在另一个终端使用nvidia-smi命令可以实时监控显存使用情况。
# Linux/Windows WSL watch -n 1 nvidia-smi对于SVD-XT模型,在1024x576分辨率下生成25帧视频,显存占用峰值可能在12GB到16GB之间,具体取决于decode_chunk_size等参数。如果显存不足,可以尝试:
- 降低生成分辨率(如768x432)。
- 减少
num_frames(生成更短的视频)。 - 启用
pipe.enable_model_cpu_offload()或pipe.enable_sequential_cpu_offload()(Diffusers库功能),将暂时不用的模型部分卸载到CPU。 - 使用
torch.float16或bfloat16精度代替float32。
生成速度: 生成速度受GPU型号、显存、图像分辨率、帧数和推理步数影响。记录每个测试案例的生成时间,有助于评估不同参数配置下的效率,为后续的批量测试规划时间。
磁盘与内存:
- 模型文件:单个SVD模型约5-10GB。
- 生成的视频:一个25帧的MP4视频约几MB到几十MB。进行上百次测试后,需要预留足够的磁盘空间。
- 系统内存:在加载模型和处理视频数据时,Python进程会占用一定系统内存。如果同时进行多个任务或处理高分辨率视频,可能需关注内存使用。
8. 常见问题与排查方法
在搭建测试环境和运行模型时,你可能会遇到以下问题:
| 问题现象 | 可能原因 | 排查方式 | 解决方案 |
|---|---|---|---|
| 模型下载失败或缓慢 | 网络连接问题,或Hugging Face访问不稳定。 | 检查网络,尝试wget或浏览器直接下载模型文件。 | 1. 使用国内镜像源。 2. 手动下载 .safetensors或.bin文件,放到本地缓存目录(通常为~/.cache/huggingface/hub)。3. 对于ComfyUI,将模型文件放入其 models/checkpoints目录。 |
| 运行时显存不足 (OOM) | 模型太大、分辨率太高、帧数太多或decode_chunk_size设置过大。 | 观察nvidia-smi显示的显存占用峰值。 | 1. 降低视频分辨率或帧数。 2. 启用CPU Offload ( enable_model_cpu_offload)。3. 使用更小的模型变体(如果存在)。 4. 在ComfyUI中尝试使用“低显存模式”节点。 |
| 生成视频全黑或扭曲 | 输入图像尺寸不符合模型要求,或模型未正确加载。 | 检查输入图像尺寸是否为模型期望的尺寸(如SVD-XT常用1024x576)。检查模型文件是否完整。 | 1. 严格按照模型文档调整输入图像尺寸。 2. 重新下载或验证模型文件哈希值。 3. 尝试更简单的输入图像(纯色背景,简单物体)。 |
| 视频闪烁严重,物体抖动 | 这是典型的时序不一致性“幻觉”,模型在帧间未能保持一致性。 | 逐帧检查,确认是全局闪烁还是局部物体抖动。 | 1. 增加num_inference_steps(如从25增加到50),但会延长生成时间。2. 尝试使用不同的采样器(如 Euler a, DPM++ 2M Karras)。 3. 在ComfyUI中引入“一致性模型”或“帧插值”节点作为后处理。 4.根本性限制:当前模型架构的固有问题,需等待模型本身改进。 |
| 物理错误(如物体浮空、穿透) | 模型缺乏足够的物理世界先验知识,或训练数据中此类模式不足。 | 对照测试案例设计,确认错误类型。 | 1. 在提示词(Prompt)中更精确地描述物理状态(如“on the table”, “falling down”),但效果有限。 2. 使用ControlNet(如Depth, Canny)为生成过程提供更强的空间结构约束。 3. 考虑使用专门在物理模拟数据上微调过的模型(如果存在)。 |
| ComfyUI 节点报错或缺失 | 缺少自定义节点依赖,或工作流文件版本不兼容。 | 查看ComfyUI终端或WebUI的错误信息。 | 1. 根据错误信息安装缺失的节点包(通常通过git clone到ComfyUI/custom_nodes目录)。2. 在ComfyUI Manager中查找并安装对应节点。 3. 尝试寻找更新版本或更通用的等效工作流。 |
9. 最佳实践与使用建议
基于以上测试和分析,我们总结出一些在研究和应用AI视频生成技术时的最佳实践,旨在更有效地管理“幻觉”风险。
- 建立基准测试集:为你关心的领域(如产品展示、动画短片、科学演示)创建一套小而精的基准测试图像和评估标准。每次模型更新或参数调整后,都运行一遍这个测试集,量化比较结果。
- 提示词工程与约束引导:
- 具体化:使用更具体、包含空间关系和动作描述的提示词。例如,将“a ball”改为“a red rubber ball resting on a wooden table”。
- 负面提示:善用负面提示词来排除常见错误,如“floating, distorted, blurry, bad anatomy, discontinuous motion”。
- 多模态引导:积极尝试结合Depth Map、Canny Edge、OpenPose等ControlNet条件,为生成过程提供更强的空间和结构指导,这能有效减少几何和位置上的“幻觉”。
- 后处理与融合:
- 帧插值与稳定:对于生成视频的轻微抖动,可以使用传统的视频稳定算法或AI帧插值模型(如RIFE, DAIN)进行平滑处理。但这无法修正重大的逻辑错误。
- 混合编辑:对于重要的商业项目,不要完全依赖AI一次性生成。可以将AI生成的视频作为素材,在专业视频编辑软件中进行剪辑、合成和修正,人工修正明显的物理错误。
- 理解技术边界:认识到当前扩散模型在长程时序建模和复杂物理推理上的局限性。对于逻辑严苛、物理精确度要求高的场景(如工业仿真、科学可视化),目前的AI生成视频尚不能完全替代基于物理引擎的渲染或手工制作。
- 版本管理与实验记录:使用工具(如Weights & Biases, MLflow)或简单的文档记录每次实验的模型版本、参数配置、输入种子和输出结果。这对于追溯问题、复现成功案例至关重要。
- 合规与伦理考量:始终对生成内容负责。在发布前,务必进行人工审核,确保内容没有事实性错误、不涉及侵权、不包含有害或误导性信息。特别是在生成涉及真人相貌、特定品牌或敏感场景的内容时,需格外谨慎。
10. 总结与下一步
AI视频生成中的“幻觉”与物理错误,是技术迈向更高可靠性必经的挑战。通过对Fable等案例的讨论,我们不应止于质疑,而应将其转化为推动技术前进的测试标尺。
对于开发者和研究者,最直接的下一步是动手复现和测量。利用Stable Video Diffusion等开源模型,按照本文提供的测试方法,在你的本地环境中构建一个“幻觉”检测流程。从最简单的物体运动测试开始,记录下模型在哪些方面表现良好,在哪些方面频繁出错。这些一手的数据和观察,远比泛泛的讨论更有价值。
对于内容创作者和应用开发者,下一步是建立质量红线。明确你的项目可以容忍何种程度的“幻觉”,以及通过哪些技术或人工手段可以将其控制在红线之内。是将AI生成作为创意草稿,还是作为最终成品的一部分?这个决策需要基于实际的测试结果。
技术的迭代速度很快,新的模型、新的训练方法(如视频扩散模型与物理引擎的结合)正在不断涌现。保持对开源社区的关注,持续测试新的解决方案,是跟上这一领域发展的关键。也许不久后,我们就能看到在物理一致性上取得突破性进展的模型,而今天的测试方法论,将是评估其进步程度的有效工具。