OmniTools 6月17日消息,艾伦人工智能研究所(AI2)正式开源MolmoMotion——一款语言引导的3D运动预测模型。该模型能够根据输入视频帧、物体表面指定的3D查询点及自然语言动作指令,精准预测未来数秒内物体在三维空间中的运动轨迹。
同期发布的还有MolmoMotion-1M数据集与PointMotionBench基准测试集。前者包含来自116万段视频的物体锚定3D点轨迹,覆盖736种运动类型与5600个独立物体;后者含2700段人工验证视频片段,用于定量评估模型预测精度。
实验表明,MolmoMotion在PointMotionBench上全面超越现有3D运动预测方法。在下游任务中表现尤为突出:在仿真机器人规划场景中,基于该模型的控制策略任务成功率达76.3%,显著优于基线模型的56.0%;在视频生成任务中,其预测轨迹可有效引导生成过程,在五项核心运动质量指标上均优于基线模型。