原始录像不能直接训练出岗位能力。数据引擎把一次工作拆成观察、环境、任务、动作、结果与成本。
智能体看到了什么。
当时的空间与设备状态。
必须完成什么。
采取了什么动作。
完成质量如何。
时间与经济代价。