Ego2World 是一个基准,将标注好的第一人称烹饪视频编译成可执行的规划环境,支持部分可观测。编译器把视频中的步骤和涉及的物体映射到符号化的动作规则、持久的世界状态以及显式的任务条件。研究者可以让智能体提交一系列动作,系统会执行并检查结果。
该框架将世界状态与智能体信念分离,便于在连续任务中控制信息的复用与规划策略的比较。我们在 105 个烹饪任务上评估了六种规划器,发现即使大多数操作被接受,仍有大量任务目标未达成。执行轨迹和条件检查能够区分被中断的运行、部分达成以及完整执行但未完成目标的情况。
在一次配对实验中,使用 Qwen‑Plus 作为语言模型,加入持久信念后,动作有效性提升了 4.15 个百分点,视觉查询次数下降了 90.27%,但使用的 token 增多且未观察到完成率提升。
Ego2World 为追踪规划与记忆选择如何影响执行、观测需求和任务达成提供了可复用的测试平台,搭建了从人类记录活动到交互式智能体评估的桥梁。
点评