Taxonomy 总结里收录的 17 个基准,从两个角度归类:考什么能力(图一)和怎么评(图二)。叶子节点是基准名,括号里是对应的子任务或说明。
按"模型输出什么 → 谁来判 → 判什么 → 用什么指标"展开。①→④ 是离真实物理执行越来越近的梯度;⑤ 是附加的过程指标,没有基准拿它排名。
实心点 = 该维度是主要评测对象;淡点 = 部分子任务涉及。
空白最多的格子——物理理解 × 规划决策——正是"直觉物理 + 闭环"目前几乎没有基准覆盖的区域;ESI-Bench 是唯一同时落在物理与主动交互两列的。