论文
Implicit Intelligence——评估智能体对用户未言明之处的处理
Implicit Intelligence -- Evaluating Agents on What Users Don't Say
摘要
现实世界中向 AI 智能体提出的请求在根本上是不完全指定的。自然的人类交流依赖共享上下文和说话者期待听者推断的未言明约束。当前的 Agentic 基准测试显式指令遵循,但无法评估智能体能否对跨越无障碍需求、隐私边界、灾难性风险与情境约束的隐含要求进行推理。我们提出 Implicit Intelligence,一个评估框架,测试 AI 智能体能否超越提示遵循而成为真正的目标达成者,并配有 Agent-as-a-World(AaW),一个以人类可读的 YAML 文件定义交互世界并由语言模型模拟的测试环境。我们的场景特点是:用户请求表面简单、正确解法内藏复杂性、约束可通过环境探索被发现。我们在 205 个场景上评估 16 个前沿与开源权重模型,发现表现最好的模型场景通过率仅为 48.3%,表明在弥合字面指令遵循与类人情境推理之间的差距上仍有很大改进空间。
