论文
ReFract视角感知基准
ReFract: Benchmarking Perspective Awareness in Language Model Agents with Text World Models
摘要
LLM智能体日益部署于工业维护与设备故障排查等高风险场景,其中使用者承担多种角色。有能力的智能体必须以校准于用户角色的方式行动:采取行动、提供信息时尊重该角色的知识与能力边界。与编码不同——那里错误通常可恢复——这些场景中的智能体响应会作用于物理设备,可能造成不可逆的设备损坏、生产损失或人身伤害。现有基准大多忽视智能体需要推断角色意图、且只通过该角色合法可用的工具行动的需求;我们把这种能力称为视角感知。为此我们提出ReFract:150条专家验证条目,智能体必须依据用户角色对同一查询差异化行动。条目基于去标识化的领域支持对话查询构建,我们为其构建Text World Model模拟智能体运行环境,并装配视角感知的动作轨迹。SOTA LLM至多解决69%的任务,超过50%的轨迹包含尝试视角违规动作。ReFract把视角感知确立为智能体评测中一个独特的、基本未解决的轴。