论文
HAS-Bench:在可配置人类参与下评估基于LLM的人机系统
HAS-Bench: Evaluating LLM-Based Human-Agent Systems under Configurable Human Participation
摘要
大语言模型日益在人类是主动协作者而非被动任务提供者的设定中运作。我们引入HAS-Framework——基于图的框架——将人类与LLM驱动的智能体表示为具有显式角色、权限、通信路径与动作权限的一等参与者。基于该框架——HAS-Bench在可配置人类参与(跨代理级别、交互通道与角色策略)下评估人机系统。该基准同时测量任务结果与过程级协作行为——包括澄清质量、反馈利用、控制校准、安全、主动性与交互成本。跨六个领域的实验表明:人类参与可大幅改善任务完成与失败恢复——但增益取决于人类输入何时、如何以及由谁行使。
