论文

超越任务完成:测量终端用户界面中的交互成本

Beyond Task Completion: Measuring Interaction Cost in Terminal User Interfaces

智能体系统Agent任务评测

摘要

大语言模型 (LLM) 越来越多地通过终端用户界面 (TUI) 使用,但仅完成任务并不能说明界面理解和操作的难度。现有的人工评估和LLM生成的评级或报告无法提供基于已验证任务执行的交互工作的可重复测量。我们提出了智能体-as-a-User,这是一种将LLM智能体置于用户角色中的评估范例。 智能体-KLM 将智能体端的解释和操作成本分开,并将它们在结构上与人类交互联系起来。 TUINaut 通过记录交互轨迹并使用独立于执行模型的预言机验证结果来操作范例。使用 TUINaut-Bench,我们研究了 15 个现实世界 TUI 中的 84 项任务,其中包括 6 名人类参与者和 5 种观察评估器配置,并评估了由三个领先堆栈生成的 45 个 TUI。相似的总成功率掩盖了人类和智能体完成任务的差异,而解释和操作成本遵循相关的任务排名,尤其是对于操作而言。这种模式在各种配置中都存在。生成的 TUI 可以实现正确的功能,同时仍需要改进可用性。这些结果将智能体-as-a-User 定位为可重复的、以执行为基础的范例,用于测量基于任务的可用性。

超越任务完成:测量终端用户界面中的交互成本的原论文方法或结果图
图 3.TUINaut 工作流程概述。人类和智能体用户以一致的角色执行 TUI 任务,而独立于执行模型的预言机验证结果任务状态。任务资产初始化沙盒 TUI。人类用户或键盘智能体观察其渲染状态,通过特定于角色的过程对其进行解释,并通过键盘事件发出操作。文件系统、shell 状态和屏幕预言机独立验证完成情况。