论文
超越任务完成:测量终端用户界面中的交互成本
Beyond Task Completion: Measuring Interaction Cost in Terminal User Interfaces
摘要
大语言模型 (LLM) 越来越多地通过终端用户界面 (TUI) 使用,但仅完成任务并不能说明界面理解和操作的难度。现有的人工评估和LLM生成的评级或报告无法提供基于已验证任务执行的交互工作的可重复测量。我们提出了智能体-as-a-User,这是一种将LLM智能体置于用户角色中的评估范例。 智能体-KLM 将智能体端的解释和操作成本分开,并将它们在结构上与人类交互联系起来。 TUINaut 通过记录交互轨迹并使用独立于执行模型的预言机验证结果来操作范例。使用 TUINaut-Bench,我们研究了 15 个现实世界 TUI 中的 84 项任务,其中包括 6 名人类参与者和 5 种观察评估器配置,并评估了由三个领先堆栈生成的 45 个 TUI。相似的总成功率掩盖了人类和智能体完成任务的差异,而解释和操作成本遵循相关的任务排名,尤其是对于操作而言。这种模式在各种配置中都存在。生成的 TUI 可以实现正确的功能,同时仍需要改进可用性。这些结果将智能体-as-a-User 定位为可重复的、以执行为基础的范例,用于测量基于任务的可用性。
