论文

U-Define:为LLM规划中的硬约束与软约束设计用户工作流

U-Define: Designing User Workflows for Hard and Soft Constraints in LLM-Based Planning

模型推理推理验证与自校正

摘要

LLM日益用于终端用户任务规划,但其黑盒性质限制用户确保可靠性与控制的能力。虽然近期系统加入验证技术,用户如何有效施加此类刚性约束来表达意图、适应现实可变性仍不清楚。例如,既往工作发现纯硬约束过于僵硬,数值灵活性权重令用户困惑。我们研究交互工作流如何更好支持用户施加约束以引导LLM生成的规划,考察把严格性抽象为高层类型(硬与软)并配以不同验证机制,能否帮助用户更可靠地表达并对齐意图。我们提出U-Define:让用户以自然语言定义约束并将其归为「不得违反的硬规则」或「允许弹性的软偏好」。U-Define以互补方法验证两类约束:硬约束用形式化模型检查,软约束用LLM-as-judge评估。通过技术评估与普通及专家用户研究,我们发现用户自定义约束类型提升了感知有用性、性能与满意度,同时保持可用性。这些发现为设计灵活而可靠的基于约束的工作流提供了洞见。

U-Define:为LLM规划中的硬约束与软约束设计用户工作流:论文配图
图 1. 在传统的工作流程(上)中,用户收到 LLM 计划,但必须手动检测错误和缺失的偏好。相比之下,U-Define(底部)使用户能够用自然语言明确地陈述自己的约束,区分绝对不能违反的硬规则(例如“包括素食选项”)和反映灵活性的软偏好(例如“保持轻松的节奏”)。然后通过针对其类型量身定制的机制进行验证:硬约束的正式模型检查和软约束的LLM法官评估。系统会生成满足或违反约束的验证结果,允许用户迭代地细化、放宽或加强约束。 U-Define 使用户能够利用将可靠性与灵活性相结合的约束类型。