论文

缺少知识还是能力不足?为大语言模型智能体构建知识门控的可验证任务

Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents

智能体系统Agent任务评测

摘要

专业代理任务通常取决于公共语料库中缺少的约定,但基准很少控制代理是否有权访问这些约定。我们引入了一种知识门控任务构建协议,它将任务指令与包含私有约定、参考表和实用运算符的紧凑工件分开。构建时来源、跨提供和保留工件条件的字节相同的任务指令、泄漏审计和可执行见证使得对工件的依赖变得明确且可测试。在 15 项校准任务中,一种前沿代理配置在使用人工制品的情况下实现了 68.0% 的通过率,在没有人工制品的情况下达到 0%;在一项任务中,一个看似合理但不正确的人工制品在五次试验中的收益率也为 0%。确定性求解器和规则语料库为结构化任务提供了准确的基本事实,而命名的标准级规则则支持无法由单个可执行预言机检查的输出。与配置相关的校准屏幕保留了满足我们的五次试验经验知识门控屏幕的七个任务。这些实验验证了构建协议的行为;他们并没有证明保留的任务可以改善训练后的情况。我们在 https://github.com/DatagridsAI/Knowledge-Gated-Task-Construction 公开发布了部分任务套件和支持工具。

缺少知识还是能力不足?为大语言模型智能体构建知识门控的可验证任务:论文配图
图1 知识整理程序概览。一名人类馆长将大面积的地体压缩成千字节大小的人工制品,但不包括端到端的解决办法。经过一次泄漏审计,同一指示在三个智能体结构下进行评估:知识配置。 示意图中的“Pass”、“Fail”和“Low pass”表示对重复试验而非单程结果的经验性过速率带。结构化任务使用确定性的解决方案和规则公司来精确的参考真相;自由形式交付品使用标准层次的评分。知识淡化和校准诊断了所构建的任务;在这项工作中不进行模型培训。