论文
缺少知识还是能力不足?为大语言模型智能体构建知识门控的可验证任务
Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents
摘要
专业代理任务通常取决于公共语料库中缺少的约定,但基准很少控制代理是否有权访问这些约定。我们引入了一种知识门控任务构建协议,它将任务指令与包含私有约定、参考表和实用运算符的紧凑工件分开。构建时来源、跨提供和保留工件条件的字节相同的任务指令、泄漏审计和可执行见证使得对工件的依赖变得明确且可测试。在 15 项校准任务中,一种前沿代理配置在使用人工制品的情况下实现了 68.0% 的通过率,在没有人工制品的情况下达到 0%;在一项任务中,一个看似合理但不正确的人工制品在五次试验中的收益率也为 0%。确定性求解器和规则语料库为结构化任务提供了准确的基本事实,而命名的标准级规则则支持无法由单个可执行预言机检查的输出。与配置相关的校准屏幕保留了满足我们的五次试验经验知识门控屏幕的七个任务。这些实验验证了构建协议的行为;他们并没有证明保留的任务可以改善训练后的情况。我们在 https://github.com/DatagridsAI/Knowledge-Gated-Task-Construction 公开发布了部分任务套件和支持工具。
