论文

LLM代表团签约:技术与努力选择中的道德风险

Contracting for LLM Delegation: Moral Hazard in Technology and Effort Choice

模型推理测试时计算扩展

摘要

我们将标准委托人-代理框架扩展到代理从一套技术中进行选择的场景,每种技术都有不同的成本能力概况。该框架在 大语言模型 (LLM) 时代变得越来越重要,其中代理选择模型和相关的工作水平(例如 词元预算)。我们将输出质量和努力之间的关系建模为凹饱和函​​数,这取决于代理平衡技术选择和努力分配的隐藏二维动作选择。我们推导出委托人的最佳线性合约,证明代理的最佳响应以触发技术转换的阈值奖励份额为特征。最后,我们使用跨 MATH 和 MMLUPro 基准的开放权重 LLM 配对来校准我们的模型。我们表明,当使用强盗算法来驾驭这种环境时,委托人和代理都会收敛到与我们的理论平衡密切相关的策略。这些结果表明,简单的线性契约可以有效地激励代理工作流程中复杂的、具有技术意识的委派。