论文
CordisBench:语言模型可以推理动态代理Harness中的组件生命周期吗?
CordisBench: Can Language Models Reason About Component Lifecycles in Dynamic Agent Harnesses?
摘要
动态代理工具使语言模型能够改变塑造其自身执行的软件。这种灵活性带来了新的推理负担:本地插件更改可以通过依赖项和清理来传播。我们推出 CordisBench,这是一个包含 1,200 个问题的生命周期推理基准。它将受控的形式设置与针对 Cordis 执行的程序相结合,Cordis 是一个管理组件依赖关系和清理的运行时,并要求模型识别受影响的组件,预测指定拆卸顺序后的状态,确定所有或部分顺序下的条件,并选择执行时成功的重新配置。在这些任务中,我们使用确定性的任务特定评分,以低推理量评估了三种以效率为导向的模型,具有 2、4、8、16、24 或 32 个相关交互。模型通常可以很好地处理小型系统,但随着更多交互变得相关,其可靠性会降低,特别是在预测最终状态和跨拆卸订单进行推理时。额外的推理工作可以为某些模型带来显着的收益。成本是不小的:在我们的 16 个交互子集中,GPT-5.6 Luna 在中等努力下每个问题使用近 3,000 个推理标记。对于这些受控实例,这种成本是可以避免的:独立的有限参考语义与 Cordis 对用于对所有 528 个可执行问题进行评分的每个观察和行动结果的执行一致。