论文
使用小语言模型执行闭环图算法:步骤准确性和执行轨迹可靠性
Closed-Loop Graph Algorithm Execution with Small Language Models: Step Accuracy and Rollout Reliability
摘要
小语言模型为大规模系统提供了一种有效的替代方案,但它们在多个相关决策上执行结构化算法的能力仍然知之甚少。我们将图算法执行作为闭环预测问题来研究,其中模型从当前图和算法状态中重复选择下一个动作。我们的评估框架涵盖了几个经典的图程序、多个合成图族以及不相交的训练、验证和测试分区。它使用步骤准确性、精确的轨迹准确率、约束有效性、部分解决方案质量、前缀生存和基于干预的诊断来评估本地决策质量和全局执行行为。结果表明,自适应可以为遍历和着色等结构过程产生可靠的策略,而加权算法对错误累积仍然更加敏感。更广泛地说,研究结果表明,强大的下一步预测不一定会转化为可靠的自主执行,也不一定会激励通过完整的闭环部署而不是孤立的决策来评估算法语言模型。