论文
语义投票:LLM 代码生成的基于执行的共识
Semantic Voting: Execution-Grounded Consensus for LLM Code Generation
摘要
LLM 代码生成管道通常会对多个候选者进行采样并选择一个最终答案,而无需访问完整的预言机。现有的管道混合了文本投票、排名和基于执行的协议,但每个组件的相对贡献仍不清楚。我们研究了不同模型、思维水平和基准的 18 种配置,比较了输出模式多数投票、加权投票、MBR-Exec 和 SemanticVote(一种通过 LLM 生成的输入上的执行指纹对候选者进行聚类的方法)。出现了三个发现。 (1) 在每种配置上,基于最佳执行的选择器都超过输出模式多数投票 19-52 个百分点,每个基于执行的选择器都超过至少 18 个百分点。 (2) 一旦候选人在不同的输入上执行,聚合规则的效果就有限:SemanticVote、加权投票和 MBR-Exec 在所有 18 种配置中在统计上都无法区分。最大的因素是输入质量:基于草图的输入生成始终优于直接 LLM 生成 0.6-2.1 pp,随机模糊高达 11.3 pp。 (3) 思维水平与选择族的相互作用不同:更深层次的思维将多数投票提高 12 pp,但基于执行的方法保持不变或随着候选多样性下降而退化。这些结果将推理时间代码选择视为信号质量问题而不是聚合规则问题:当预言机不可用时,行为证据比聚合规则更重要。