论文

IDEA:通过语言到数值校准实现可解释、可编辑的LLM决策框架

IDEA: An Interpretable and Editable Decision-Making Framework for LLMs via Verbal-to-Numeric Calibration

模型推理推理验证与自校正

摘要

大型语言模型(LLM)越来越多地被部署用于决策,但其在高风险领域的应用仍受限于概率校准不准、解释不可信以及无法精确融入专家知识。我们提出IDEA,一个将LLM决策知识提取为基于语义有意义因子的可解释参数化模型的框架。通过EM联合学习语言到数值的映射与决策参数、保留因子依赖关系的相关采样,以及具有数学保证的直接参数编辑,IDEA能够产生校准的概率,同时支持定量的人机协作。在五个数据集上的实验表明,基于Qwen-3-32B的IDEA(78.6%)优于DeepSeek R1(68.1%)和GPT-5.2(77.9%),并实现了完美的因子排除与精确校准——这是仅靠提示无法达到的精度。实现已公开于 https://github.com/leonbig/IDEA。

IDEA:通过语言到数值校准实现可解释、可编辑的LLM决策框架:论文配图
图 1:基于LLM的决策中信任赤字的三种表现形式,其根源在于一个共同的根源:内部与外部的不一致。 (a) 未校准的概率:对于相同选项,排名和评分会产生不一致的排序。 (b) 不忠实的解释:生成的基本原理与实际决定输出的潜在推理背道而驰。 (c) 不可控的干预:自然语言指令无法保证行为合规性——尽管有明确的排除指令,因素 X 仍继续影响预测。