论文

叙述式思维:大语言模型可废止伦理推理的推理时脚手架

Narration-of-Thought: Inference-Time Scaffolding for Defeasible Ethical Reasoning in Large Language Models

模型推理推理策略与问题分解

摘要

道德困境上的标准思维链展现两种失败模式:利益相关者坍缩(踪迹至多点名一个对结果有利害关系的一方)与不确定性压制(在承诺行动前没有显式未知或保留)。我们引入叙述式思维(NoT)——把思维链结构化为五段的系统提示:主角、利益相关者、两步后果、不确定性——然后承诺。NoT不加训练、参数或微调。在三厂商四生成器的100个DailyDilemmas场景上——NoT把利益相关者坍缩从最高31%压到1%以下——把不确定性压制在所有模型上从最高72%压到1-24%。等预算的冗长CoT对照排除token开销作为有效成分;NoT在四个生成器中的三个上保留利益相关者数+0.79到+0.90、不确定性分+0.65到+0.93的Cliff's delta优势——分段消融把每个变化归因到其具体子指令。以NoT初始化的文本梯度下降进一步改进脚手架;跨家族训练裁判(与生成器不同厂商)在每个测量轴上支配同家族裁判。扩展到五轮多利益相关者辩论协议——该脚手架在校准集上把6%僵局转为95%完全共识——在DailyDilemmas复刻上100%合并收敛。所得踪迹外化每个承诺背后的利益相关者、后果与不确定性根据——为可靠的智能体部署提供可审计基底。

叙述式思维:大语言模型可废止伦理推理的推理时脚手架:论文配图
图 4:claude-sonnet-4-6 上的子指令消融:每个下降一节条件的 Cliff δ\delta 与对利益相关者计数和不确定性得分的完全 NoT 控制。负 δ\delta 意味着子指令提高了编码度量,因此删除它会减少它。利益相关者子指令(NoT 提示的子指令 2)和不确定性子指令(子指令 4)显示其各自目标指标的最大负 δ\delta。