论文

SeDT:句子-Transformer 决策-Transformer 多轮对话可靠性调节

SeDT: Sentence-Transformer Decision-Transformer Conditioning for Multi-Turn Conversation Reliability

上下文与知识上下文工程

摘要

当一个任务在一个回合中完全指定时,大语言模型 (LLM) 会获得令人印象深刻的性能,但当相同的任务在多个回合中逐步揭示时,相同的模型会损失高达 39% 的性能,这种现象被大规模记录为“在对话中迷失”。至关重要的是,这次崩溃几乎完全是可靠性故障;在最好的情况下,能力仅下降 16%,而不可靠性则增加一倍以上(+112%)。我们认为根本原因是结构性的,平坦的对话历史为之前的每个回合分配了相同的隐式权重,从而使模型没有信号来区分关键约束和偶然对话。我们提出了 SeDT Sentence-Transformer Decision-Transformer,这是一种 无需训练 推理时间方法,通过从离线强化学习中导入 return-to-go 条件来解决这个问题。 SeDT 使用从三个互补的语义、词汇和位置信号派生的累积相关性分数来注释每个对话分片,并在最后一轮向模型提供完整的注释历史记录,无需更改权重,无需训练数据,也不会丢弃上下文。在三个 LLM 和三个生成任务中的 Lost-in-Conversation 基准上进行评估,SeDT 在所有九个模型任务组合中都优于分片基线,平均性能 P 提高高达 +37.7%,并且在九个组合中的七个组合中同时降低了不可靠性。简而言之,告诉模型过去的哪些回合很重要,足以大幅恢复对话中损失的性能。