论文

STAR:通过转点对齐和段级 DPO 减轻空间推理中的级联错误

STAR: Mitigating Cascading Errors in Spatial Reasoning via Turn-point Alignment and Segment-level DPO

模型训练偏好优化

摘要

结构化空间导航是大语言模型(LLM)空间推理的核心基准。思想可视化 (VoT) 等现有范式很容易在复杂拓扑中出现级联错误。为了解决这个问题,我们提出了 STAR,一个基于拓扑锚的两阶段框架,并引入了具有人类启发的转点注释的 RedMaze-23K 数据集。第一阶段使用有监督的 微调 来帮助模型内化空间语义并修剪冗余路径。第二个采用空间感知分段级直接偏好优化(SDPO)来完善长视距导航中的自我校正。实验表明,STAR 在开源模型中实现了最先进的性能:其 32B 变体的性能优于 DeepSeek-V3(29.27% vs. 25.00%),达到 GPT-4 性能的 82.4%。