论文

轨迹自行分段:以Agent声明的边界为训练单元

Trajectories That Segment Themselves: Agent-Declared Boundaries as a Training Unit

模型训练奖励建模与过程监督

摘要

长程编码Agent轨迹与现有训练信用单元不匹配:单个动作没有稳定价值,整段标签混合有效探索和被放弃方向,固定窗口则按日志机制截断。我们提出采集时的语义自分段,以声明式约定让行动Agent在生成轨迹时显式表达边界。用可证伪因果假设实例化后,连续采用的假设界定长度可变的语义阶段,无需里程碑词汇、标准补丁、环境回放、教师logits或事后分段器放置边界。Agent命名猜想后,评审可按名称否定,从而生成真实日志中罕见的错误原因—纠正转移;一次采集产生四种监督目标,包括整段标签丢弃的失败区间审计监督。删除声明后,仅给切分点而不给假设,模型仍能以超过随机两倍的表现将动作块归到主导假设,胜过同轨迹等长分段(配对符号检验p=0.0002),通过词汇控制,并在标签置换后失效。要求定位边界时,不看代码的标注者在40个边界中匹配24个,随机放置为11.5个;机械测试事件规则在从严格到宽松的扫描中均未优于随机。因此分段具有连贯性且不易低成本复现。下游对2551个阶段边界对做DPO,在91个对抗性留出条目上没有改变任何决策;匹配构造的60个条目中有四个由错变对,两种控制均无变化。已有来自单一生成器的1825对样本时,下一步应改变的是语料多样性,而非边界定义。

轨迹自行分段:以Agent声明的边界为训练单元:论文配图
图6 :假设定义的阶段作为数据接口。假设生命周期创建一个可变长度的语义段。回顾性审核绑定证据并诊断细分市场;掩码对构造将决策转换为本地偏好单位。