饱和陷阱与干预时机的主体性:为什么情感信号……
The Saturation Trap and the Subjectivity of Intervention Timing: Why Affect-Based Triggers and LLM Judges Fail to Time Interventions on Autonomous Agents
摘要
随着自主人工智能代理从对话系统转向长期软件执行,决定何时中断代理的运行时安全层变得至关重要。我们使用连续 18 维情感动态引擎 (HEART) 作为诊断探针来研究这个时序问题,根据 SWE 平台验证的调试跟踪上的人工注释干预点,评估四个干预触发系列 - 绝对状态阈值、复合状态动作模式、正则表达式推理特征提取和零样本 LLM 作为判断。我们报告了三项发现。首先,状态饱和陷阱:智能体在持续的困难下没有显示出恢复信号,因此建模的挫败感很快就会越过阈值并保持在最大值,将时刻检测器的阈值状态触发器转换为近乎恒定的指示器,在五个轨迹中触发 39-83% 的动作。其次,LLM 法官的能力和背景底线:小型模型 (gpt-5.4-mini) 永远不会触发,而前沿和跨供应商模型只有在全轨迹背景下才能逃脱零触发底线,即使如此,也只能以高达 90 倍的成本达到 F1 0.17-0.40。第三,也是最重要的是,监督目标在人类中是不可重现的:在 56 个动作轨迹上使用一个标题的三个训练有素的注释者仅在略高于机会的位置上达成一致(位置 Krippendorff 的 alpha = +0.047;最佳成对 Cohen 的 kappa = +0.349),而在干预类型上完全不同意(暂停退化;澄清低于机会;仅反映 alpha = +0.226)。我们的结论是,干预时间是一个低可靠性的结构,使得单注释器 F1 成为不合适的优化目标。我们的贡献是在人类评估者间可靠性、四个检测器架构、跨模型 LLM 法官扫描和再现的饱和效应(而不是任何单个检测器的准确性)之间联合映射该问题。