论文
口头Agent何时有足够的证据采取行动? PACT-SLM 合同测试
When Does a Spoken Agent Have Enough Evidence to Act? The PACT-SLM Contract Test
摘要
流式语音Agent可能会在可用语音支持之前采取外部操作,但最终回合分数并不能揭示每个观察到的前缀是否支持该操作。我们引入了语音语言模型轮流的部分语音动作契约(PACT-SLM),这是一种受控评估,分配第一个有效动作时间并分别测量动作身份和时间。主要诊断包含来自四个保留语义族的 80 个配对对比组以及跨干净和 15 dB 噪声渲染的 1,600 个前缀预测。在纠正随机分支代码和语义标签之间的不匹配后,改装后的 WavLM Base Plus 探针达到了 26.03% 的发病后语义标签汇总准确率(95% 组引导间隔:22.14%-29.68%),暴露了对 18.99% 的发病前前缀的操作,并准确预测了 5.94% 的完整轨迹。它在起始后标签准确性方面超过了匹配文本、标量声学和打乱表示探针,但其得分位于 100 个前缀内标签排列的第 96 个百分位,低于第 97.5 个百分位参考值 (26.73%)。经过的时间比 WavLM Base Plus 更准确(36.25% vs. 23.13%),但在动作识别方面不太准确(9.92% vs. 26.03%)。这些结果表明,动作同一性和时间安排衡量部分语音决策行为的不同方面。