论文
StanceBench:基于音频LLM的语音人际立场评估基准
StanceBench: A Benchmark for Audio LLM-Based Interpersonal Stance Evaluation from Speech
摘要
语音到语音对话模型日益依赖韵律与互动细节来传达社交意图,但针对这些线索的基准仍然有限。我们提出StanceBench,一个测量会话语音中人际立场并评估具备音频能力的LLM作为自动裁判的基准。基于Seamless Interaction语料库,StanceBench(1)通过角色提示两极界定9个立场维度,(2)标准化单说话人与基于互动的评估,(3)报告LLM-as-a-judge的鲁棒性、偏差与立场推断。在所评估的立场中,共情与礼貌最易判别。温暖与果断的可分离度中等,并存在正向偏斜/不对称。诚实最难判别,且呈现高提示顺序偏差,与其需要跨轮证据相一致。专注可判别但与人类判断的一致性较弱。互动立场对语境更敏感,存在阈值差距与高方差,尤其是冲突调节。
