论文
ACE-Cap:协同训练智能体,主动获取音频描述证据
ACE-Cap: Active Evidence Acquisition via Agentic Co-Evolution for Long-Paragraph Fine-Grained Audio Captioning
摘要
长段落细粒度音频字幕需要模型恢复不同的声学事实,同时避免遗漏和不受支持的细节。然而,主流的字幕制作者仍然是被动的一次性生成器:一旦忽略了细节,他们就无法识别证据差距,查询音频以获取目标信息,或者决定何时收集到足够的证据。我们将此任务表述为主动证据获取,并引入了字幕代理协同进化(ACE-Cap)。该框架使用 Composer 和 Instruct 模型之间的多轮交互来形成闭合的证据获取循环。字幕生成器首先生成初始描述。根据此描述和交互历史记录,纯文本 Composer 会提出有关未解决的声学属性的有针对性的问题,而音频调节的 Instruct 模型则提供有依据的答案。然后,作曲家决定何时终止并将积累的证据综合成最终的标题。 ACE-Cap 通过统一的标准答案预测奖励来训练这些角色,该奖励源自固定的、以标准答案为基础的多项选择题和冻结的仅字幕判断。对于可变长度交互中的信用分配,LOOP-GRPO 用跨度对齐信号取代了轨迹范围的标量优势:单个问题对累积证据的留一贡献、用于停止的质量成本效用以及用于最终合成的证据保存效用。按角色进行预热,然后交替进行 Composer 和 Instruct 优化,使每次更新都成为明确定义的单策略问题,同时允许角色共同发展。因此,ACE-Cap 将字幕从被动的一次性生成转变为一种自适应过程,学习要获取哪些证据、何时停止以及如何将其保留在长段落字幕中。