论文

FormBharo:设计和评估印度农村地区用于填写会话表格的语音代理

FormBharo: Designing and Evaluating a Voice Agent for Conversational Form Filling in Rural India

应用与实践语音交互与综合语音服务

摘要

在印度,几乎每项社会福利都以表格开始,但最需要这些福利的人往往无法读写。联系他们需要进行口头交谈。如今,这项工作落到了一线卫生工作者身上,他们一次登记一名受益人,这是对紧张能力的利用不当。我们构建了 FormBharo(印地语“填写表格”),这是一个语音代理,通过将 大语言模型 (LLM) 与确定性的、基于规则的验证和流程控制配对,在严格的延迟和成本预算下通过电话填写结构化表格。该项目正在与 ARMMAN 一起进行试点,ARMMAN 是一家在印度运营大规模孕产妇和儿童移动医疗项目的非政府组织,旨在让低收入、讲印地语的母亲参与产前和产后护理。据我们所知,这是第一个为该人群试点填写登记表的语音代理。我们公开发布了 FormVoiceAgentBench,这是一个基准测试,将人工录制的印地语音频与 960 个模拟通话中的 3,760 个多轮对话测试配对,以评估我们的代理组件(转录、提取、回复生成)和真实声学变化下的端到端表单完成。当 LLM 收到容易出错的真实语音记录而不是参考记录时,表格完成度下降了约 41 分。基于规则的控件可以恢复许多回合级提取错误,帮助更小、更便宜的模型在表单完成方面匹配或超越前沿模型。组件性能并不能预测端到端性能:GPT-5.5 在参考笔录上的轮级提取准确性方面领先(99.8%),但在表单完成方面排名较低。由于错误会在整个管道中传播和消除,因此模型的最佳模型选择只能通过端到端评估才能出现。最后,没有一个模型能够同时兼顾准确性、成本和延迟,因此我们使用基于 Pareto 的加权和标量化来选择平衡三者的可部署配置。