论文

MeetBench-XL:面向实时会议的校准多维评估与学习型双策略智能体

MeetBench-XL: Calibrated Multi-Dimensional Evaluation and Learned Dual-Policy Agents for Real-Time Meetings

摘要

企业会议环境需要AI助手在严格的延迟、成本与隐私约束下处理多样化运营任务,从实时讨论中的快速事实核查到面向战略规划的跨会议分析。现有会议基准主要聚焦简化的问答,未能反映真实企业工作流——查询源自多利益相关方协作、跨越长时序上下文并需要工具增强推理。我们通过一个基于真实场景的数据集与一个学习型智能体框架来弥补这一空白。首先,我们介绍MeetAll,一个源自231场企业会议、总计140小时的双语多模态语料库。问题采用经领域专家评审与人类可辨别性研究验证的企业知情协议注入。与纯合成基准不同,该协议扎根于四个企业关键维度:认知负荷、时间上下文跨度、领域专业知识与可执行任务执行,并通过对金融、医疗与技术行业利益相关方的访谈进行校准。其次,我们提出MeetBench-XL,一个与人类判断对齐的多维评估协议,测量事实保真度、意图对齐、响应效率、结构清晰度与完整性。第三,我们提出MeetMaster-XL,一个学习型双策略智能体,联合优化快慢推理路径之间的查询路由与工具调用,包括检索、跨会议聚合与网络搜索。轻量级分类器以最小开销实现准确路由,相较单模型基线取得更优的质量—延迟权衡。与商业系统的对比实验显示一致提升,并有消融、鲁棒性测试与真实部署案例研究支持。资源:https://github.com/huyuelin/MeetBench。

MeetBench-XL:面向实时会议的校准多维评估与学习型双策略智能体
图1:基于企业会议工作流的 MeetAll 数据集与 MeetBench-XL 基准概览。MeetAll 包含 231 场会议(140 小时),注入了经过企业验证的问题,涵盖运营事实核查、跨会议综合以及可执行规划任务。MeetBench-XL 在五个以人类判断校准、企业优先的维度上评估助手。MeetMaster-XL 通过学习到的策略优化达到了可部署级别的性能。