论文
RubricsTree:跨健康记忆和医疗技能的个人健康代理的可扩展和不断发展的开放式评估
RubricsTree: Scalable and Evolving Open-Ended Evaluation of Personal Health Agents across Health Memory and Medical Skills
摘要
具有用户健康(传感器)指标的 LLM 授权个人健康代理为缓解全球医疗保健获取方面的差异提供了一条有希望的途径。然而,大规模临床部署仍然受到开放式评估瓶颈的限制:医生注释可靠,但成本高昂且不可扩展,而 LLM-as-a-judge 评估器可扩展,但主观、不一致,有时临床上不一致。我们推出了 RubricsTree,这是一个可扩展的评估框架,具有超过 100 个原子的、可临床验证的布尔量规的专家对齐分层分类法,通过由经验丰富的医生领导的专业小组通过迭代人机循环管理协议从 4,000 个真实用户查询的见解中演变而来。上下文感知自适应路由器仅激活每个查询的相关自动加权标题子集,从而提供具有专家一致质量的可扩展评估所需的吞吐量。通过系统的元评估,我们表明 RubricsTree (i) 在具有挑战性的开放式查询的专家对齐方面大大超过了强大的大规模评估基线; (ii) 可靠地惩罚上下文降级的响应; (iii) 当用作结构化指令、文本反馈或性能优化的训练奖励时,Gemini、GPT 和 Qwen 模型系列在 HealthBench 上的相对增益高达约 66%。因此,RubricsTree 提供了持续优化产品级个人医疗保健人工智能所需的可扩展、可审计和不断发展的评估基础设施。