论文
通过人类对齐为药物发现中的代理 AI 设计一个基于 LLM 的鲁棒评估系统
Designing a Robust LLM-Based Evaluation System for Agentic AI in Drug Discovery Through Human Alignment
摘要
Agentic 大语言模型 (LLM) 系统正在重塑化学和药物发现的科学工作流程,但评估其开放式、工具增强的输出仍然是一个基本瓶颈。 LLM 作为法官范例已成为一种可扩展的替代方案,但现有的药物发现基准部署了 LLM 法官,而没有验证他们与人类专家的一致性。在这项工作中,我们为 ChatInvent(阿斯利康部署的代理药物发现助手)提出了一个 LLM-as-a-Judge 评估框架,有五个贡献。首先,我们定义了四个输出质量评估维度——完整性、相关性、结构清晰度和范围遵守——以及确定性工具调用正确性检查。其次,我们通过与五位专家注释者的人类对齐研究来验证法官,比较 Gemini 3.1 Pro、Claude Opus 4.7、GPT-5 和 Llama 3.1 70B 作为候选法官。第三,我们使用人工注释示例的少量演示来优化表现最佳的法官,将与人类多数投票的一致性从 0.80 提高到 0.86。第四,将优化的判断应用于 70 个保留的问题,我们发现了具体的局限性,并且没有发现强有力的证据表明非正式措辞会降低输出质量;但是,在询问代理之前让 LLM 重写原始问题可能仍然会有所帮助。最后,我们将框架扩展到 38 个不明确、无效、超出范围或道德敏感的对抗性问题,并表明代理的拒绝行为是由请求的既定意图引导的。我们的框架提供了一个可重用的模板,用于对科学领域的代理系统进行人性化的评估。