论文
采用贝叶斯对抗多智能体框架的 AI for Science 低代码平台
AI-for-Science Low-code Platform with Bayesian Adversarial Multi-Agent Framework
摘要
大语言模型(LLM)展现自动化科学生成的潜力,但在可靠性、多智能体工作流中的误差传播以及成功指标模糊领域的评估上面临挑战。我们提出专为 AI for Science(AI4S)任务设计的贝叶斯对抗多智能体框架,以低代码平台(LCP)形式呈现。三个基于 LLM 的智能体在贝叶斯框架下协调:任务管理器把用户输入结构化为可执行计划与自适应测试用例,代码生成器产出候选解,评估器提供全面反馈。框架采用对抗循环:任务管理器迭代细化测试用例以挑战代码生成器,同时按贝叶斯原理整合功能正确性、结构对齐与静态分析等代码质量指标,动态更新提示分布。测试与代码的协同优化降低对 LLM 可靠性的依赖,并应对科学任务固有的评估不确定性。LCP 还把非专家提示转译为领域特定需求,简化人机协作,使无编程背景的从业者无需手工提示工程。基准评估证明 LCP 在生成稳健代码的同时把误差传播降到最低。该平台还在一项地球科学交叉学科任务上测试,展现强可靠性,优于竞争模型。
