论文
LLARS:支持领域专家与开发者协作进行LLM提示、生成与评估
LLARS: Enabling Domain Expert & Developer Collaboration for LLM Prompting, Generation and Evaluation
摘要
我们展示LLARS(LLM Assisted Research System),一个弥合领域专家与开发者之间鸿沟、用于构建基于LLM系统的开源平台。它将三个紧密关联的模块整合为端到端流水线:协同提示工程,支持带版本控制与即时LLM测试的实时共同编写;批量生成,在用户选择的提示×模型×数据组合上进行可配置的产出并带成本控制;混合评估,由人类与LLM评估者通过多种评估方法共同评判输出,并以实时一致性指标与溯源分析为给定用例找出最佳的模型-提示组合。新提示与新模型自动可用于批量生成,已完成的批次可一键转化为评估场景。对在线咨询场景中六名领域专家与三名开发者的访谈证实,LLARS直观易用,通过将一切集中在同一处节省了大量时间,并使跨学科协作顺畅无缝。
