论文

用Harness提高学业指导系统可靠性:LLM对比研究

Harnessing LLMs for Reliable Academic Supervision: A Comparative Study

智能体系统Agent Harness

摘要

LLM能对单次提示生成流畅回答,但成为领域决策系统的可靠组件还需要运行机制。Harness工程围绕模型组织确定性约束,包括符号过滤、检索、带模式约束的输入输出、LLM评审循环、人工审核关卡、持久状态和审计记录。论文以包含重要建议、长期责任追踪和结构化流程的学业指导为案例,比较无额外约束的GPT-5助手ASA与采用较小GPT-4o-mini的多模块系统ASuS。ASuS用LangGraph Harness整合符号语义检索、模式校验输出、有重试上限的LLM评审、人工审核、确定性加权风险评分及逐节点SQLite审计。评价涵盖证据依据、可解释性、一致性、流程完整性、认知负担和约束遵循六个维度。十名评估者的盲评结合2×2模型—Harness消融,发现ASuS在全部维度得分更高;汇总均分为4.08,ASA为1.23。十名评估者中八名的配对Wilcoxon检验在α=0.05下拒绝零假设。消融显示,Harness结构贡献在较大程度上不依赖具体模型。论文归纳七种反复出现的Harness工程模式,认为在可靠性、可追溯性与机构一致性优先的任务中,运行机制能够挑战“更大模型更好”的简单判断。