论文

Vibe专利化:评估LLM裁判者在专业专利撰写智能体中的表现

Vibe Patenting: Evaluating LLM Judges for Professional Patent-Drafting Agents

模型评测智能体系统Agent Harness评测方法与指标

摘要

LLM裁判者被越来越多地用于评估和优化AI生成内容,但其在复杂专业工作中的可靠性尚不明确。我们通过Vibe Patenting构建了一个端到端的专利撰写测试平台,用于AI智能体的评估。一个独立调用的LLM裁判者对生成的专利草案进行评估,并提供结构化反馈以实现迭代修订。在多个发明领域和不同撰写智能体配置下,裁判引导的修订能持续提升裁判评估的质量,而无引导的修订则趋于饱和。值得注意的是,迭代的裁判反馈使低推理能力的智能体能够接近高成本高推理能力智能体的性能水平。更强的模型和更多推理通常能提升裁判评估的撰写质量,而领域特定的智能体工作流能带来进一步提升。我们通过专业专利律师的独立评估验证了裁判结果,发现存在有意义但高度依赖指标的共识,以及系统性的校准差异。这些结果凸显了LLM裁判者作为复杂专业工作流评估工具和优化信号的实用性和局限性。

Vibe专利化:评估LLM裁判者在专业专利撰写智能体中的表现:论文配图
图1:Vibe Patenting框架。AI智能体先将技术证据转换为共享表示,再由专利技能协同生成权利要求、说明书、附图及支撑分析。质量评审智能体评估整个材料包,必要时启动修订。