论文

mimeo:将公开专家语料编译为智能体技能,并检验迁移效果

mimeo: Compiling Public Expert Corpora into Agent Skills and Testing What Transfers

智能体系统Agent Skills

摘要

向智能体提供有关指定专家的文件可以提供难以找到的材料,产生可识别的角色,或改变智能体的决定。这些是不同的主张。我们测试每一项。 mimeo 是一种开源工具,可以查找某人的公共作品,根据缓存的源文本检查每个提取的引文,并编写一个代理可以加载的文件。八个记录的构建平均有 38 个模型调用;检查拒绝了 13.2% 的提取报价。我们使用一个编码代理工具测试了四个专家文件。知识获取最清晰:油印回答了所有 20 个晦涩难懂、引用较多的问题;没有闭卷条件回答超过 10。同一页面上的关键字搜索 (BM25) 回答了 15-17,这是本示例无法解决的差距。依据来源的回答显示出一个明显的好处:根据模型记忆编写的角色在每个评分者的 20 个答案中的 1-4 个上错误地陈述了记录的位置;朴素的智能体和模仿者从来没有这样做过。在简短的开放提示中,每个角色都很容易被发现,并且添加任务材料可以将识别度降低 18-23 点。 mimeo 并不比记忆中的配置文件更容易识别。判断转移仍未解决,因为两项测试都达到了上限:每种条件都发现了 94-97% 的工程任务中存在的问题,并且在 16 个新应用场景上得分为 94-100%。人工智能判断的“听起来像专家”分数随着法官的变化而变化:四个首选答案中的两个基于模型的刻板印象,而两个在同一文本上没有发现差异。这是对依赖单一人工智能法官的警告。证据支持哑剧作为一个人的紧凑的、可检查的参考,而不是作为他们判断的明显转移。工具包和专家简介:https://github.com/K-Dense-AI/mimeo

mimeo:将公开专家语料编译为智能体技能,并检验迁移效果:论文配图
图1 哪些转让取决于所计量的。灰色标记控件( 无技能, 单线人, 来自模拟配置); 橙色标记 BM25 检索; 蓝色标记 Mimeo 。(a) 在同一20个问题上,每个分数都是一个分数。(b) 在三个任务设置中盲目识别已装满专家:重复的按键工程任务、简短的开关提示和附有成套证据的同样的提示。4名法官平均人数,小点是单身法官,破折线是25%的概率。(c) 每点为一个分数下的一个条件。重复职等单独显示,不作为独立数据处理。