论文
表征影响检索:多模态智能体harness中的技能发现与路由案例研究
Representation Affects Retrieval: A Case Study of Skill Discovery and Routing in a Multimodal Agent Harness
摘要
生产级智能体harness必须从不断增长的技能库中发现并排序最适合用户任务的技能。在小规模下,这种选择发生在上下文中:LLM规划器在系统提示中暴露的技能表征之间做出选择,没有显式的基于嵌入的检索步骤。我们将这种上下文内选择视为大规模下基于嵌入的技能检索的小N对应物,并对Tinycloud——一个生产级多模态视频智能体harness——如何为其规划器表征技能开展案例研究。该harness以两种反复出现的表征发布技能:tool-skill,包装单个外部API或系统工具并充当原语词汇;以及workflow-skill,编排tool-skill调用加上模板渲染以产出一件命名的交付物。该harness通过系统提示中的两个界面暴露它们:面向自动加载技能的内联正文界面(完整指令、脚本、模板),以及面向按需技能的单行列表。跨三种暴露机制(全开、默认、全关)的六任务选择消融显示:全开自动加载在每个任务上都选中金标技能;全关会拖慢执行并造成硬性的发现失败;而生产默认配置在一个任务上发生误路由,因为它的词汇信号与一个自动加载的tool-skill相撞,后者把规划器的注意力从列出的workflow-skill上拉走。核心发现是:提示内暴露技能并非单调有益——部分暴露会制造词汇竞争,抑制正确选择。我们将这一小N观察与近期大规模基于检索的技能路由工作联系起来,并将本贡献定位为案例研究而非基准。