论文
SkillSeek:重新审视市场规模的座席技能检索
SkillSeek: Revisiting Agent Skill Retrieval at Marketplace Scale
摘要
Anthropic 的 Agent Skills 将 LLM Agent的可重用程序知识打包到 SKILL.md 目录中,并且开源聚合已超过 230,000 个技能,从而实现选择而不是创作瓶颈。文献中的标准答案将选择外包给Agent本身:一个以 LLM 为媒介的检索循环,它重写查询并在Agent的决策循环内细化候选者,并为每项任务支付 LLM 词元。我们推出了 SkillSeek,这是一种根据标准 IR 配方(基于 BGE 的双编码器为小型交叉编码器提供数据,通过 MCP 公开)构建的开源两阶段技能检索器。在 89 任务 SkillsBench 基准上,在 4×11的池、主干和方法网格中,SkillSeek 达到了与 Liu 等人的 LLM 介导的循环观察到的同等水平。基本上没有额外的成本:普通的 bm25 单独在四个设置中的三个上记录了等于或高于其精炼循环的通过率,并且一个小的交叉编码器覆盖了第四个设置上的剩余差异。第一阶段的召回上限解释了这种模式,每次试验的总支出从 51.30 美元下降到 27.54 美元(与无技能基线相差 50 美分以内)。在我们测试的 SkillsBench 任务和 OpenHands 工具下,这将标准 IR 配方定位为Agent技能检索的强大默认设置,而 LLM 介导的替代方案自然适合确定性方法不足的情况。