论文

LLM 工具注册表中面向代理的信息设计:修辞、立场和结构的预注册测试

Agent-Facing Information Design in LLM Tool Registries: A Preregistered Test of Rhetoric, Position and Structure

模型评测模型行为与机制分析

摘要

人工智能代理通常从注册表中选择工具,每个工具的提供者都会在其中编写其描述。我们询问这些描述中的销售语言是否会改变代理商选择的工具。我们以一种受控方式构建了不同的列表对(添加赞扬、可验证的规范或列表顺序),并要求两个 OpenAI 模型调用一个工具。在一项预先注册的研究中,叠加的赞扬(总共四种)将工具的选择率提高了约 43 个百分点,达到或超过了可验证的规范。赞扬还让一些人选择了无法完成任务的工具,但很少选择要求访问不需要的数据的工具。对于相同的列表,第一个列出的工具被选择的频率大约高 72 点。对于有数字限制的任务,结构化字段可以帮助代理选择功能强大的工具;在字段旁边添加提供商的销售文本会减少或消除这种收益。登记处可以将限制列为字段,向代理商隐藏销售文本,并随机化顺序。堆积如山的赞扬,但没有单一的赞扬在保留的领域中复制。在盲语评级完成之前,结果是临时的,并涵盖两个小模型。