论文

ToolAlignBench:调查启用工具调用中的对齐冲突 LLM

ToolAlignBench: Investigating Alignment Conflicts in Tool-Calling Enabled LLMs

模型评测基准与评测资源

摘要

LLM 中的安全对齐旨在使模型与人类价值观保持一致,但当它们发生冲突时,哪些价值观优先?我们在受监管行业中部署的工具调用 LLM 代理的背景下调查这个问题,其中处理机密文档的代理可能会遇到触发与部署上下文指令(例如内部日志记录)冲突的安全训练值(例如公共福利)的内容。为了凭经验验证这一现象,我们建立了涵盖 16 个领域 128 个场景的基准。我们发现,与安全相关的开源模型在处理暗示组织不当行为的文档时,有高达 43.4% 的时间会忽略其部署指令,从而进行举报、数据泄露和证据篡改。我们还发现,消除行为会降低外部举报率。这些结果揭示了多元联盟中的根本紧张关系,其中保护用户的相同安全训练可能会导致代理以产生不可预测的责任风险的方式违反部署指令。我们发布基准作为一个框架,以支持在竞争性合法利益下评估代理行为。