论文

AgentWorld:面向Agentic信息检索的个性感知可靠性评估

AgentWorld: Personality-Aware Reliability Evaluation for Agentic Information Retrieval

智能体系统Agent任务评测

摘要

智能体信息检索的评估仍局限于与同质化用户的脚本化交互,既缺失自然的人格多样性,也缺失对抗脆弱性。我们提出AgentWorld,一个组合以下要素的仿真框架:(i) 由大五(OCEAN)人格驱动的用户群体与有状态的工具使用环境;(ii) 带结构化故障分类、部分得分和双重控制交接验证的pass^k一致性指标;(iii) 六种微调格式的分数阈值化训练数据导出;(iv) 一个对抗性风险分析器(Risk Analyser),对所需中间状态骨干进行快照,在四类任务感知扰动下分支蒙特卡洛rollout,并通过ΔP/ΔT评分、Dempster–Shafer证据融合和Shapley攻击类别归因来量化风险。三个实验展示该框架:跨10个OCEAN人格的对话式分析智能体(240次评估者判断);跨5任务×4人格变体的客服智能体;以及对5个任务的对抗压力测试,揭示预先存在的轨迹脆弱性(无扰动时V_min=0.375)和工具/基础设施层攻击的主导地位(Shapley:系统层46%、动作层38%)。人格差异暴露了同质化测试无法发现的失败模式——跨域泄漏、上下文漂移、0.27分的质量差距,以及同一任务上跨人格50%对100%的通过率——而风险分析器量化了pass^k本身无法测量的轨迹级脆弱性。

AgentWorld:面向Agentic信息检索的个性感知可靠性评估:论文配图
图1。AgentWorld:面向智能体信息检索的个性感知评测统一框架。四个阶段在持续的 定义→模拟→评估→压力测试→改进 循环中运行。(a) 定义:用户目标、应用/领域、被测智能体、OCEAN人格。(b) 模拟:在感知-行动-提交循环下进行带工具使用、交接与状态变化的端到端多轮交互。(c) 评估:逐消息行为评分、pass@k可靠性、结构化故障分类,以及轨迹级与交接级评估。(d) 对抗风险分析器(§3.4、§4.4):带蒙特卡洛分支的必需中间状态主干、四类任务感知扰动、Dempster–Shafer证据融合与Shapley归因。评分门控的导出闭合循环——失败成为训练信号。