论文
AgentWorld:面向Agentic信息检索的个性感知可靠性评估
AgentWorld: Personality-Aware Reliability Evaluation for Agentic Information Retrieval
摘要
智能体信息检索的评估仍局限于与同质化用户的脚本化交互,既缺失自然的人格多样性,也缺失对抗脆弱性。我们提出AgentWorld,一个组合以下要素的仿真框架:(i) 由大五(OCEAN)人格驱动的用户群体与有状态的工具使用环境;(ii) 带结构化故障分类、部分得分和双重控制交接验证的pass^k一致性指标;(iii) 六种微调格式的分数阈值化训练数据导出;(iv) 一个对抗性风险分析器(Risk Analyser),对所需中间状态骨干进行快照,在四类任务感知扰动下分支蒙特卡洛rollout,并通过ΔP/ΔT评分、Dempster–Shafer证据融合和Shapley攻击类别归因来量化风险。三个实验展示该框架:跨10个OCEAN人格的对话式分析智能体(240次评估者判断);跨5任务×4人格变体的客服智能体;以及对5个任务的对抗压力测试,揭示预先存在的轨迹脆弱性(无扰动时V_min=0.375)和工具/基础设施层攻击的主导地位(Shapley:系统层46%、动作层38%)。人格差异暴露了同质化测试无法发现的失败模式——跨域泄漏、上下文漂移、0.27分的质量差距,以及同一任务上跨人格50%对100%的通过率——而风险分析器量化了pass^k本身无法测量的轨迹级脆弱性。
