论文
显式状态引出并不够:记忆策略分类的受控审计
Explicit State Elicitation Is Not Enough: A Controlled Audit of Memory-Policy Classification
摘要
个性化智能体必须决定检索到的用户记忆应被使用、忽略、更新还是查询,之后才能作用于当前任务。我们利用这一场景开发了一套针对结构化中间输出的实证审计协议:首先审计数据集捷径,然后隔离捆绑式提示变更,检查中间标签是否与答案相关联,测试分解式语义证据,并审计提供商层面的执行失败。一个480样本的合成开发集最初显示状态结构化提示包带来巨大收益,但TF-IDF诊断显示了词汇可分性,且不存在独立的正向Ignore案例。因此我们构建了一个冻结的160样本受控反事实集,包含40个匹配的四路族以及由规则推导的参考策略。在该集合上,暴露四个状态定义能提升准确率,但单独增加显式状态输出字段并未显著提升Llama-3.3-70B的策略准确率,对GPT-OSS-120B也只带来边缘且不显著的增益。提供与基准相关联的状态标签会改变策略预测,但由于这些标签确定性地映射到策略,这属于标签条件化诊断,而非存在忠实内部机制的证据。族层面与种子稳定性分析进一步表明,样本级准确率高估了反事实一致性:完整的四路族全部成功很罕见。一项引出分解式语义证据的探索性后续实验也未能改善被干净评估的端点的路由;对应的GPT-OSS条件因提供商侧请求验证问题而无法进行。我们仅评估策略分类,不评估下游响应、工具行动或记忆库变更。