论文
智能体模型做信息抽取的行为可控性:从固定工作流到反思式智能体
Behavioral Controllability of Agentic Models for Information Extraction: From Fixed Workflows to Reflective Agents
摘要
大语言模型(LLM)智能体正被越来越多地用于复杂信息抽取任务,但反思、记忆等智能体组件是否带来相对于固定LLM工作流可观察、可控的改进,仍不清楚。我们以会议论文数据集抽取为研究场景——系统需识别学术PDF中提及的数据集并产出结构化记录。我们比较固定工作流基线与反思式智能体变体,并指定一个优化的智能体条件(S2),在相同任务上扩展更丰富的PDF工具与动态工具选择。评估强调过程级行为——包括工具执行、重试、反思、记忆使用、运行时与失败恢复——而把抽取覆盖与字段完整度作为次要结果指标。论文刻画了智能体机制何时改变系统行为、这些改变是否改善任务完成,以及观察到的失败模式如何在同一评估框架下催生优化的智能体设计。
