论文

探索和测试基于技能的行为配置文件注释:模式引导执行下的人类可操作性和 LLM 可行性

Exploring and Testing Skill-Based Behavioral Profile Annotation: Human Operability and LLM Feasibility under Schema-Guided Execution

模型评测模型能力评测

摘要

行为概况(BP)注释很难自动化,因为它需要跨多个语言维度同时编码。我们将 BP 标注视为一组标注技能而不是单个任务,并从这个角度评估 LLM 辅助 BP 标注。使用 30 个中文隐喻颜色词派生词的 3,134 个索引行和 14 个特征 BP 模式,我们实现了一个技能文件驱动的管道,其中每个特征都通过模式文件、决策规则和示例进行外部定义。两名人类注释者在 300 个实例验证子集上完成了两轮纯模式协议,使 BP 技能能够被分类为可直接操作、在集中重新注释下可恢复或结构上未指定。然后在相同的设置下评估 GPT-5.4 和三个可本地部署的开源模型。结果表明,BP标注在技能层面存在高度异质性:5个技能是可直接操作的,4个技能在集中重新标注后可恢复,5个技能在结构上仍不明确。 GPT-5.4 非常可靠地执行保留的技能(准确度 = 0.678,\k{appa} = 0.665,加权 F1 = 0.695),但这种可行性是选择性的而不是全局的。人类和 GPT 难度概况在技能级别 (r = 0.881) 上高度一致,但在实例级别 (r = 0.016) 或词汇项级别 (r = -0.142) 上不一致,我们将这种模式描述为共享分类、独立执行。成对协议进一步表明,GPT 更适合被理解为独立的第三技能声音,而不是直接的人类替代品。开源失败主要集中在模式到技能的执行问题。这些发现表明,应根据技能可行性而不是任务级自动化来评估自动注释。