论文
语义几何能教会 Agent 判断行动许可吗?
Can Semantic Geometry Teach an AI Judgement?
摘要
AI Agent如何判断应遵循哪些规则?一条规则允许动作,另一条又设定条件、例外或冲突义务。关系明确时,确定性系统可解决;关系隐含在语言里时,Agent可能遵循一条规则却漏掉应阻止动作的另一条。拒绝所有未决动作避免风险,也阻止合法动作。我们希望Agent能区分并行动。最初假设几何测量可提供判断基础,因而将动作与政策表示成向量,测试几何是否能识别管辖政策并解释动作关系。四项研究未建立可靠的行动前判断。最终合成研究中,词法路由找回所有管辖及阻止政策,政策检查中位数减少97.7%;但组合管线仍将全部2304个测试动作升级审查,包括本应允许的动作。把所有政策交给同一后续机制也未改变决定,找到政策没有解决解释问题。我们据此修订假设:Agent判断需要构建后果图,将行动主体和权限连接到政策条件、例外及动作造成的变化。后续将研究显式关系能否帮助区分行动、停止与请求审查。