论文
从可追溯性到正当性:代理软件工程中的责任结构
From Traceability to Justifiability: Accountability Structures in Agentic Software Engineering
摘要
推广人工智能系统的管道发布记录,声称评估的东西是部署的东西,并且证据许可了过渡。我们仅根据公开材料来衡量这些记录是否可以表达该主张以及其声明是否成立。首先,根据一个固定的三标签协议对 47 个交付平台(20 个 CI/CD、27 个模型服务/代理)进行两类文档调查,两次评分(第二次盲审),每个查阅的页面都通过内容哈希和日期固定。在 188 个双级单元中,我们没有发现任何平台的默认记录会发出行为元组的内容寻址标识(模型版本、指令、工具定义、检索和运行时配置);该列默认的盲通过等级为 47 中的 0。同时,代理平台的默认答案(27 中的 16)也出现了不可变的名义版本控制:可变指针后面的版本整数,工件供应链已经发现这一层不足。其次,仪器仅根据管道公布的排气计算实现的保证深度,并将其与声明的深度进行比较。应用于从散列存档中两次分级的 30 个公共存储库的冻结双层框架(第二次盲审;单元级协议 23 和 30 中的 19,两次都通过独立地找到相同的 5 个完整实现),最明显的结果是可验证性漏洞:选择采用证明工具的 15 个存储库中有 7 个发布了仅源版本,因此无法在声明的地方检查其工作流程声明的绑定。在可检查的情况下,它主要进行检查:七个可衡量的采用者中有五个实现了端到端的绑定;这两个缺陷都在于身份绑定。综合起来,结果发现该领域的记录在结构上缺乏合理性,这是可以拒绝转换的一级。该调查带有到期时钟;我们会说明哪些内容会证伪每项发现。