论文
ATANT:一个评估AI连续性的框架
ATANT: An Evaluation Framework for AI Continuity
摘要
我们提出ATANT(Automated Test for Acceptance of Narrative Truth),一个用于衡量AI系统连续性的开放评估框架:连续性指跨时间持续、更新、消歧并重构有意义上下文的能力。尽管AI行业已产出各种记忆组件(RAG流水线、向量数据库、长上下文窗口、画像层),但尚无公开发表的框架正式定义或衡量这些组件是否产生真正的连续性。我们将连续性定义为一个具有7项必要属性的系统属性,引入一种在评估回路中无需LLM的10检查点评估方法,并呈现一个包含250个故事、覆盖6个生活领域、共1,835个验证问题的叙事测试语料库。我们对一个参考实现进行了5轮测试套件迭代的评估,从58%(旧架构)提升到隔离模式(250个故事)下的100%和50故事累积模式下的100%,在250故事累积规模下为96%。累积结果是主要度量:当250个不同的生活叙事共存于同一数据库时,系统必须为正确的上下文检索出正确的事实且不发生交叉污染。ATANT与系统无关、与模型无关,并被设计为构建和验证连续性系统的序列化方法学。框架规范、示例故事和评估协议可在https://github.com/Kenotic-Labs/ATANT获取。完整的250故事语料库将逐步发布。