论文
Fyan:具有文档级形式化语义审计功能的人类人工智能工具
Fyan: A Human--AI Harness with Semantic Auditing for Document-Level Formalization
摘要
我们推出了 FYAN,一种用于文档级数学形式化的人类人工智能工具。 FYAN 不是孤立地处理定理,而是协调涵盖规范、证明规划、逻辑审查、Lean证明构建、知识管理和验证的端到端工作流程,并支持独立监督和人工指导。一个核心组成部分是基于证据的语义审计,它评估正式陈述是否忠实地保留了其非正式规范。语言模型根据局部对应、遗漏、范围和逻辑关系构建结构化证据,而确定性验证器检查这些证据并产生可重复的判断。当接受实质性但可接受的偏差时,FYAN 要求明确的证明转移义务,将正式声明与面向来源的解释连接起来。在每个阶段使用相同的模型 (DeepSeek-V4.1-Flash),FYAN 在严格的Lean检查下证明了 143 个 FormalTCS 定理中的 86 个,而一般Agent Harness仅证明了 69 个定理,并将自然语言证明分数从 0.501 提高到 0.851。在 ConsistencyCheck 上,其语义审核比直接 LLM 评审捕获更多不一致的语句,无论是在根据源验证的标签(召回率 0.777 与 0.636)上还是在原始标签上(0.873 与 0.820),并将其报告的每个不匹配定位到特定的假设、结论或范围。 FYAN 还构建了 ODENumLib,这是一个用于常微分方程数值分析的 9,355 行 Lean 库。