论文
Croissant Tasks:用于可复现机器学习评估的元数据格式
Croissant Tasks: A Metadata Format for Reproducible Machine Learning Evaluations
摘要
可复现性是科学方法的基石,但在机器学习中仍是一个关键挑战。成因包括执行细节交代不足与脆弱的软件环境。以人为中心的补救措施,如清单核查与人工验证,虽有帮助,但需要大量人力且难以规模化。为解决这一问题,我们提出 Croissant Tasks:一种声明式、机器可操作的元数据格式,将底层实现细节抽象为高层规格说明。该格式实现了概念可复现性:通过独立的、由智能体生成的实现来验证论断,而非脆弱的源码复制。我们的贡献包括:(1)Croissant Tasks 规范,将任务问题与解决方案形式化解耦;(2)一个自动化 LLM 流水线,可将现有基准改造为该格式;(3)实证验证,表明自主智能体能够摄取这些规格说明,并从零生成功能可用、结果准确的复现流水线。我们期望这一格式成为机器学习自动化与概念可复现性的新基础。