论文
公平一点!机器学习工程代理能否遵守公平约束?
Be Fair! Can Machine Learning Engineering Agents Adhere to Fairness Constraints?
摘要
机器学习工程 (MLE) 代理有望根据原始数据和自然语言指令实现端到端 ML 管道开发的自动化,从而有可能使非技术领域专家也能使用 ML。然而,在敏感和受监管的领域,这种抽象会造成责任差距:最终用户可能缺乏对影响正确性、稳健性、公平性和法规遵从性的设计选择的可见性。我们认为现有的基准不足以评估 MLE 代理是否可以安全地应用于此类环境。我们提出了以责任为中心的评估框架的需求,并对黑色素瘤分类进行了探索性研究,重点关注肤色的公平性作为责任约束。在评估最近的两个 MLE 代理时,我们发现代理生成的管道显示出很高的方差,并且在预测质量和公平性方面始终低于手动设计的基线,尽管有面向公平性的提示。这些初步结果表明,需要进一步研究重新设计 MLE 代理,以允许人类指导搜索过程并可靠地评估生成的 ML 管道的合规性和质量。