论文

为基于 AI 的功能开发人员提供的 In-IDE 工具包

In-IDE Toolkit for Developers of AI-Based Features

AI 基础设施AI 开发与运维平台

摘要

基于 LLM 和代理工作流程构建的人工智能功能很难测试、调试和重现,特别是对于没有机器学习背景的以产品为中心的软件工程师来说。我们推出了适用于 JetBrains IDE 的 AI Toolkit 插件,它将跟踪和评估直接带入运行/调试循环中。与从业者进行的混合方法研究提出了三个一致的需求:(1) 使评估定期且可重复,(2) 在执行时公开跟踪,以及 (3) 最小化设置和上下文切换。在这些需求的指导下,AI Toolkit 引入了 IDE 原生工作流程:运行触发的跟踪捕获;立即、分级检查;从轨迹中一键“添加到数据集”;以及具有可插入指标的类似单元测试的评估。 PyCharm 的第一个版本显示了有希望的早期信号 - 在运行时提升时的强烈转换、捕获痕迹的人的持续使用以及低流失率 - 这表明 IDE 原生可观察性降低了激活能量并帮助开发人员采用严格的实践。我们详细介绍了人工智能代理调试器和人工智能评估的设计和实现,报告了初步采用遥测,并概述了扩大框架覆盖范围和规模评估的后续步骤。总之,这些结果表明,将 AI 可观察性和评估集成到日常 IDE 工作流程中可以使非机器学习专家可以进行现代 AI 开发,同时保留软件工程实践。