论文

ARIA - 信息娱乐系统自主测试的代理框架

ARIA - An Agentic Framework for Autonomous Testing of Infotainment Systems

智能体系统Agent 架构与控制循环

摘要

汽车信息娱乐验证仍然依赖于手动测试,速度慢、成本高,并且与敏捷发布和 OTA 更新不兼容。脚本化自动化仅提供部分帮助:它将测试逻辑与实现结合起来,产生脆弱且高维护成本的套件。现有的 LLM 驱动框架主要针对 Web/移动应用程序,使用单代理或双代理设置,使一两个模型同时具有感知、规划、动作选择和验证功能,鉴于信息娱乐的复杂性,容易产生幻觉和无效的探索循环。我们提出 ARIA(自主实时信息娱乐评估),这是一个多代理 LLM 框架,它通过视觉交互在 Android 信息娱乐系统上自主运行端到端测试,每步使用四个专门代理的闭环管道加上一个报告阶段。从单句场景(路径、操作、预期结果),ARIA 运行交互并生成报告、可重现的脚本和每一步的视觉证据。在 30 个场景中对制造商的物理 Android 信息娱乐系统进行评估,ARIA 完成了 28 个场景(93.3%)并得出结论(2 个错误),其中 20 个场景(71.4%)与 真值 匹配。它发现了所有 5 个已知缺陷,没有任何故障被视为工作;其 8 个误报源于导航/图像限制和不受支持的手势,表明多代理 LLM 可以在工业上运行信息娱乐测试,同时暴露低误报容忍度的成本。单智能体基线证实了多智能体设计的价值:在第一次通过时,在更强的模型重新审视缩小差距之前,它显示出更高的假阳性率(72.0% vs. 52.6%),将导航困难与系统故障混为一谈。我们报告首次通过/重访后结果、每个场景的词元/调用/成本,并通过重复运行显示稳定性跟踪复杂性,故障检测完全一致,指出可视化测试的 CI 集成。