论文

扩展 FunctionGemma 以实现实用的设备上移动功能调用

Extending FunctionGemma for Practical On-Device Mobile Function Calling

模型训练合成数据

摘要

设备上的助手需要将自然语言映射到本地系统操作的函数调用模型,但现有资源强调 Web API 或狭窄的移动操作目录。我们通过引入 MOBILEACTIONSEXTENDED 将 FunctionGemma 270M-it 扩展到实际的 Android 工作流程,MOBILEACTIONSEXTENDED 是一个经过模式验证的综合数据集,包含约 9,500 个对话,涵盖 15 个设备控制类别,包括消息传递、电话呼叫、相机/屏幕截图、亮度控制、设备状态查询、手电筒控制和应用程序管理。我们在仅完成损失下使用 TRL 监督微调对 270M 模型进行微调,产生扩展专家和与 Google 的 MOBILEACTIONSGOOGLE 联合训练的组合模型。在 MOBILEACTIONSEXTENDED 上,端到端准确率从基本模型的 29.3% 和 Google Mobile-Actions 变体的 17.2% 提高到 76.5%。合并后的模型在 MOBILEACTIONSEXTENDED 上的保留率为 76.5%,在 MOBILEACTIONSGOOGLE 上的保留率为 82.3%,低于 Google Mobile-Actions 专家的 90.3%,相当于类别覆盖率翻倍的代价是 8.0 个百分点的权衡。我们发布了数据集、微调模型、可重复的训练/评估管道和 Android 演示,强调紧凑的本地函数调用是实现低延迟和隐私保护移动助手的实用途径。