论文
沙箱中的编码Agent可作为具有竞争力的全模态任务求解器
Sandboxed Coding Agents are Competitive Omni-modal Task Solvers
摘要
随着多模态 LLM 越来越多地针对视频和音频,人们通常认为此类任务需要原生全模态模型。我们证明情况并非总是如此:仅具有文本+图像访问和沙盒工具使用界面的 编码智能体 可以匹配,并且在多个设置中优于跨多个音频视频基准的 SOTA 原生全模态模型和预定义的多模态代理支架。我们的轨迹分析表明,它们的优势来自于编写代码和编排工具,从文字记录、帧和其他模态信号中提取相关证据,从而将全模态任务转换为检索和信息处理问题,而不是摄取整个媒体流。我们通过故障分类和流程级跟踪分析进一步描述了它们的局限性,并表明简单的技能注入(包括人工编写和自我提炼的技能)可以显着提高性能。为了探索开源启发,我们引入了 Code-X,这是一种带有 OmniCoding 轨迹数据集和可验证奖励的训练配方,并提供了 Qwen-3.5-9B 和 Qwen-3.6-27B 的基线。最后,我们认为下一个前沿是多模态处理,并引入 TerminalBench-O,它是现实世界全模态处理任务的流程级基准。代码可在 https://github.com/Dongping-Chen/OmniCoding 获取。