论文

BekchiAI:一键测量、观测与控制LLM智能体

BekchiAI: Measuring, Observing, and Controlling LLM Agents in One Click

智能体系统Agent任务评测

摘要

大语言模型智能体能在多步骤中推理、调用工具并自主行动,但其智能体技能——正确排序工具调用、在依赖下规划、判断不可信输入、为生成的论断提供依据——难以用仅看准确率的排行榜来衡量。我们提出BekchiAI,同时应对两方面:一个衡量智能体技能的基准和一个观测与控制运行中智能体的平台。BekchiAI-Benchmark包含13个使用工具的ReAct智能体,覆盖7个任务类别(算术、结构化/SQL、安全检测、URL落地、规划、编排和工具策略),共2,057个确定性、已提交的测试任务。每个任务都可由验证器核查:金答案通过在真实数据库上运行规范SQL、计算有向无环图(DAG)的精确调度或求值闭式lambda得到,其中包括将对抗性安全样本与刻意不完善的签名扫描器配对,使分数反映模型自身的判断而非对预言答案的照抄。我们在准确率之外定义了一小组行为指标——工具调用符合度、URL幻觉与来源匹配、以及每模型token成本——并报告了四模型比较(Qwen3.7-Max、gemma-4-31B-it、gemma4:26b、gpt-oss-120b),其看点在于家族内离散度而非总体。基准运行使用所提供的评估脚本执行。BekchiAI-Platform是面向已部署智能体的补充性网页观测与控制层,提供完整的token与延迟遥测以及远程终止运行。基准、评估工具和平台均已公开发布。

BekchiAI:一键测量、观测与控制LLM智能体:论文配图
图1:四个模型按任务类别的零样本准确率——每个类别一根轴(即表 4 中该类别各任务族的任务加权均值;半径 == 在 [0,1][0,1] 上的成功率)。多边形展现了各模型的画像:gpt-oss-120b(红色)在结构化(0.240.24)、规划(0.570.57)和工具策略(0.620.62)类别上塌陷,但在 url-grounding(0.830.83)上达到最远,而其余三个模型勾勒出大体相似的高包络——这是单一总分无法传达的形状。