论文
BekchiAI:一键测量、观测与控制LLM智能体
BekchiAI: Measuring, Observing, and Controlling LLM Agents in One Click
摘要
大语言模型智能体能在多步骤中推理、调用工具并自主行动,但其智能体技能——正确排序工具调用、在依赖下规划、判断不可信输入、为生成的论断提供依据——难以用仅看准确率的排行榜来衡量。我们提出BekchiAI,同时应对两方面:一个衡量智能体技能的基准和一个观测与控制运行中智能体的平台。BekchiAI-Benchmark包含13个使用工具的ReAct智能体,覆盖7个任务类别(算术、结构化/SQL、安全检测、URL落地、规划、编排和工具策略),共2,057个确定性、已提交的测试任务。每个任务都可由验证器核查:金答案通过在真实数据库上运行规范SQL、计算有向无环图(DAG)的精确调度或求值闭式lambda得到,其中包括将对抗性安全样本与刻意不完善的签名扫描器配对,使分数反映模型自身的判断而非对预言答案的照抄。我们在准确率之外定义了一小组行为指标——工具调用符合度、URL幻觉与来源匹配、以及每模型token成本——并报告了四模型比较(Qwen3.7-Max、gemma-4-31B-it、gemma4:26b、gpt-oss-120b),其看点在于家族内离散度而非总体。基准运行使用所提供的评估脚本执行。BekchiAI-Platform是面向已部署智能体的补充性网页观测与控制层,提供完整的token与延迟遥测以及远程终止运行。基准、评估工具和平台均已公开发布。
