论文
XiangqiBench闭环智能体评测
Finding the Move Is Not Winning the Game: XiangqiBench for Closed-Loop Evaluation of LLM Agents
摘要
静态评测因模型说出正确着法而给它记分,但智能体必须在对手应对下把计划贯彻到可验证结局。我们提出XiangqiBench,一个中文象棋的可执行基准:从119个由引擎或仅将军搜索支持的必杀残局出发,LLM智能体必须对引擎防御者完成将杀。交互式REPL接口区分真实着法、状态查询与向前模拟;我们记录了12个前沿LLM在两种观察协议下的8568条多轮轨迹。三个看似称职的信号都高估了闭环成功。(i)转化差距:模型在26.1%的Sighted试验中先手走出参考着法,但这些试验只有13.9%终局获胜。(ii)一致性差距:领先模型pass@3达38.7%而pass^3仅5.9%,在其曾获胜的46个局面中仅7个三局全胜。(iii)模拟差距:32.3%被接受的模拟调用终止于非法着法;在49.3%的可比情形中真实防御者的应手不同于智能体模拟的线路;自撰推演能查合法性却无法预判对手。会找着法不等于赢棋:智能体评测应给闭环结局打分并同时报告可靠性与覆盖面。