论文
TruthTensor:通过预测市场漂移和整体推理评估大语言模型人类模仿
TruthTensor: Evaluating LLMs Human Imitation through Prediction Market Drift and Holistic Reasoning
摘要
评估语言模型与 AI 智能体从根本上是困难的,因为静态基准无法捕捉真实世界的不确定性、分布漂移,以及孤立任务准确率与人类在演化条件下对齐决策之间的差距。本文提出 TruthTensor,一种新颖、可复现的评估范式,不仅把推理模型当作预测引擎,还把它们当作在植根社会、高熵环境中运行的人类模仿系统来测量。该框架建立在前瞻性、无污染任务之上,把评估锚定在实时预测市场,并结合概率评分以提供模型行为的整体视图。TruthTensor 用以漂移为中心的诊断与显式鲁棒性检查来补充传统正确性指标,以保证可复现性。它规定了人类与自动化评估的角色、标注协议与统计检验程序,以确保结果的可解释性与可复制性。在 500 多个真实市场(政治、经济、文化、技术)的实验中,TruthTensor 表明预测准确率相近的模型在校准、漂移与风险敏感度上可能差异显著,凸显了沿多个轴(准确率、校准、叙事稳定性、成本与资源效率)评估模型的必要性。TruthTensor 由此把现代评估最佳实践——清晰假设框定、审慎的指标选择、透明的算力/成本报告、人在环验证以及开放、版本化的评估契约——落地为可操作流程,以在真实世界决策情境中产生可辩护的 LLM 评估。我们已公开发布 TruthTensor:https://truthtensor.com。
