论文
真实资本下链上语言模型智能体的运行层控制
Operating-Layer Controls for Onchain Language-Model Agents Under Real Capital
摘要
我们研究在真实资本下将用户指令转化为经验证的工具行动的自主语言模型智能体的可靠性。实验设定为DX Terminal Pro,一项为期21天的部署,其中3,505个由用户出资的智能体在有界的链上市场中交易真实ETH。用户通过结构化控件和自然语言策略配置金库(vault),但只有智能体可以选择常规的买入/卖出交易。该系统产生了750万次智能体调用、约30万次链上行动、约2000万美元交易量、超过5,000枚ETH的部署资金、约700亿推理token,以及针对策略合法的已提交交易99.9%的结算成功率。长时间运行的智能体累积了数千个序列决策,包括持续活跃智能体的6,000多个“提示-状态-行动”循环,形成了从用户指令到渲染提示、推理、验证、投资组合状态再到结算的大规模轨迹。可靠性并非仅来自基础模型本身,而是源自模型周围的运行层:提示编译、类型化控件、策略验证、执行防护、记忆设计和轨迹级可观测性。上线前测试暴露了纯文本基准很少度量的失败模式,包括捏造交易规则、费用瘫痪、数值锚定、节奏化交易和误读代币经济。针对性的脚手架改动将捏造卖出规则的比例从57%降至3%,将费用主导的观察从32.5%降至10%以下,并在受影响的测试人群中把资金部署率从42.9%提升到78.0%。我们表明,管理资本的智能体应当沿从用户指令到提示、经验证的行动再到结算的全路径进行评估。
