论文

单文件测试:通过社交影响力跟踪对首次输出 LLM Web 生成进行纵向公共界面评估

The Single-File Test: A Longitudinal Public-Interface Evaluation of First-Output LLM Web Generation with Social Reach Tracking

模型评测模型能力评测

摘要

本文对 2025 年 12 月 10 日至 2026 年 2 月 4 日期间“HTML AI Battle”项目中 17 个公共实验中收集的 68 个单文件 HTML 生成进行了为期八周的观察比较。四个推理模型系列 GPT、Gemini、Grok 和 Claude 在固定的公共接口协议下进行了比较,没有自定义指令、没有个性调整、没有修复提示。每个输出都使用人工评分和 Gemini LLM 作为评审层从渲染的浏览器视频中进行评估,以确保及时遵守、功能正确性和 UI 质量,然后打包到涵盖 X (Twitter)、TikTok 和 YouTube 的标准化社交媒体协议中。该跟踪器还用于两项监督预测分析:24 小时 X 印象的实验级模型和 HTML 详细程度的生成级模型。根据该协议,克劳德是最强大、最稳定的家族,平均表现领先,并在主要人类加权分数下赢得 9/17 的提示。较长的测量推理时间与较高的整体质量无关。双子座作为评判者在功能正确性和整体表现方面明显比人类评估者更加宽容,而稳定的自我偏爱偏差仍未解决。探索性 X 印象模型在屏幕后交叉验证下仍然很弱(MAE = 46,874,R^2 = -0.377),而 HTML 线模型表现更好,仅模型系列基线优于提示感知替代方案(MAE = 135.2,R^2 = 0.576)。总体而言,选定的出版前技术/音频变量不足以预测 24 小时 X 覆盖范围,而代码冗长更多地是由模型系列驱动的,而不是由提示措辞驱动的。这些比较仍然是观察性的,并受到公共界面漂移、访问路径差异和一名主要人类评分员的限制。