论文
FinHardBench:LLM 能否为金融计算生成延迟感知硬件?
FinHardBench: Can LLMs Generate Latency-Aware Hardware for Financial Computing?
摘要
大语言模型 能否生成不仅正确而且快速的硬件?本文研究了金融 FPGA 设计中的问题,其中 5-10 纳秒的延迟决定了竞争优势,并且设计随着协议、策略和法规的发展而不断迭代。 FinHardBench 是 33 项金融计算任务的基准测试,与反映现实世界 FPGA 迭代周期的三个实验一起呈现:根据规范生成新模块、跨 6 阶段交易管道调整系统级配置以及使现有模块适应规范变化。对 1530 多轮实验中的 6 个 LLM 进行评估,得出三个结果:(1) 模型实现了 19-61% 的功能正确性,在特定任务上时序退化高达 13.7$\times$; (2)在系统级设计空间探索中,顶级LLM以比随机搜索、模拟退火和贝叶斯优化基线更高的可靠性收敛到最优配置(在相同的24轮预算下,5/5种子与0-4/5); (3) 大多数模型的策略级规范变更仍未解决。在六个模型中,生成和 DSE 排名适度重叠:最强的代码生成器并不是最快的架构优化器,而最弱的代码生成器 (MiniMax M2.7) 仍然在 5 个种子中的 4 个上达到系统最优。在 FinHardBench 中的任务中,难度比抽象级别更紧密地跟踪训练数据模式的可用性。 FinHardBench 作为开源基准测试发布。