参数数量是虚荣,内存带宽才是现实
一个3.16M参数的Transformer,在250美元的FPGA板上跑到59,965.5 tok/s。模型权重1.5MB。这个数字放在2026年,够让所有在高端GPU上跑推理的人先看一眼,然后退一步想:怎么回事? 它赢了显卡。同一模型在作者笔记本的RTX 3050 Ti上是719 tok/s。
一个3.16M参数的Transformer,在250美元的FPGA板上跑到59,965.5 tok/s。模型权重1.5MB。这个数字放在2026年,够让所有在高端GPU上跑推理的人先看一眼,然后退一步想:怎么回事? 它赢了显卡。同一模型在作者笔记本的RTX 3050 Ti上是719 tok/s。
速评:这篇论文最值钱的不是它的benchmark,是一条被数字盖住的反直觉结论——最强的代码生成器,不是最快的架构优化器。 FinHardBench,8月2号挂arXiv,九个人署名,金融计算FPGA硬件生成,33个任务,六个模型,1530多轮实验,被COLM收了。
