← 完整结果与方法 · English version · 工作论文 (PDF)
FinAgentBench 通俗版导览 —— 三天时间、约 750 美元算力额度、一套完全相同的 测试系统,以及一些让我们自己也意外的结果。
当人们问"AI 能做金融研究吗",他们其实是在问两种非常不同的能力。第一种是干活: 拿到一份研究配方和一堆原始行情数据,写好代码,算出正确的数字 —— 这是一个好研究助理做的事。第二种是判断:读一段东西 —— 一条新闻、一篇分析师文章、一份财报 —— 然后正确猜出这只股票接下来会怎样。 能赚钱的是这种能力,而它在人类当中也同样稀缺得多。
我们把两种能力分开测,并且用的是 AI 不可能背过的数据。 后面你会看到,"不可能背过"这一点正是整场博弈的胜负手。
我们写了五道难度递增的复现题 —— 从"在 20 只股票上计算一个动量策略", 一直到"复现一篇著名机器学习学术论文的核心结果,中途要训练四个模型"。 每个 AI 拿到的是:研究配方、原始数据、一个终端、一个步数预算。 打分的是一个脚本 —— 不是人,也不是另一个 AI —— 它把 AI 交上来的每一个数字与我们自己算出的标准答案逐一比对。
前四道题,基本上每个模型都拿了满分 —— 包括一个只花了千分之一美元 就做出完美复现的小型开源模型。只有第五道、学术论文规模的那道题把队伍分开了: 22 个模型中 9 个全对;其余的模型把机器学习部分训练对了, 却在组合收益核算的细节上失了手。
代价在于可靠性。同一任务重跑五次,多数模型五次全对 —— 但有几个模型偶尔会满怀信心地给出一个错误数字, 另有约 6% 的运行因为无聊的基础设施原因(各家 API 的兼容性怪癖)而失败。 如果你雇用一个 AI 研究助理,你仍然需要检查它的工作 —— 这与调查中企业部署 AI agent 的实际反馈完全一致。
这是一个应该改变你阅读每条"AI 预测股票"新闻方式的结果。 我们给模型看 1,008 个历史新闻事件(2004-2024),让它们预测每只股票之后五天的走势。 然后我们做了完全相同的测试,但把新闻藏了起来 —— 模型只能看到股票代码和日期。
最强的那个模型,藏起新闻反而预测得更好。只给它"苹果,2013 年 3 月 2 日", 它就能以惊人的准确度排出接下来发生的事 —— 因为那些年份的市场历史就在它的训练数据里。 它不是在读新闻,它是在回忆答案。同样的现象在美联储公告上更加强烈: 一个模型在完全看不到美联储声明的情况下, 以 90% 的准确率"预测"了市场对历史上历次议息会议的反应。
公平的考试是:近 300 篇发表于 2026 年 4-8 月 —— 即被测模型训练截止之后 —— 的投资研究长文。没有答案可以背。 模型读每篇文章,预测这只股票接下来 20 个交易日相对大盘的表现。
三件事很突出。第一,把文章藏起来,每个模型都退化成抛硬币 —— 所以存在的信号确实来自真正的阅读。第二,存在一个真实的能力阶梯: 便宜的小模型展现出温和但真实的能力,大型前沿模型明显更强。 第三,最新的前沿一代是一次台阶式跃迁,不是渐进式改良 —— 某个系列此前的四个版本得分挤在一条窄带内,而它的最新模型把分数翻了一倍。
我们在七种金融文本上做了同样的实验。结果的规律在经济学上非常合理, 而且高度一致:
| AI 读的文本 | 预测价值 | 原因 |
|---|---|---|
| 分析师观点长文 | 真实信号 | 解读性内容在市场中扩散得慢 |
| 知名基金季度持仓披露 | 正向(样本小) | "聪明钱"的交易在披露后仍在延续 |
| 财报新闻稿 | 无 | 硬数字在几分钟内就被定价 |
| 财报电话会全文 | 无 | 同上 —— 到第二天已全部在价格里 |
| 美联储声明 | 除记忆外无 | 宏观新闻即时定价 |
| 单条新闻标题 | 几乎没有 | 一句话太单薄 |
简而言之:AI 在信息扩散缓慢的地方创造价值 —— 观点、解读、有延迟的披露; 在市场已经反应完的地方,它什么也加不上。更糟的是:在财报文本上, 模型会顺着公告的方向外推,而市场在随后数周内均值回归 —— 一个天真的 AI 读者会系统性地买在短期顶部。
我们把"读文章"的预测转换成模拟的周度组合 —— 买入每个 AI 最看好的股票、做空它最看空的,持有一个月,再扣除交易成本。 在可用的三个月数据里,我们尝试的全部十种配置都是正收益,其中几种相当强。 预测本身也可复现:同一个模型跑两遍,预测之间的相关性约 0.9。 还有两个值得知道的细节:模型自报的信心是有信息量的 (高信心的一半大约比低信心的一半准一倍),而且它们预测的幅度 —— 不只是方向 —— 也大致标定正确。
以上的一切 —— 五场复现考试、横跨约 1,800 个标注事件的七个文本实验、 23 个模型、可靠性重跑 —— 消耗了约 750 美元的算力额度和三天时间, 由一个 AI agent 端到端编排完成(这份页面也是它写的,而它自己的错误也在过程中被打分)。 一项方法可比的人力研究 —— 25 位作者、306 位问卷受访者、 一年日历时间的那种 —— 需要六位数的预算。 两种研究都重要。但当一个关于 AI 能力的问题出现时, 仅仅是把实验跑一遍的成本已经下降了大约一千倍。 这改变了谁有资格去发现真相。