匡醍量化|大富翁量化

利好为何不涨?AI预测财报竞赛揭秘

📅 2026-10-01 开发效率 进阶 👁 本月阅读 —

今天(9月30日)的市场走得摇曳生姿,跌宕起伏。消息面上,前夜贴息政策重磅发布,理论上利好房地产板块。但相关板块却是低开下挫,一度大跌4.35%。好在先抑后扬,最终收涨0.91%。

很显然,我们要问,为何利好反而导致低开下挫?这就是所谓的利好兑现是利空吗?

这也是量化研究一直想解决的问题。当然,A 股的政策反应与美股的财报反应并非同一机制,本文只是借用"利好为何不涨"这个问题说事儿。

今天为你介绍 Optiver 与芝加哥大学研究者(Ralph & Bradford)合作的一个平台:explainingmarkets.ai。它正在做一场面向全球参赛者的公开竞赛:参赛者构建 AI 系统,预测股票对财报公告的反应,并在真实市场结果面前接受检验。

站在主办方一侧,平台的研究者还做了一组对照实验:用 OpenAI 的 GPT-6 Luna、Sol、Astra 三个模型,测试不同数据输入能让"AI 解释财报反应"的能力提升多少。

Ralph S. J. Koijen 和 Bradford (Lynch) Levy 都来自芝加哥大学布斯商学院。竞赛基于他们合著的工作论文《Assessing the Benefits of Optimized Agentic AI Systems for Asset Pricing》提出的基准,配有一套 SDK,供研究者在实时、样本外的标准下评估 AI 系统。

芝加哥大学是全球经济学人心中的麦加,是芝加哥学派发源地,芝加哥学派深刻塑造了现代经济学面貌。

/01 老问题:业绩超预期,股价为什么还跌?

每到财报季,交易员都会遇到这样的场面:一家公司的营收、利润、下季指引全部超出分析师预期,第二天股价却下跌。

英伟达就是典型。据 Explaining Markets 的博客,在 2026 年 8 月那次财报之前,英伟达已经连续四个季度在营收、EPS 和下季指引上全部超预期,但每一次都引发次日股价都下跌,平均超预期幅度约 4.8%。

这说明股价反映的不是"好消息",而是"比预期更好的消息"。但预期到底是什么,很难量化,更难让 AI 去理解。

/02 Explaining Markets:一场面向全球的"AI 系统"竞赛

参赛流程分三步:

  1. 搭建并连接。 下载示例 Notebook,或使用官方基于 Modal 云平台的启动模板,搭好智能体并接入平台。官方称多数人 30 分钟内就能跑起来。
  2. 接收实时事件。 公司发布财报时,你的智能体会收到一份电话会议的要点摘要,并在预测截止时间前提交预测。
  3. 跟踪成绩。 每个预测都会与实际市场表现对比,成绩更新在公开排行榜上。

每个事件,智能体提交一个 0 到 1 之间的数,表示它预期这只股票的市场反应,在当季所有财报公告中处于什么百分位:0 最负面,0.5 居中,1 最正面。它考的是相对排序,而不是具体涨跌多少。每个事件以第一次有效提交为准,迟交、格式错误或越界都算漏报。漏报的事件会被主办方用你自己的平均预测补上,所以跳过并不划算。

平台用 R² 衡量预测与实际收益的吻合程度,可以理解为"预测能说明多大比例的收益差异"。排行榜对每个智能体给出三个数字:

  • 仅用"盈利超预期"的基准 R²;
  • 加上智能体预测后的完整模型 R²;
  • 两者之差 ΔR²,即预测比"只看盈利超预期"多解释了多少。

季度榜按 ΔR² 排名,奖金排名则按全部计分事件上的 ΔR² 计算。评分逻辑全部公开在示例仓库里。

任何人都可以参加,包括学生、研究者、工程师和独立开发者,不需要金融背景,会 Python 即可。没有报名费,成本主要取决于调用哪些模型、调用多频繁,官方称 Koijen 和 Levy 论文的全部预算不到 10 美元。每个账户最多提交 5 个智能体,每个智能体最多 10 名队员。

前五名分享总共 7500 美元(2500、2000、1500、1000、500 美元),由 Optiver 出资,芝加哥大学发放。

/03 参赛者比的是什么?

所有参赛者拿到的官方材料是一样的:每个事件会通过平台接口推送,带有该事件的信息包,其中核心是电话会议的要点摘要。

规则没有限定模型和工具,也不限制你自行补充数据,前提是不得使用事件"知识截止时间"(knowledge_cutoff)之后的任何信息。这条限制覆盖数据收集、提示词、检索、外部搜索、人工调研和人工调整的全过程。截止时间之后的价格、成交量、期权数据等市场信号不能用,除非是官方接口提供的。违规者没有领奖资格,还可能被公开标注或移出榜单,获奖者可能被要求提供日志、时间戳等记录,甚至接受审计。

所以差异只能来自参赛者自己的方法:怎么设计提示词和推理流程,选什么模型,补什么截止时间之前的公开数据,以及怎么处理官方材料。前视偏差是这个基准最想避免的问题,也正是规则写得这么严的原因。参赛者不需要公开代码或提示词,只需提供一份高层级的方法说明。

截至 9 月 30 日,Q3 赛季榜单前三名的完整模型 R² 为 26.5%、26.1%、26.0%,基准 R² 为 9.7%,ΔR² 分别为 0.168、0.164、0.162。该赛季计分期到 10 月 2 日才结束,这些仍是初步结果,要等资格和合规核验后才作数。

/04 实验之一:让 AI 读电话会议

除了比赛之外,主办方自己也在做数据实验,并据此决定往每一季的比赛中,增加新的数据源。这些新的数据源据信将提高参赛者模型的解释能力。

tip

某种程度上,你可以认为,通过这个竞赛,顶流基金和经济学家也给出了LLM 因子挖掘方向上他们的最新研究。建议读者不妨把这些研究用在其它竞赛上,比如 WorldQuant 排名赛上,也许可获得一些新的 Alpha。
基线是盈利超预期(Earnings Surprise),即实际业绩与分析师共识之间的差距。在最近一个财报季(2026 年第三季度),仅靠盈利超预期,R² 约为 **10%**,比之前几个季度略高,但仍有约 90% 的差异无法解释。

数字之外还有信息。主办方从电话会议中提取结构化事实,交给 OpenAI 的 Luna、Sol、Astra 三个模型,Luna 最小,Astra 最强。以英伟达为例,提取出的要点包括:

  • 第二财季营收创纪录,为 960 亿美元;
  • 下季营收指引为 1080 亿美元(±2%);
  • 毛利率因存储价格上涨而下调,第三季度约 74%,第四季度触底 71%–72%;
  • 数据中心营收 890 亿美元,环比增长 18%;
  • 中国数据中心算力收入仍不计入展望。

加入这些事实后,完整模型的 R² 从 10% 升到 21%–23%,翻了一倍多。

但主办方也指出:三个模型的成绩非常接近,推理强度从中等调到最高,对 Luna 也毫无帮助。主办方的解释是,股价只对新信息作出反应,而一条信息是否"新",取决于市场事先预期了什么。"营收 960 亿美元"本身没有好坏之分:预期 920 亿,它是大惊喜;预期 950 亿,只是小幅超出。模型只看到"960 亿",不知道预期,再聪明也难以判断。

/05 实验之二:财报前由智能体写一份研报

于是有了三季度的核心实验。2026 年第三季度,每次财报电话会之前,主办方都运行一个智能体任务:让 Claude Opus 5 在 Claude Code 环境中,运行 Anthropic 的财报预览技能(earnings preview skill)。

这个智能体只被告知公司名称、财季和发布时间,其余信息自己在公开网络上查找,产出一份标准化的前瞻研报,内容包括一致预期与公司指引、本季最关键的指标、牛/基/熊三种情景及对应的股价反应,以及市场仓位与情绪。546 个竞赛事件中,有 542 个生成了研报。

这种让 AI 写研报,然后以此作为输入的方法,也是我们可以借鉴的。以下以英伟达财报事件为例,看看AI 研报的几个核心事实和观点。

案例:英伟达财报事件

财报于 2026 年 8 月 26 日美东时间收盘后发布。研报写成时,股价约 212.51 美元,市值约 5.24 万亿美元,距 52 周高点(236.54 美元)约低 10%。

区分"卖方共识"和"买方门槛"

指标 公司指引 卖方共识 买方/耳语
营收 910 亿美元 ±2% 919–923 亿美元 940–950 亿美元
非 GAAP EPS — 2.08–2.09 美元 约 2.15 美元以上
数据中心营收 — 约 857 亿美元 高 800 亿美元档
毛利率 约 75% 约 75% ≥75%,不受 Rubin 爬坡稀释
下季营收指引 — 1038–1041 亿美元 1050 亿美元以上

这张表正是此前模型缺少的东西。研报明确写道:超过 920 亿美元只是"入场券",真正有区分度的是 950 亿美元以上。

关键博弈点

研报认为最重要的只有一个数字:下季营收指引。1050 亿美元是多头分界线,1030 亿美元是失望线。它还称,最近四次股价反应是由指引相对买方门槛的高低驱动的,而不是本季超预期的幅度。

这正好对应开头那个"连续四次超预期却下跌"的现象:超的是卖方的数字,没超过买方的。

情景与概率

情景 概率 下季指引 关键驱动 预期股价反应
牛 约 25% ≥1060–1080 亿美元 Rubin 提前、毛利率守住 75%、中国重新计入指引 +6% 至 +11%
基 约 50% 1040–1055 亿美元 常规小幅超预期,毛利率约 75% −3% 至 +3%
熊 约 25% ≤1030 亿美元 指引仅符合预期,毛利率滑向约 73.5% −8% 至 −13%

研报还写到,期权隐含波动约为 ±5.4% 至 ±5.9%(来自网络上的二手数据,与下文平台提供的官方统计不是同一来源);半导体基金三周净流出约 63 亿美元;美银牛熊指标处于 9.5 的极端位置(偏向反向看多信号),说明市场情绪并不狂热。它的结论是:期权定价的波动幅度低于牛熊两种情景,如果对尾部结果有信心,期权定价算合理。

事后对照:大致落在牛市情景内

电话会实际披露的是:营收 960 亿美元,下季指引 1080 亿美元,数据中心营收 890 亿美元。股价在反应窗口内的市场调整后收益为 +8.1%。

  • 营收 960 亿美元,落在牛市情景区间(950–970 亿美元)内,也高于买方耳语上沿。
  • 下季指引 1080 亿美元,达到牛市情景的上沿,远超 1050 亿美元的多头线。
  • 数据中心营收 890 亿美元,刚好达到牛市情景要求的 890 亿美元。
  • 股价 +8.1%,落在牛市情景预期区间(+6% 至 +11%)内。

也有两处与研报设想不符:

  • 毛利率。 研报把守住 75% 作为牛市条件,把滑向 73% 以下视为熊市信号。实际第三季度指引为 74%,第四季度还要降到 71%–72%,按研报自己的框架偏负面,但股价依然大涨。这说明市场更看重增长的量级,研报对毛利率的权重判断偏重。
  • 中国。 研报把"中国重新计入指引"列为牛市条件之一,实际并未计入,牛市结果照样出现。

**这只是一个事后挑选的案例,不能证明研报有效,有效性要看下一节的整体 R²。**研报不是一份"准确预测",而是给模型提供了一把尺子:有了"买方 950 亿美元、指引分界 1050 亿美元"这些预期数字,960 亿和 1080 亿才有了是否超预期的比较基准。

/06 主办方的验证:解释力提升到 30% 以上

有了研报作为额外上下文,主办方测试的每个模型表现都更好,排序也变得清晰:Astra 高于 Sol 高于 Luna。此前三个模型成绩接近的现象不再出现,这与博客"瓶颈在于缺少预期信息"的解释一致。

推理强度也开始发挥作用,尤其是对最小的模型:Luna 从中等强度的 24% 提高到最高强度的 29%,每 1000 个事件的成本不到 3 美元。GPT-6 Astra 在超高(xhigh)推理强度下,解释了超过 30% 的收益差异。

排行榜的正式排名看的是 ΔR²。博客里的 30% 是完整模型的 R²,对照约 10% 的基准,增量大约是 20 个百分点(这是我的换算,博客没有直接给出)。

与论文的对照。 网站首页引用的论文摘要称,最优的智能体系统把 R² 从约 8% 提高到接近 20%,那是在电话会议文本上提取信号并做优化的系统。本期博客的 30% 来自 2026 年第三季度的新数据和主办方的另一组测试。两者的样本和设置不同,不宜严格对比,也不宜与参赛榜单直接比较,但方向一致:好的上下文能显著提高解释力。

/07 下一步:加入期权市场数据

根据前面的研究,主办方将为 Q4的比赛注入新的数据:

从 2026 年 10 月 3 日起,平台会为有流动性期权的股票,附上三项来自期权市场的统计量,都在知识截止时间之前测得。研报也会从同一天起成为每个提交都会收到的数据,参赛者无需自己搭建研究流程。

  • 隐含财报波动率: 用财报后前两个到期日的平值隐含波动率,按 Dubinsky 等人(2019)的期限结构法,把财报事件的跳动与日常波动拆分。
  • 隐含绝对波动幅度: 市场预期的价格跳动幅度,只有大小,没有方向。
  • 25-delta 偏斜: 25-delta 看涨期权的隐含波动率减去看跌期权的隐含波动率(Carr 和 Wu, 2007)。为负,说明下行保护定价更高。

以英伟达为例,它在历史数据中的期权统计是:

  • 隐含财报波动率:6.36%
  • 隐含绝对波动幅度:5.07%
  • 25-delta 偏斜:−1.61 个波动率点

研报和期权统计都放在事件的 DisclosureBundle 中,通过 information_url 获取。两项都是可选项,没有就不会出现,所以代码要能优雅回退。不到一半的 Q3 事件有期权统计。这些新数据能带来多大提升,博客目前没有给出结果。

/08 结论

回到最初的问题:AI 能解释财报后股价的反应吗?

竞赛还在进行,到目前为止,仍有70%的差异无法解释。当然,理论上我们也不应该期待差异得到100%的解释。

Explaining Markets 目前给出的答案是:AI 已经能读懂一部分财报与股价的关系,而让它做到这一点的关键,不是更强的模型,而是让它知道市场事先预期了什么。

无论如何, Koijen和Levy在他们的工作论文和竞赛中,给出了新的方法。对量化人来说,受反身性影响,很少有永恒的 Alpha (但确实有,比如小市值),寻找 Alpha 的过程,就是寻找新的信息和新的加工方法的过程。