金融AI公司Samaya发布研究博客,称在其自建的金融预测框架(harness)下,最新的前沿AI模型在预测财报“意外”(实际值与分析师一致预期之差)上,首次超过人类专家分析师。文中结果均为Samaya自述。
Samaya为模型搭建了专门的金融预测环境,提供截至预测时点的金融信息。模型在财报发布前一周(财报前5个交易日),预测营收、毛利率、营业利润和调整后每股收益四项指标。
样本是7月14日起发布财报(晚于所有模型的知识截止日期)、市值超过50亿美元、有8家以上券商提供预估的456家公司,覆盖所有行业。参测的7个模型为GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5、GPT-5.6 Sol、Claude Sonnet 5、Gemini 3.8 Flash和Kimi K3。
Samaya还说明,测试中移除了网页访问,因为很难对其施加时间点门控,改为在门控后提供必要的新闻源。
Samaya称,分析师习惯在财报前下调预期,实际结果多数超过一致预期,因此原始一致预期相对容易被超越。为此他们另设了“偏差校正一致预期”:在一致预期上加上各公司历史意外的中位数(仅在为正时加)。
据Samaya称,Sonnet 5和Kimi K3等较旧、较小的模型也能跑赢原始一致预期,但只有Fable 5.1、Opus 5.5和GPT-6 Astra能跑赢偏差校正后的一致预期。
GPT-6 Astra在最多的指标上表现最好,包括营收预测误差、整体预测误差和命中率;Fable 5.1和Opus 5.5在意外相关性上最佳。
对于模型胜出的原因,Samaya查看了部分推理过程,轶事性地(anecdotally)观察到,模型收集新证据的能力和敢于偏离一致预期的意愿,是其胜出的原因。
Samaya称,其已在产品内向用户和客户提供财报预测agent的alpha版本。