AI能够检索海量公开资料,但那些还没有被录入任何文档里的信息,它是挖不出来的。
让一个分析师两周读完300份财报,大概率会直接扛不住。换成AI来做这项工作,十几分钟就能全部跑完,还能顺带标出内容里的交叉引用、矛盾描述和异常数据,这确实是实打实的能力。现在Bloomberg终端搭载的AI工具,已经支持用自然语言,在几万份企业文档里检索“管理层在解释毛利率下滑时存在哪些前后矛盾的说法”,并且输出附带原文引用的摘要。投研平台的AI助手,能依靠自然语言指令独立完成上市公司尽职调查,整合路演记录、研报与财务数据,剩下最终判断的工作交给人就行。这类工作过去一名初级分析师要连续干上好几天,现在交给机器就能处理。

不过这里有一条很容易被大家忽略的边界。
AI的底层依托统计模型。梯度下降的作用,就是强化高概率的关联关系,同时抹平低频、冲突、少见的信号。换句话说,一类模式在训练数据里出现次数越少,AI就越容易把它当成噪声忽略。而市场里那些还没有被定价的信息,恰恰就藏在这类低频信息之中。主流叙事没有覆盖到的结构性变化、尚未形成共识的早期趋势、从未发生过的范式转变,这些内容在历史数据里出现频率极低,甚至完全不存在。无论模型规模多大,对于从未出现过的模式,它没办法从训练数据里归纳生成。AI擅长把已经存在的已知模式重新组合,没办法发现全新的未知模式。
生命科学领域有个很形象的说法,他们把没有录入任何公开数据库的信息称作“暗物质”。PubMed拥有3600多万条文献引用,ClinicalTrials.gov收录几十万项研究,GenBank存放数十亿条基因序列,看上去几乎覆盖了全部相关内容。但这些都只是研究者选择对外发表的结论。真正影响商业决策的资料,比如2019年面向400名病理实验室负责人的调查问卷、两年前用来挖掘未被满足需求的KOL访谈记录、长达十年的竞品情报跟踪材料,都分散在PDF、演示文稿和共享硬盘内,从来没有录入公开数据库。AI只能读取别人选择公开的内容,看不到支撑对方做出判断的底层信息。
由此会引出一个很现实的问题:当所有人都可以借助AI快速整理公开信息,这项能力本身就不再构成竞争优势。
68%的对冲基金已经在用AI开展市场分析、搭建交易策略,但只有26%的机构从中拿到可量化的收益。差距不在于算法本身,而是喂给模型的数据。当所有人都让模型读取同一批财报、新闻、SEC文件,信息差就会消失,公开数据变成普通商品。一旦一份数据集大范围流通,它能带来的超额收益就会持续衰减。学术研究多次验证这个结论:大约一半已经发表出来的市场异象,在论文公开之后就不复存在。
贝莱德自己做过一组对照测试,他们自研模型预测财报发布后的股价走向,准确率达到61.3%;而GPT-4这类公开大模型的准确率区间在49.7%到54.9%,两者相差接近十个百分点。差距不是模型智能程度,而是底层的数据架构不一样。一边是所有人都能获取的公开文本,另一边是机构独有的内部资料。
说到底AI能做什么?它只是把散落各处、本身就存在的信息整合起来,把原本需要人花三天读完的材料压缩到三分钟看完。这项能力有价值,但价值体现在节省时间,并不是拥有预知未来的能力。哪怕一份AI生成的行业报告引用四十个信源,覆盖三十个主题,它能输出的依旧只是公开世界里已经存在的内容。像还没敲定的合同、未对外发布的渠道调研、供应链上正在发生的细微持续性异常,这类信息AI无法获知。
有人会觉得,只要把私有数据喂给AI就能解决问题。方向没错,但“投喂数据”这件事远比想象的麻烦。私有数据的痛点从来不是数量不足,而是格式杂乱。2017年的一份定制市场研究,采用的研究方法和现在的标准不匹配;三年前专家访谈笔记格式五花八门,一部分是录音文件,一部分存放在邮件;客户项目资料带有保密要求,从一开始就不是为整体检索设计的。想要让AI读取并利用这些资料,必须先完成繁琐的数据标准化工作,而这件事AI没办法独立完成。
能够拉开差距的机构,并不会单纯让AI读取更多公开资料,而是让AI读懂只有自家才掌握的内部资料。公开信息只是地基,地基之上能搭建怎样的成果,取决于你手里掌握哪些别人拿不到的素材。AI接手了信息整理这类体力工作,但判断的工作依旧要依靠人。它能告诉你消费者信心下滑、库存堆积、毛利率收窄,却解释不了背后的缘由。为什么这一季度和下一季度下滑的逻辑不一样,同样的库存数值,放在两种不同渠道结构下含义完全相反,这些都需要和产业链人员沟通,依靠对市场情绪的感知,以及从长期数据里沉淀出来的直觉。
总的来说AI是效率极高的整理工具。你把一堆杂乱的文档交给它,它能以极快速度完成分类、建立索引、标记矛盾点。但那些还没有录入系统、放在屋子外面的资料箱,它看不见。而市场里价值最高的信息,往往就放在这些箱子里。
