上周三早上,樱桃的情报哨兵例行交了一份简报。里面有这么一条:
ChatGPT 的引用结果,与 Bing 自然排名的头部结果有 87% 的重合。
我们当时的第一反应是:终于摸到通道了。这句话的意思是——不用再猜大模型在想什么,只要把 Bing 的自然排名做上去,ChatGPT 的引用会跟着来。对一个做出海业务、拿不到高成本搜索流量的团队来说,这是一条几乎免费的杠杆。我当即把它写进了行动清单,排在 P1:Bing 排名,作为 ChatGPT 引用的杠杆。
三天后,同一份简报的头条变成了另一句话:
ChatGPT 自建索引曝光(代号 Labrador):网页、PDF、YouTube、新闻、arXiv、维基等垂直索引家族。Google 排名不再是 ChatGPT 可见度的代理,之前那个 87% 重合的判断需要修正。
于是,那条 P1 行动还没开始执行,就已经过期了。
这件事让我第一次认真想一个问题:我们做平台研究时,最危险的结论,往往是最漂亮的那个。
87% 这个数字,为什么那么有说服力
回看那条情报,它本身没有任何错误。87% 这个数字大概率是真的,测量方法也没问题——两条榜单逐一比对而已。
问题出在我们怎么解释它。
同一个 87%,至少有三种截然不同的解释:
第一种,ChatGPT 依赖 Bing。 它把 Bing 的检索结果当作回答的来源,所以两条榜单高度重合。这是我们当时默认的解释——因为它给出了一个可以动手的方向。
第二种,它们读了同一批上游。 权威站点、维基、主流新闻,这些内容本来就在所有检索系统的前列。两个学生考了同一张卷子、得了相近的分数,不代表一个抄了另一个,可能只是他们都学了同一本课本。
第三种,只是当时的重合。 检索实现是随时在改的东西。今天重合 87%,下个月换一版检索管线,可能就变成 40%。
我们犯的错,是把一个测量结果直接读成了一个因果关系,然后跳过验证,把它变成了策略。
这在统计上有个朴素的名字:观测到相关性,不等于找到了机制。但真正要命的不是这个概念,而是它在平台研究里的具体形态——当你的样本是”某个平台在某一周的某一版实现”,你其实没有样本,你只有一张快照。

更麻烦的是:机制这一层,天生不稳定
那三天里,我还看到另外几条信息。现在回头看,它们全都指向同一个方向:
- 某引擎的灰度版本切换,让一份第三方研究里的引用结构整个变了,官方随后承认某个环节没有按预期工作——一次灰度,就是一次引用大洗牌;
- 中文侧已经有引擎把精读信源压缩到 4 到 5 个,孤证不采;
- 各家发布时效的基线差异巨大,从数小时到四周不等;
- 一条关于检索结果可验证性的量化研究显示:被识别为做过优化的页面,引用占比确实在往上走,但其中相当一部分被同时标成了「低可验证性」。
把这些放在一起,会得到一个不太舒服的结论:AI 平台的”机制”不是知识,是版本状态。
你研究出来的任何一条具体规则——哪个引擎读哪个索引、引用几个信源、偏好什么格式——都带着一个隐性过期时间,而且这个时间不由你决定。
我们做营销策略的周期是季度和年;平台改实现细节的周期是周,甚至是一个发布窗口。这两个时间尺度不匹配,就意味着:任何押在具体机制上的策略,都是在赌某个版本不会变。
赌赢一次,你会以为是自己厉害;赌输一次,你连哪里错了都找不到。
后来我们换了个问法
认知修正在一次内部复盘上发生。数据师在日志里写了一句话,大意是:既然机制会变,那我们该记录的就不是「机制是什么」,而是「什么不会因为一次灰度就不成立」。
这句话把问题从体感变成了可操作的东西。我们后来把平台研究拆成了两层:
第一层,观测。 什么时间、测了什么、看到了什么。这一层只记录事实,不带解释。上面那条 87% 就属于这一层——它是真的,它只是不能拿来指导行动。
第二层,机制。 如果写的是解释,就必须同时写清楚两件事:成立的条件,以及什么信息出现会让它作废。写不出来,就说明它还不配进策略——它只是一个好听的猜测。
这条规则看起来像给自己加流程,实际效果是省钱:它让漂亮的巧合在进入预算之前,先过一次作废测试。
顺着这个思路,我们开始问另一个问题——哪些东西是不变量?
四个我认为可以押的东西
用「会不会因为某次灰度而失效」去筛一遍,剩下的大概是这四类:
一,可验证性。 这是我认为最硬的一条。一份针对 1,826 条带数字引用的审计发现,34.7% 的引用页面里根本找不到那个数字。这对任何引擎都是产品级事故——用户看到一个来源错误的答案,怀疑的不会只是那条内容,而是整个答案。所以在方向上加码可验证的内容(数据有出处、表述能被逐句核对、时间和口径写清楚),是在押一件所有引擎都必须往那边走的事。
二,多源一致。 已经有引擎明确把单条来源的权重压到很低的水平,要求同一事实有多个独立信源交叉验证。这条逻辑不需要理解任何索引实现就能成立——检索系统对孤证的不信任是天然的,跟它是哪家公司做的没关系。
三,新鲜度与结构。 光是各家发布时效基线的差异,就够我们重排一次内容刷新日历了。这两条之所以稳,是因为它们压在检索的成本结构上:结构清楚、时间新的内容,在任何一种检索实现里都更好处理。
四,合规与去硬广。 这一条来自压力,而不是偏好。中文侧已经有了明确的治理规范,点名禁止所谓「答案霸权」和「保证第一」这类表述;监管层面出现过对虚构排名的处罚案例;部分引擎开始直接给批量投放的内容打上疑似营销的标注。被打标的内容,等于被移出候选池。
四条里,没有一条像 87% 那么性感。不变量从来不性感——它们写不成标题,只能写进流程。

我们改的三件事
第一,情报结论分两层归档。 观测和机制分开写,机制条目必须附作废条件。这条规则上线三天就派上了用场——后面再出现类似高度重合的数字,我们的第一反应不再是「抓到通道了」,而是「这是不是只是两个系统都在读同一批上游」。
第二,交付指标换了一套。 不再对客户承诺排名类的说法,改成三个能验证的数:被引用的比例、引用我们内容的页面里数据能否对得上、同一事实的独立信源数。前面那个处罚案例和治理规范,让这件事从「建议」变成了「必须」。客户其实不反感这个转变——能对上数的引用,本来就比一张排名截图更像资产。
第三,把引用准确性做成了例行审计项。 既然大比例的被引页面连数字都对不上,那「你被引用了,但引错了」就是一个真实存在、而且几乎没人查过的问题。我们现在的例行动作是:把客户的核心问题在几个引擎里跑一遍,逐条比对引用来源和原文数据。第一次做的时候,我自己也没想到能查出这么多。
最后
有人可能会问:既然那个 87% 已经作废,那三天的研究是不是白做了。
我的看法是:情报作废了,方法留下了。复盘时我们发现,那次误判真正的价值不是让我们看到了某个机制,而是暴露了我们在「从数据到行动」之间少了一级——从「看起来像原因」到「可以下注」,中间必须有一道作废测试。
做 AI 可见度这件事,最难的部分不是知道今天的规则。规则是情报简报、是别人拆解出来的漂亮数字,谁都看得到。
难的是知道——哪些东西明天还是规则。
我们那张地图作废了。它教会我们的,是怎么画一张不会过期的地图:不画路,只画山。
顺便问一句:你有没有查过,AI 引用你的时候,引对了没有?我猜大多数公司的答案是——没查过。