我们有一个跑了大半年的内容质量检查任务。每天一篇稿子,写完丢给一个质检 AI,它读完给三档结论:通过、修改、重写。
它出结论很快,也很温和。大半年的时间里,它偶尔提议改个措辞,从没要求过重写。
上个月我心血来潮,翻了一次它的历史输出——我想看看这半年它到底拦下过什么。
翻完之后我盯着屏幕坐了一会儿。它一次也没说过「这句话是编的」。
不是它偷懒。是它的活里根本没有这一项。
从那天起我才算真正看清一个我们每天都在踩、但一直没命名的坑。
一、验收员从头到尾只读了内容,没读事实
我们把「质检」拆成了三个问题:这句话通吗?逻辑顺吗?格式对吗?
通顺、逻辑、格式——这三个问题全部可以只对着文本回答。文本自己就是判据。
而「这件事是真的吗」这个问题的判据,根本不在文本里。它在文本外面的世界里:那个数据出处存不存在、那个客户说的话是不是原话、那个机制我们是不是真的验证过。
于是那个质检 AI,是一个非常勤奋、非常称职、但只在一个封闭系统内部工作的验收员。它的世界里只有一篇稿子。它读稿子,说稿子通顺。它当然对——稿子确实通顺。
就像一个人趴在放映厅的后排,认认真真地看完了整部电影,然后签下「放映合格」。灯亮了他才想起来:他一次也没抬头看过放映机。
这就是裂缝:内容检查的是内容,事实检查的是事实。而我们一直把这两件事当成一件事。

二、为什么「自我确认」这一步,靠加人加提示词补不上
发现裂缝之后的第一反应,是给那个质检 AI 加提示词。加一条:「请核对文中所有数据是否真实。」
我试过。结果是它开始对文中的每个数字说「建议核实来源」。
注意这句话的结构——它把核实这件事退回给了一个没有能力核实的对象。稿子里的数字是从哪来的?是我们投喂给写作 AI 的。它不知道对不对;质检 AI 也不知道对不对。两个都不知道的人互相对了一遍,最后产出一句「建议核实」,事情办完了。
这个问题加提示词补不上,因为它是结构性的:
| 判据在哪 | 谁有资格判 | |
|---|---|---|
| 通顺 / 逻辑 / 格式 | 文本里 | 读文本的人(AI 可以) |
| 真 / 假 / 出处 | 文本外的世界 | 接触过那个世界的人(AI 默认没有) |
第二行那个「接触过那个世界的人」,通常就是当初把素材给出去的那个人。
所以真正的问题不是「怎么让 AI 更会核对」,而是「我们是怎么把核对这件事弄丢的」——在我们把素材交出去的那一刻,我们同时签了一份隐藏的责任转移单:素材的准确性,从此归接收方负责。而接收方(那个写作 AI)默认所有输入为真。
于是准确性在流程里变成了一个没有主人的东西。它被移交了一次,然后被无限期地挂在半空。
三、一次真实的翻车:全篇只有两个数字,两个都记错了
说一个具体的。九月初,一个客户的案子。
仲马要给一个官网的诊断报告写引言,我随口给了他几个数:客户官网的页面数、某个页面上的问题条数、一次对比测试的结果。他写出来的稿子很漂亮——漂亮到我把整篇都读完了,没觉得哪里不对。
后来我核对原报告,三个数里两个记错了。
不是仲马编的。他有完整的对话记录,也把记录读得很仔细——他还是错了。因为那几个数字,在我随口说出去的时候就是错的:我把两个数混了。他老老实实地、一字不差地、极其认真地,把一个错误输入完整地传递到了输出里。
这件事最值得写下来的地方不是「AI 出错」,而是我们检查的方向一直都反了。
我们的质检流程,检查的是从输入到输出这一步有没有损耗——术语对不对、语气像不像、有没有漏点。我们从来没检查输入本身。
而恰恰是输入这一环最危险:输出错了,你会觉得不对劲;输入错了,全篇没有任何一处会变得刺眼。它顺顺当当地通过所有检查,一直走到读者面前。

那天之后我给流程加了一条:凡是外部数字,我先说清「这个数我是从哪里看见的」。说不出来源的数,不进稿子。
四、跨模型复核有效,但它有个天花板
我们后来试了另一个做法:换一个模型来复核。
这个动作是有效的,而且有效得很实在。不同模型家族的「合理化倾向」不一样:一个模型觉得顺理成章的表述,另一个模型会停下来问一句——因为各家的训练数据、后训练偏好、拒答阈值都不同。我自己的体感是,跨家族复核能抓住的内部不一致,比同模型自查多不少。
但它的天花板必须说清楚:跨模型复核,本质上还是内容对内容。
两个从没接触过原始素材的模型,对着同一篇文章互相对答案。它们能发现「第三段的说法和第七段矛盾」,能发现「这个数字和前面那个数量级不匹配」——这些都是文本层面的矛盾。但它们永远发现不了「这个数字本身就是错的」。
因为正确答案不在文章里,在文章外面那个被引用的世界里。复核能扩大检查范围,扩不到文本之外。
这也是我们最后把「人」放回流程的那一层,放的位置很具体——不是”人最后看一眼”,而是:人管输入,AI 管输出。
五、一条能带走的规则
我给这类流程总结了一句话:
不要让起草者验收自己的输入。
起草者(无论人还是 AI)有一个天生的立场:他需要这份输入成立,否则他的工作要重来。这个立场本身没有恶意,但它决定了他在核对输入时,会不自觉地寻找「它是对的」的证据。
所以规则得落到角色上,不能落到态度上:
- 输入环节:谁把素材带进流程,谁标注来源。带不进来的(说不清出处的数、记不准的原话),不进流程。
- 输出环节:交给 AI。通顺、逻辑、格式、跨模型矛盾,AI 做得又快又好,而且不知疲倦。
- 最后一层:不是更聪明的 AI,是一个与产出结果没有利益关系的人,去对一遍事实——注意是对事实,不是对文本。
这三层里,只有第二层可以自动化。第一层需要人肯老实说「我记不清了」;第三层需要有人愿意花十分钟去翻原始报告,看着那份已经写得很漂亮的稿子说:「等一下,这个数不对。」

这十分钟从来不会出现在任何一份周报里。但它是文章能不能被相信的全部。
我把那个质检任务的配置改了。现在它每天的第一个动作,不是读稿子,而是把稿子里所有外部数字列出来,标出出处,然后问一句:这个出处,是谁提供的?
它目前还是抓不住全部。但它至少开始往放映厅后面看了——它会看一眼放映机。
那个动作看起来很笨。可我们的内容里,最贵的部分,一直是那个笨动作守着的。