我让AI一次生成100篇文章,会发生什么?
选题是同一个话题目录下的 100 个长尾词。我把词表、受众、字数要求丢进去,让它分十批出稿,中间不看。全部出完之后我从第一篇通读到第一百篇,发现的东西和预想的不一样。
前二十篇,说实话读得下去
结构有变化,举例各自不同,每篇都能找到一两个新鲜点的角度。随机抽一篇出来单看,是过得去的。
事后我才想明白原因:前二十篇里它是在消耗我给的素材。词表、受众描述、字数要求,这些信息刚好够撑起二十种不同的切入角度。
这时候我甚至在想,是不是一直在担心的问题不存在。
三十篇左右开始套自己的模板
从第 30 篇起,它开始复用自己在前面已经写过的段落。不是逐字复制,而是同一套论证骨架换词再写一遍:先铺背景,再列三条,再归纳。
到第 60 篇左右,连三条里的第一条都开始雷同——同一个比喻、同一个转折词、同一个收尾句式。
我最在意的是它开始出现交叉引用。第 55 篇里写"正如我们在前面提到过的",然后引用了一个我从未让它写过的说法。它已经开始把自己之前的输出当成事实来源。
本质原因是它没有外部输入。一个上下文里连续写一百篇同一个话题,它能动用的素材就是自己前面写过的东西,于是自我采样,越往后越像自己。
第八十篇出现了事实漂移
这一条最危险。
它在那篇里给出了一个具体的数字和一个具体的产品名。我顺着查了出处,两个对不上。数字偏了一个量级,产品名把另一家公司的案例安了上去。
这种漂移不是随机的:AI 在长任务里会倾向于维持"确信度"这个风格,即使内容已经偏离。数量越大,人越不可能逐条核查,于是错误更容易活到上线。
第二次尝试:每十篇喂一次新素材
按这个思路重跑了一遍。同样的 100 个选题,但每十篇之间塞一批真实材料——一次实测记录、一组带出处的数据、一段报错日志。
效果很明显:词汇丰富度回来了,事实漂移基本消失。代价是这一轮花掉的时间,比我自己写二十篇还多。
也就是说,这条路能把质量拉回到可用,但省下的那部分时间全花在喂素材上了。
这里也必须提一句:分批生成不等于分散风险。十批生成和一次生成在结构重复这件事上没有本质区别——只要没有新输入,它会在任何批次划分下塌缩到同一套写法。
一百篇差文章,比一百篇好文章危险得多
这里必须讲清楚一件事,因为它和我之前的直觉相反。
风险不是"这一百篇平均分太低"。Google 的搜索质量指南里有一条叫 Scaled Content Abuse(4.6.5),针对的是大量生产低投入、低原创性、缺乏编辑加工的内容。它评价的方式不是给每篇打分,而是看整个模式。
这里有一层容易被忽略的东西:4.6.5 判定的是"模式",而模式是可以从站点结构里直接读出来的——上百个页面共用同一种标题骨架、同一种段落顺序、同一种收尾句式。即使每篇的文字完全不同,结构上的重复本身就是信号。
更麻烦的是 2025 年的一次调整:整个内容质量评估已经升级为站点级别的信号。也就是说,判定不再局限在某一批页面,而是会拉低整个域名上其他内容的表现。
这条对我来说是整个实验里最贵的一课。一个做了几年、有很多页面正常排名的域名,可以因为新增的一批低质页面被整体拖下去。损失的不只是那一百篇。
还有一个只有栏目结构复杂的站才会踩到的坑叫 Site Reputation Abuse(4.6.4):借着主站的权重,塞进和主站毫不相干的第三方内容去蹭排名。如果这个站的主题是一件事,而某个栏目讲的是完全无关的另一件事,即使那些文章单篇质量过关,结构本身就在触发这条判定。相关性是硬条件,不是加分项。
我最后留下了七篇
删掉九十三篇,留下的七篇是那些我确实能补充一手材料的:自己跑过的实测、手里的真实数据、踩过的具体报错。
剩下的九十三篇我全部删除,而不是设为不可索引。保留但屏蔽索引看起来更稳——万一以后还能用呢。反复权衡之后我还是删了,理由是这些页面的存在本身就构成一个模式,而构成模式的证据并不要求它们被索引。
这次之后我改了做法:一批不超过十篇,每批之间插入真实素材,写完之后我先补材料再让它成稿。数量本身没有什么意义,增量才有。这块的判定口径和申诉流程在 Google Search Central 的官方文档里写得很细,值得在开工前完整读一遍,而不是上线之后再补救。
至于哪些页面形态天然更容易做出增量,在线工具集合里那些带实测数据的页面是挺好的参照;而页面上的脚本逻辑是否影响渲染,是 JavaScript 那一侧要单独处理的事。
本文引用的政策条目来自 Google 搜索官方质量指南 4.6.4(Site Reputation Abuse)、4.6.5(Scaled Content Abuse),以及 2025 年内容质量信号升级为站点级别的公开说明。