# 我让AI一次生成100篇文章，会发生什么？

URL: https://caijiao.org/posts/184
Source: docs/posts/184.md
Description: 前二十篇正常，三十篇之后开始套自己的模板，第八十篇出现了事实漂移。批量生成真正的代价不是单篇差，而是 Google 4.6.5 规模化内容滥用叠加 2025 年升级为整站信号的评估机制。

选题是同一个话题目录下的 100 个长尾词。我把词表、受众、字数要求丢进去，让它分十批出稿，中间不看。全部出完之后我从第一篇通读到第一百篇，发现的东西和预想的不一样。

## 前二十篇，说实话读得下去

结构有变化，举例各自不同，每篇都能找到一两个新鲜点的角度。随机抽一篇出来单看，是过得去的。

事后我才想明白原因：前二十篇里它是在消耗我给的素材。词表、受众描述、字数要求，这些信息刚好够撑起二十种不同的切入角度。

这时候我甚至在想，是不是一直在担心的问题不存在。

## 三十篇左右开始套自己的模板

从第 30 篇起，它开始复用自己在前面已经写过的段落。不是逐字复制，而是**同一套论证骨架换词再写一遍**：先铺背景，再列三条，再归纳。

到第 60 篇左右，连三条里的第一条都开始雷同——同一个比喻、同一个转折词、同一个收尾句式。

我最在意的是它开始出现交叉引用。第 55 篇里写"正如我们在前面提到过的"，然后引用了一个我从未让它写过的说法。它已经开始把自己之前的输出当成事实来源。

本质原因是它没有外部输入。一个上下文里连续写一百篇同一个话题，它能动用的素材就是自己前面写过的东西，于是自我采样，越往后越像自己。

## 第八十篇出现了事实漂移

这一条最危险。

它在那篇里给出了一个具体的数字和一个具体的产品名。我顺着查了出处，**两个对不上**。数字偏了一个量级，产品名把另一家公司的案例安了上去。

这种漂移不是随机的：AI 在长任务里会倾向于维持"确信度"这个风格，即使内容已经偏离。数量越大，人越不可能逐条核查，于是错误更容易活到上线。

## 第二次尝试：每十篇喂一次新素材

按这个思路重跑了一遍。同样的 100 个选题，但每十篇之间塞一批真实材料——一次实测记录、一组带出处的数据、一段报错日志。

效果很明显：词汇丰富度回来了，事实漂移基本消失。代价是这一轮花掉的时间，比我自己写二十篇还多。

也就是说，这条路能把质量拉回到可用，但省下的那部分时间全花在喂素材上了。

这里也必须提一句：分批生成不等于分散风险。十批生成和一次生成在结构重复这件事上没有本质区别——只要没有新输入，它会在任何批次划分下塌缩到同一套写法。

## 一百篇差文章，比一百篇好文章危险得多

这里必须讲清楚一件事，因为它和我之前的直觉相反。

风险不是"这一百篇平均分太低"。Google 的搜索质量指南里有一条叫 Scaled Content Abuse（4.6.5），针对的是**大量生产低投入、低原创性、缺乏编辑加工的内容**。它评价的方式不是给每篇打分，而是看整个模式。

这里有一层容易被忽略的东西：4.6.5 判定的是"模式"，而模式是可以从站点结构里直接读出来的——上百个页面共用同一种标题骨架、同一种段落顺序、同一种收尾句式。即使每篇的文字完全不同，结构上的重复本身就是信号。

更麻烦的是 2025 年的一次调整：整个内容质量评估已经升级为**站点级别的信号**。也就是说，判定不再局限在某一批页面，而是会拉低整个域名上其他内容的表现。

这条对我来说是整个实验里最贵的一课。一个做了几年、有很多页面正常排名的域名，可以因为新增的一批低质页面被整体拖下去。损失的不只是那一百篇。

还有一个只有栏目结构复杂的站才会踩到的坑叫 Site Reputation Abuse（4.6.4）：**借着主站的权重，塞进和主站毫不相干的第三方内容去蹭排名**。如果这个站的主题是一件事，而某个栏目讲的是完全无关的另一件事，即使那些文章单篇质量过关，结构本身就在触发这条判定。相关性是硬条件，不是加分项。

## 我最后留下了七篇

删掉九十三篇，留下的七篇是那些我确实能补充一手材料的：自己跑过的实测、手里的真实数据、踩过的具体报错。

剩下的九十三篇我全部删除，而不是设为不可索引。保留但屏蔽索引看起来更稳——万一以后还能用呢。反复权衡之后我还是删了，理由是这些页面的存在本身就构成一个模式，而构成模式的证据并不要求它们被索引。

这次之后我改了做法：一批不超过十篇，每批之间插入真实素材，写完之后我先补材料再让它成稿。数量本身没有什么意义，增量才有。这块的判定口径和申诉流程在 [Google Search Central](/google-search-central/) 的官方文档里写得很细，值得在开工前完整读一遍，而不是上线之后再补救。

至于哪些页面形态天然更容易做出增量，[在线工具集合](/tool/)里那些带实测数据的页面是挺好的参照；而页面上的脚本逻辑是否影响渲染，是 [JavaScript](/javascript/) 那一侧要单独处理的事。

---

*本文引用的政策条目来自 Google 搜索官方质量指南 4.6.4（Site Reputation Abuse）、4.6.5（Scaled Content Abuse），以及 2025 年内容质量信号升级为站点级别的公开说明。*
