# 我让AI分析一个网站，它到底能发现什么？

URL: https://caijiao.org/posts/199
Source: docs/posts/199.md
Description: HTML 里写明的信息、结构化数据语法它都能查，渲染后的 DOM、爬虫视角、真实流量拿不到。Omni Calculator 月访问约 1429 万，这类数字它给不出。

我拿自己的站试过很多轮，也拿别人的站试过。试到后来我把结果分成两张清单——一张是它能查出来的，一张是它一定会胡说的。分开看之后，这个工具的用法就清楚了。

边界在哪里，取决于一件事：**它需要的信息是不是已经写在 HTML 里。**

## 能查的：所有写在源码里的东西

这一类它做得相当好，好到可以省掉不少人工审计。

页面级的元信息是它的强项：title 是否缺失或重复、description 是不是空的、有没有多个 h1、canonical 指向对不对、hreflang 有没有自引用。这些都是从 HTML 里读出来的确定性事实，不存在猜测成分。

结构化数据的语法错误也很适合它查。JSON-LD 这类标记对格式要求严格，缺一个必填字段、类型名拼错、嵌套层级不对，都会导致整段标记被忽略。把一段 JSON-LD 贴给它，它能指出缺了哪个字段、哪个类型和 Google 要求的不一致。真正要用起来还是得对着规范看，[JSON-LD](/json-ld/) 里对每种类型的必填字段有完整说明，而 Google 自己的文档在 [Google Search Central](/google-search-central/) 上，两者对着查一遍比较稳妥。

还有一类是它比你快得多的：跨页面的模式识别。你把二十个页面的 HTML 丢给它，它能指出"这二十个页面的 title 只有后半段不同""这几个页面的 description 是同一句话换了关键词"。这种批量比对人做起来很痛苦，它做起来只是数数。

同样的能力也能用在内容审计上：一批页面里有没有互相重复的大段文字、有没有只换了关键词的近似页面。这类"模板痕迹"恰好是搜索引擎判断低质量内容时看的东西，自己扫一遍很有必要——不是因为算法会惩罚重复本身，而是因为这种页面通常也确实没有给用户提供额外信息。

## 查不了的：需要执行才能得到的东西

一旦页面的真实内容依赖 JavaScript 执行，它的判断就开始不可靠了。

如果你给它的是 curl 下来的原始 HTML，它看到的是渲染前的空壳。它会告诉你"这个页面没有正文内容"，而实际上浏览器里内容很丰富。这个误判很常见，也很致命——基于它给出的优化建议会完全跑偏。

判断办法：让它分析之前，先用浏览器把渲染后的 DOM 存下来再喂给它。或者更简单，直接看页面源码里有没有实质内容。客户端渲染的单页应用在这一点上天然吃亏，服务端预渲染的静态页面则完全没有这个问题。

响应头和服务器配置它也同样拿不到，除非你主动贴给它。缓存策略、压缩是否开启、HTTP/2 是否启用、证书链是否完整，这些都在 [Nginx](/nginx/) 配置里，不在 HTML 里。把配置文件贴给它倒是可以分析的——所以这类事情的正确用法是"贴配置让它审"，而不是"给它域名让它猜"。

## 一定会说错的：流量、排名、外链

这是它最危险的一块，因为它的语气和前面那些可靠结论完全一样。

它不知道任何网站的真实访问量。第三方估算工具给的数字本身就是推算值，而且不同工具之间差距很大——同一个站，一个说月访问一百万，另一个可能说三百万。拿 Omni Calculator 举例，2026 年 6 月的估算访问量约 1429 万，这个数字是估算工具给出的，不是它公布的。AI 随口报一个流量数字，来源大概率是它记忆里的某个旧估算，过期多久完全不可知。

![Omni Calculator 计算器分类页截图](/images/2026-09/omnicalculator.com.png)

*Omni Calculator 首页的 Physics 分类挂着 546 个计算器，是 Chemistry 108 个的五倍。*

关键词排名、外链数量、域名权重同理。这些数据的获取需要专门的爬虫和索引，模型没有。它给你的数字是从训练语料里回忆出来的，可能准，也可能是三年前的，还可能把两个同名站点搞混。

处理原则很简单：**凡是涉及外部数据的结论，一律当它没有，自己去看。** 它能做的是分析你给它的材料，不是替你去取材料。

## 它的价值在于"看得多"，不在于"看得深"

用下来我觉得它最划算的用法是做第一轮筛查。

一个几百页的站，人工逐个检查元信息要一整天。让它先跑一遍，把明显的问题列出来——重复 title、空 description、缺 alt、结构化数据缺字段——你拿着这份清单去核实，重点看它有没有误报。这个流程能把一天压到两小时，而且你自己核实过的结论比看报告可靠得多。

反过来，别让它做方向性判断。"这个站的内容质量怎么样""为什么这个站排名不好"这类问题，它没有能力回答，因为它看不到搜索结果页、看不到排名、看不到用户行为。它能给的答案都是从页面特征倒推的猜测，听起来有道理，但和真实原因可能毫无关系。

Google 自己在内容质量上的立场一直很清楚：AI 生成本身不违规，违规的是为了操纵排名规模化生产没有增量的内容。所以让 AI 帮你找技术问题是安全的，让它批量产出没有增量的内容则不是——这两件事的分界线值得记牢。

把这个边界记清楚之后，用法就收敛成一句话：它能替你读材料，不能替你取材料。你给它的东西越具体，它的结论越可依赖；你让它自己去找的东西，一律当作没说。

---

*Omni Calculator 访问量为第三方估算工具 2026 年 6 月数据；Google 政策表述参考其官方搜索质量指南。*
