# Google 搜索基础

URL: https://caijiao.org/google-search-central/01-search-basics
Source: docs/google-search-central/01-search-basics.md
Description: 介绍 Google 搜索从发现 URL、抓取页面、渲染内容、建立索引到展示搜索结果的基本流程，帮助初学者理解 SEO 的技术边界。

做 SEO 之前，先要区分几个经常混在一起的概念：页面被发现，不等于已经被抓取；页面被抓取，不等于已经被索引；页面被索引，也不等于一定会在目标关键词上获得靠前展示。

## 搜索流程

Google 搜索通常会经历以下阶段：

| 阶段 | 含义 | 站长能做什么 |
| --- | --- | --- |
| 发现 | Google 通过链接、站点地图或提交记录知道一个 URL | 提供清晰内链、XML Sitemap、规范 URL |
| 抓取 | Googlebot 请求页面资源 | 保持 200 状态、避免误封、控制重定向链 |
| 渲染 | 对需要执行 JavaScript 的页面进行渲染理解 | 确保主要内容和链接渲染后存在 |
| 索引 | 判断页面是否适合进入搜索索引 | 避免 noindex、重复内容、低质量空页 |
| 展示 | 根据查询意图、页面质量和相关性生成搜索结果 | 写清标题、摘要、正文结构和结构化数据 |

这几个阶段都可能失败。排查时不要只问“为什么没排名”，而要先确认页面是否能被发现、抓取、渲染和索引。

## Googlebot 是什么

Googlebot 是 Google 用来抓取网页的自动化程序。它会请求 HTML、CSS、JavaScript、图片等资源，并根据页面内容和站内外链接继续发现其他 URL。

常见注意点：

- 不要用 `robots.txt` 阻止页面渲染所需的 CSS 和 JavaScript。
- 重要页面应能通过普通 `<a href="...">` 链接访问。
- 服务器对 Googlebot 不应返回和普通用户明显不同的核心内容。
- 大量 5xx、超时或重定向循环会影响抓取稳定性。

## SEO 能控制什么

SEO 不能保证排名，但可以降低搜索系统理解页面的成本。

你能稳定控制的事项包括：

- 页面是否返回正确的 HTTP 状态码。
- 页面是否允许抓取和索引。
- 页面标题、描述、H1、正文和内部链接是否清楚。
- 是否提供 canonical、站点地图、结构化数据等机器可读信号。
- 页面是否快速、稳定、适合移动设备访问。

你不能直接控制的事项包括：

- 某个关键词的固定排名。
- 搜索结果摘要一定按你的 description 显示。
- 添加结构化数据后一定获得富媒体结果。
- 新页面一定在某个时间内被收录。

## 技术 SEO 与内容质量

技术 SEO 解决的是“搜索系统能不能顺利读取和理解页面”。内容质量解决的是“页面是否值得被推荐给用户”。两者缺一不可。

一个技术上合格的页面仍可能因为内容薄弱、重复、过时或缺乏可信来源而表现一般；一个内容很好的页面也可能因为被 `noindex`、canonical 指向错误、页面需要登录、渲染失败而无法获得搜索流量。

## 快速自检

- 重要页面是否能从首页或栏目页点击到？
- 页面是否返回 `200 OK`，而不是软 404、错误页或无限重定向？
- 页面源代码或渲染后 DOM 是否包含主要内容？
- 是否没有错误使用 `noindex`、`robots.txt` 或登录拦截？
- 每个重要页面是否有唯一主题、标题和正文？

## 参考资料

- [Google 搜索的工作原理](https://developers.google.com/search/docs/fundamentals/how-search-works)
- [SEO 入门指南](https://developers.google.com/search/docs/fundamentals/seo-starter-guide)
- [Google 搜索基础要求](https://developers.google.com/search/docs/essentials)
