Google 搜索原理

2026年9月6日

Google 是全自动搜索引擎。结果里绝大多数 URL 不是人肉提交的,是爬虫自己转出来的。流程就三步:抓取 → 索引 → 呈现

官方说明见 Google 搜索的工作方式


抓取

Googlebot(也叫蜘蛛)按算法挑 URL,控制速度避免压垮站点。发现途径常见有:

  1. 页面上的 <a href>
  2. robots.txt(允许 / 禁止)
  3. sitemap.xml
  4. Search Console 提交
  5. RSS / Atom
  6. 301 / 302 跟着走
  7. 现代 Googlebot 会跑 JS,动态插的链接也可能被看到——但仍不如首屏 HTML 里就有稳

新站、深层级路由,只靠内链爬得慢,sitemap 更重要。


索引

抓到的文本、图、视频被分析后放进索引库。用户搜索时查的是这个库,不是实时扫全网。改完页面,同步经常要几天到几周。

抓到 ≠ 进索引。 写了下面这种,页面不会进库:

<meta name="robots" content="noindex" />
html

App Router 里等价于 metadata.robots = { index: false }。登录后、感谢页、重复筛选结果,该 noindex 就 noindex。

索引时还会看 TDK、标题层级、JSON-LD、OG、图片 alt、Core Web Vitals。质量差、和搜索意图对不上,进了库也排不上去。

会被打压的行为包括:伪装内容、门页、过期域名滥用、隐藏文字、关键词堆砌、垃圾链、机器流量、规模化空壳、滥用他人声誉等。原文:垃圾内容政策


呈现结果

Google 公开说不卖自然排名。排序综合相关性(和查询是否匹配)、权威性(域名与外链)、体验(速度、移动端)。用户语言、设备、历史也会影响同一词看到的列表。

经验数字(不是 SLA):收录常要 2–3 周,稳定排名可能要两三个月。优化的是整站,不是「锁死某一格」。


对 Next 项目的含义

  • 关键文案出现在服务端 HTML 里,别全靠客户端 useEffect 再画
  • 每篇笔记 / 文章有独立 URL 和 generateMetadata
  • 别用 noindex 误伤整站
  • 软 404(页面是 200 但写着「没有」)对索引不友好,该 notFound() 就 404

下一篇写 robots.txt


参考文档