Google 搜索原理
2026年9月6日
Google 是全自动搜索引擎。结果里绝大多数 URL 不是人肉提交的,是爬虫自己转出来的。流程就三步:抓取 → 索引 → 呈现。
官方说明见 Google 搜索的工作方式。
抓取
Googlebot(也叫蜘蛛)按算法挑 URL,控制速度避免压垮站点。发现途径常见有:
- 页面上的
<a href> robots.txt(允许 / 禁止)sitemap.xml- Search Console 提交
- RSS / Atom
- 301 / 302 跟着走
- 现代 Googlebot 会跑 JS,动态插的链接也可能被看到——但仍不如首屏 HTML 里就有稳
新站、深层级路由,只靠内链爬得慢,sitemap 更重要。
索引
抓到的文本、图、视频被分析后放进索引库。用户搜索时查的是这个库,不是实时扫全网。改完页面,同步经常要几天到几周。
抓到 ≠ 进索引。 写了下面这种,页面不会进库:
<meta name="robots" content="noindex" />
html
App Router 里等价于 metadata.robots = { index: false }。登录后、感谢页、重复筛选结果,该 noindex 就 noindex。
索引时还会看 TDK、标题层级、JSON-LD、OG、图片 alt、Core Web Vitals。质量差、和搜索意图对不上,进了库也排不上去。
会被打压的行为包括:伪装内容、门页、过期域名滥用、隐藏文字、关键词堆砌、垃圾链、机器流量、规模化空壳、滥用他人声誉等。原文:垃圾内容政策。
呈现结果
Google 公开说不卖自然排名。排序综合相关性(和查询是否匹配)、权威性(域名与外链)、体验(速度、移动端)。用户语言、设备、历史也会影响同一词看到的列表。
经验数字(不是 SLA):收录常要 2–3 周,稳定排名可能要两三个月。优化的是整站,不是「锁死某一格」。
对 Next 项目的含义
- 关键文案出现在服务端 HTML 里,别全靠客户端
useEffect再画 - 每篇笔记 / 文章有独立 URL 和
generateMetadata - 别用
noindex误伤整站 - 软 404(页面是 200 但写着「没有」)对索引不友好,该
notFound()就 404
下一篇写 robots.txt。