要点
一、「未编入索引」本身不是问题,要看原因是否符合预期。官方的目标表述是让每个重要网页的规范版本编入索引;重复页、备用页、被 robots.txt 或 noindex 有意排除的页、已删除且无替代的 404 页不编入索引属于正常。报告里「来源」一栏为「网站」的问题一般才是站点能修的,为「Google」的通常不是。
二、各状态的含义和处理办法如下。
| 状态 | 含义 | 需要处理的情况 | 可以不管的情况 |
|---|---|---|---|
| 已编入索引(网页已编入索引) | 网页已成功编入索引,可能还有结构化数据等其他问题 | 网址检查里显示增强功能问题时,按对应报告修 | 无其他问题时 |
| 已抓取,尚未编入索引 | Google 已抓取但未编入,将来可能编入也可能不编入;官方说明不需要重新提交抓取 | 官方页面未给出具体原因和修复步骤;重要网页长期停在此状态时,用网址检查对比已编入版本与实时测试,排除抓取和渲染问题 | 不重要的页、参数页、站内搜索页 |
| 已发现,尚未编入索引 | Google 知道这个网址但还没抓取,通常是预计抓取会让网站过载而推迟,所以上次抓取日期为空 | 大量重要网页积压时,查抓取统计报告里的主机状态和服务器响应 | 新页刚发布、数量少时,等待重新调度 |
| 已被 noindex 标记排除 | 抓取时遇到 noindex 指令(meta 或 HTTP 头),未编入 | 这个页本来要被收录时,删掉 noindex 后用实时测试确认,再请求编入索引 | 有意不收录的页 |
| 重复网页,用户未选定规范网页 | 该页与另一页重复且没声明规范网址,Google 选了另一页作规范,不会在搜索中展示此页 | Google 选错规范页时,显式声明规范网址;认为不重复时,让两页内容有实质差异 | Google 选的规范页正是想要的那一页 |
| 重复网页,Google 选择的规范网页与用户指定的不同 | 页面声明自己是规范页,Google 认为另一网址更合适 | 声明的规范页和当前页内容差异大时,Google 不会选它;需要让声明与内容一致 | Google 选的页可接受时 |
| 备用网页(有适当的规范标记) | 该页是 AMP、移动版或桌面版的备用版本,正确指向已编入的规范页 | 官方说明无需处理;Search Console 不识别语言版本备用页 | 默认不用管 |
| 软 404 | 返回 200 但内容像「未找到」、空白或主要内容缺失 | 页面已删除时改返回 404 或 410;已迁移时 301 到新址;页面其实正常时,用实时测试看渲染截图,查资源是否被 robots.txt 屏蔽、加载失败或过慢 | 无 |
| 未找到(404) | 返回 404,Google 通过其他页面链接或旧记录发现了它 | 官方建议只修站内自己链接到的或 sitemap 里列出的 404;页面已迁移时用 301 | 已删除且无替代的页;外站随意链接的错误网址 |
| 已被 robots.txt 屏蔽 | 抓取被 robots.txt 阻止 | 误封了要收录的页时,删掉对应规则 | 有意不让抓取的区域 |
| 网页会自动重定向 | 非规范网址跳转到别处,此网址本身不编入;目标页是否编入另看 | 目标页没被编入时,检查目标页本身的状态 | 旧网址正常 301 到新址时 |
| 重定向错误 | 重定向链过长、循环、超出网址长度上限或链中有空网址 | 修正跳转链;Googlebot 一般最多跟随 10 跳 | 无 |
| 服务器错误(5xx) | 请求时服务器返回 5xx、超时或繁忙 | 查抓取统计报告的主机可用性,查防火墙或防 DoS 设置是否拦了 Googlebot | 偶发且实时测试已正常时 |
| 401、403、其他 4xx | 要求授权、拒绝访问或其他客户端错误 | 要收录时取消授权要求,或在核实 Googlebot 身份后放行 | 本来就需要登录的页 |
三、还有两个出现在「改善网页体验」表里的警告,不影响编入索引。「已编入索引,尽管遭到 robots.txt 屏蔽」表示 Google 没抓取页面,但根据外部链接信息编入了,摘要通常很少;想阻止收录要先解除 robots.txt 屏蔽再用 noindex。「已编入索引,但网页无内容」表示 Google 读不到内容,可能是对 Google 隐藏内容或格式无法编入。
容易误解的地方
一、robots.txt 不是阻止收录的办法。被 robots.txt 屏蔽的页,Google 看不到页面上的 noindex,网址检查里「是否允许编入索引」会恒显示「是」,页面仍有很小概率被编入。要确保不收录,官方做法是放开抓取并用 noindex,或要求登录。
二、「网址已收录到 Google」只表示有资格出现在搜索结果中,不保证出现。官方建议直接在 Google 搜索该网址确认。
三、网址检查默认显示的是上次编入索引的版本,不是线上当前版本。实时测试只确认 Google-InspectionTool 能否访问并编入此页,不检查重复与规范选择、是否在 sitemap、质量和安全准则、人工处置、内容移除,所以实时测试通过也可能编入失败。规范网址只能在已编入版本的「Google 选择的规范网址」字段里看,实时测试预测不了。
四、实时测试会跟随重定向并测试最终网址,但界面不提示发生了跳转;已编入版本显示的是被检查网址本身的信息,要看重定向目标的状态,点「网页索引编制」区块里的检查按钮。
五、报告里的 404 列表只保留近一个月出现过 404 的网址。Googlebot 会在一段时间内反复尝试已知网址,频率逐渐降低,没有办法让它永久忘掉一个网址。已编入的网址改为返回 4xx 后会被移出索引;5xx 时已编入的网址先保留,持续出错最终也会被移除。
六、报告与网址检查结果不一致时,多数是修复发生在上次抓取之后。先看该网址的上次抓取日期再下结论。
七、重复请求编入索引不会让抓取变快。请求编入有配额,抓取可能需要几天到几周,也不保证收录。
怎么检查
一、单个网址的状态用网址检查工具查,网页索引编制报告不能按网址搜索或筛选。依次看「发现」(sitemap 和引荐页)、「抓取」(上次抓取时间、是否允许抓取、网页抓取结果)、「编入索引」(是否允许编入、用户声明的规范网址、Google 选择的规范网址)。
二、批量问题从报告的「网页为何未编入索引」表进入详情页,示例表最多 1,000 行,可能没有列出全部受影响网址。可以用 sitemap 筛选器只看已提交的网址,判断重要页面是否受影响。
三、修完一类问题后点「验证修复」。验证通常最多约两周,有时更久;期间不要重复点击。Google 会先检查少量网页,发现问题仍在就结束验证。某网址变得无法访问(删除、noindex、需登录)也会被视为该问题已修复,归入「其他」状态。问题最后一个实例消失 90 天后从问题表中移除。
四、已编入数量下降但错误没有同步增加时,先查是否用 robots.txt、noindex 或登录要求挡住了现有网页,再看对应时间段未编入网址是否同步上升。
五、软 404 用实时测试的「查看已测试的网页」截图确认 Google 渲染出的内容;5xx 用抓取统计报告的主机状态确认是否持续,单次实时测试成功不能排除抓取时的临时错误。
来源
- Page indexing report,https://support.google.com/webmasters/answer/7440203?hl=en(2026-10-05 核对)
- URL Inspection tool,https://support.google.com/webmasters/answer/9012289?hl=en(2026-10-05 核对)
- How HTTP status codes affect Google’s crawlers,https://developers.google.com/search/docs/crawling-indexing/http-network-errors(2026-10-05 核对)
- Troubleshoot Google Search crawling errors,https://developers.google.com/search/docs/crawling-indexing/troubleshoot-crawling-errors(2026-10-05 核对)
- Ask Google to recrawl your URLs,https://developers.google.com/search/docs/crawling-indexing/ask-google-to-recrawl(2026-10-05 核对)
