DTC 品牌营销知识库 DTCBM.COM 关注公众号

SEO · technical-seo

网址检查与网页索引编制报告的状态含义和处理

要点

一、「未编入索引」本身不是问题,要看原因是否符合预期。官方的目标表述是让每个重要网页的规范版本编入索引;重复页、备用页、被 robots.txt 或 noindex 有意排除的页、已删除且无替代的 404 页不编入索引属于正常。报告里「来源」一栏为「网站」的问题一般才是站点能修的,为「Google」的通常不是。

二、各状态的含义和处理办法如下。

状态含义需要处理的情况可以不管的情况
已编入索引(网页已编入索引)网页已成功编入索引,可能还有结构化数据等其他问题网址检查里显示增强功能问题时,按对应报告修无其他问题时
已抓取,尚未编入索引Google 已抓取但未编入,将来可能编入也可能不编入;官方说明不需要重新提交抓取官方页面未给出具体原因和修复步骤;重要网页长期停在此状态时,用网址检查对比已编入版本与实时测试,排除抓取和渲染问题不重要的页、参数页、站内搜索页
已发现,尚未编入索引Google 知道这个网址但还没抓取,通常是预计抓取会让网站过载而推迟,所以上次抓取日期为空大量重要网页积压时,查抓取统计报告里的主机状态和服务器响应新页刚发布、数量少时,等待重新调度
已被 noindex 标记排除抓取时遇到 noindex 指令(meta 或 HTTP 头),未编入这个页本来要被收录时,删掉 noindex 后用实时测试确认,再请求编入索引有意不收录的页
重复网页,用户未选定规范网页该页与另一页重复且没声明规范网址,Google 选了另一页作规范,不会在搜索中展示此页Google 选错规范页时,显式声明规范网址;认为不重复时,让两页内容有实质差异Google 选的规范页正是想要的那一页
重复网页,Google 选择的规范网页与用户指定的不同页面声明自己是规范页,Google 认为另一网址更合适声明的规范页和当前页内容差异大时,Google 不会选它;需要让声明与内容一致Google 选的页可接受时
备用网页(有适当的规范标记)该页是 AMP、移动版或桌面版的备用版本,正确指向已编入的规范页官方说明无需处理;Search Console 不识别语言版本备用页默认不用管
软 404返回 200 但内容像「未找到」、空白或主要内容缺失页面已删除时改返回 404 或 410;已迁移时 301 到新址;页面其实正常时,用实时测试看渲染截图,查资源是否被 robots.txt 屏蔽、加载失败或过慢无
未找到(404)返回 404,Google 通过其他页面链接或旧记录发现了它官方建议只修站内自己链接到的或 sitemap 里列出的 404;页面已迁移时用 301已删除且无替代的页;外站随意链接的错误网址
已被 robots.txt 屏蔽抓取被 robots.txt 阻止误封了要收录的页时,删掉对应规则有意不让抓取的区域
网页会自动重定向非规范网址跳转到别处,此网址本身不编入;目标页是否编入另看目标页没被编入时,检查目标页本身的状态旧网址正常 301 到新址时
重定向错误重定向链过长、循环、超出网址长度上限或链中有空网址修正跳转链;Googlebot 一般最多跟随 10 跳无
服务器错误(5xx)请求时服务器返回 5xx、超时或繁忙查抓取统计报告的主机可用性,查防火墙或防 DoS 设置是否拦了 Googlebot偶发且实时测试已正常时
401、403、其他 4xx要求授权、拒绝访问或其他客户端错误要收录时取消授权要求,或在核实 Googlebot 身份后放行本来就需要登录的页

三、还有两个出现在「改善网页体验」表里的警告,不影响编入索引。「已编入索引,尽管遭到 robots.txt 屏蔽」表示 Google 没抓取页面,但根据外部链接信息编入了,摘要通常很少;想阻止收录要先解除 robots.txt 屏蔽再用 noindex。「已编入索引,但网页无内容」表示 Google 读不到内容,可能是对 Google 隐藏内容或格式无法编入。

容易误解的地方

一、robots.txt 不是阻止收录的办法。被 robots.txt 屏蔽的页,Google 看不到页面上的 noindex,网址检查里「是否允许编入索引」会恒显示「是」,页面仍有很小概率被编入。要确保不收录,官方做法是放开抓取并用 noindex,或要求登录。

二、「网址已收录到 Google」只表示有资格出现在搜索结果中,不保证出现。官方建议直接在 Google 搜索该网址确认。

三、网址检查默认显示的是上次编入索引的版本,不是线上当前版本。实时测试只确认 Google-InspectionTool 能否访问并编入此页,不检查重复与规范选择、是否在 sitemap、质量和安全准则、人工处置、内容移除,所以实时测试通过也可能编入失败。规范网址只能在已编入版本的「Google 选择的规范网址」字段里看,实时测试预测不了。

四、实时测试会跟随重定向并测试最终网址,但界面不提示发生了跳转;已编入版本显示的是被检查网址本身的信息,要看重定向目标的状态,点「网页索引编制」区块里的检查按钮。

五、报告里的 404 列表只保留近一个月出现过 404 的网址。Googlebot 会在一段时间内反复尝试已知网址,频率逐渐降低,没有办法让它永久忘掉一个网址。已编入的网址改为返回 4xx 后会被移出索引;5xx 时已编入的网址先保留,持续出错最终也会被移除。

六、报告与网址检查结果不一致时,多数是修复发生在上次抓取之后。先看该网址的上次抓取日期再下结论。

七、重复请求编入索引不会让抓取变快。请求编入有配额,抓取可能需要几天到几周,也不保证收录。

怎么检查

一、单个网址的状态用网址检查工具查,网页索引编制报告不能按网址搜索或筛选。依次看「发现」(sitemap 和引荐页)、「抓取」(上次抓取时间、是否允许抓取、网页抓取结果)、「编入索引」(是否允许编入、用户声明的规范网址、Google 选择的规范网址)。

二、批量问题从报告的「网页为何未编入索引」表进入详情页,示例表最多 1,000 行,可能没有列出全部受影响网址。可以用 sitemap 筛选器只看已提交的网址,判断重要页面是否受影响。

三、修完一类问题后点「验证修复」。验证通常最多约两周,有时更久;期间不要重复点击。Google 会先检查少量网页,发现问题仍在就结束验证。某网址变得无法访问(删除、noindex、需登录)也会被视为该问题已修复,归入「其他」状态。问题最后一个实例消失 90 天后从问题表中移除。

四、已编入数量下降但错误没有同步增加时,先查是否用 robots.txt、noindex 或登录要求挡住了现有网页,再看对应时间段未编入网址是否同步上升。

五、软 404 用实时测试的「查看已测试的网页」截图确认 Google 渲染出的内容;5xx 用抓取统计报告的主机状态确认是否持续,单次实时测试成功不能排除抓取时的临时错误。

来源

公众号 DTC品牌营销 二维码扫码 / 长按识别

接入知识库

把整套已验证知识接进你自己的 AI

关注公众号「DTC品牌营销」,自动发放知识库 MCP / CLI 接入 key,让你的 AI 直接调用全部已沉淀经验,并持续接收更新。

相关内容