DTC 品牌营销知识库 DTCBM.COM 关注公众号

SEO · 技术SEO

技术SEO,sitemap robots canonical hreflang 渲染 速度 移动 HTTPS 重定向 重复内容 分页

技术 SEO 是优化站点让搜索引擎能发现抓取理解索引页面,对 AI 搜索同样重要,因为 AI 答案仍依赖可抓取、结构清晰、可信的网页。

robots.txt 与索引控制

  • robots.txt 控制抓取访问边界,robots meta 标签和 X-Robots-Tag 控制索引,二者用途不同,不要在同一页面上同时使用。最典型事故是被 robots.txt 阻止的页面又设 noindex,爬虫读不到指令导致 noindex 失效。
  • robots.txt 不是隐藏机制,被它屏蔽的页面仍可能因外链被索引(无说明文字),真正移除要用 noindex 或密码保护;敏感内容用密码或登录保护。
  • robots.txt 文件名为 robots.txt,放在主机根目录,支持通配符 * 和行尾匹配符 $,不要屏蔽渲染所需的 CSS/JS。
  • robots meta 标签管单个页面。noindex 禁止索引,nofollow 禁止跟随链接,二者可组合。noindex 通过 meta 标签或 HTTP 响应头表达,Google 不支持写在 robots.txt 里。
  • 被 robots.txt 屏蔽抓取的页面,其上链接不会被跟随。想阻止收录用 noindex 而非 nofollow。
  • 多个 robots 指令冲突时系统应用限制较严的那条。

规范化与 canonical

  • 规范化是出现重复或多版本内容时 Google 选一版存入索引的过程,信号包括 canonical 标签、重定向、内链、sitemap、hreflang、URL 长度等。
  • 规范化方式按信号强度递减,301/308 永久重定向和 rel=canonical 是强信号,HTTP Link 响应头适合 PDF 等非 HTML,sitemap 是弱信号。多信号一致时效果更稳。
  • canonical 是给 Google 的强提示而非指令,内容差异大时 Google 会忽略你的自选;想停止索引旧页或转移链接信号用 301 而非 canonical。
  • canonical 写法,用绝对 URL 含协议、放在 head 内(放 body 会被忽略)、用正确域、尾斜杠保持一致、每页只一个、非重复页也自指。
  • canonical 渲染时若 head 因未闭合标签或 JS 注入提前结束,标签可能被甩进 body 而失效;JS 改写 canonical 的风险详见《JavaScript 网站的抓取、渲染与索引》。
  • canonical 常见错误,一页多个 canonical、canonical 指向会重定向的 URL、把分页系列全部规范回第一页(应每页自指)、与 hreflang 冲突、内链指向非 canonical 版本、对跨域转载内容用 canonical(应让转载方用 noindex)、用相对路径、HTTP 与 HTTPS 循环互指、用 URL 片段 # 作规范、每页都规范到首页、sitemap 与 rel=canonical 与重定向三者指向不同 URL。

重复内容

  • 重复内容没有正式惩罚,但会造成不友好 URL 进搜索、外链信号分散、浪费抓取、被抓取或转载版本反超四类问题。搜索引擎把每个不同 URL 当独立页面,首页带不带 www、带不带斜杠、带 index 参数等都会产生重复版本。
  • 重复内容常见成因,分面导航、跟踪参数、会话 ID、HTTP 与 HTTPS 及 www 与非 www 未统一、大小写 URL、尾斜杠、打印版、移动版、AMP、标签分类页、附件页、分页评论、本地化、站内搜索结果页、暂存环境、电商共用厂商描述被转载。
  • 解法按情况选,参数和打印移动版用 canonical,协议和域不统一用 301,暂存环境用 HTTP 认证或 IP 白名单,站内搜索结果页用 noindex 或 robots 屏蔽,分面网址的处理详见《分面导航网址的抓取控制与抓取预算》。
  • 某重复页未被收录可能是被聚类归并到了另一页作备选,而非完全没被看见。

重定向

  • 301/308 是永久重定向,Google 把跳转目标当作规范网址的强信号,是改址的首选;302/303/307 是临时重定向,属于弱信号,Google 不把跳转目标当作规范网址的依据,搜索结果里通常仍显示原网址。永久迁移误用 302,新网址可能迟迟不被当作规范网址。
  • 服务端重定向是首选,客户端如 JS 和 meta refresh 不优选;永久用 308/301,临时用 307/302/303。
  • 断链修复三选一,改正链接、删除链接、设 301;301 用于页面已迁移或有相似替代,跳到不相关页可能被当软 404。
  • 重定向做法,HTTP 全量 301 到 HTTPS 并用 HSTS、为带外链的旧页做重定向、避免跳转链(Googlebot 一般最多跟随 10 跳)、避免循环、避免过宽规则、保留至少一年、迁移时连图片 PDF 一起重定向、整站迁移一一对应映射不要全跳首页。
  • 迁移后更新 sitemap 与内链,并在 Search Console 用地址变更工具通知。

HTTP 状态码与软 404

  • 2xx 进入索引流程但不保证收录,3xx 重定向,4xx 客户端错误,5xx 服务器错误。高价值页返回 4xx 或 5xx 要优先修。
  • 页面已删除且没有替代页时返回 404 或 410。Google 对 429 以外的 4xx 处理方式相同,404 和 410 没有区别:已编入的网址被移出索引,抓取频率逐渐下降。下架商品和软 404 的处理详见《缺货、停产和下架商品页的处理》,各索引状态含义详见《网址检查与网页索引编制报告的状态含义和处理》。
  • Googlebot 长期重复抓取 404 页是为防误删,属于正常现象。
  • 不要把所有 404 一律 301 到首页;不要让大量薄内容 URL 长期返回 200。
  • 不要用 401、403 给 Googlebot 限速,这两个状态码不影响抓取频率;需要临时降低抓取频率时返回 500、503 或 429,持续多天返回这些状态码,网址可能被移出索引。

抓取上限

  • Google 搜索的 Googlebot 只抓 HTML 等支持的文件类型的前 2MB、PDF 的前 64MB,超出部分不参与索引;CSS、JS 等资源各自单独计算。抓取基础设施的默认上限是 15MB,各产品可另设(Googlebot 文档 2026-02-03 更新)。

sitemap

  • sitemap 单文件不超过 50MB(未压缩)且不超过 50000 个 URL,超限拆分并用 sitemap 索引文件,使用 UTF-8 编码,只列完全限定的规范 URL。
  • lastmod 应反映最近实质性更新且 Google 会校验准确性,priority 和 changefreq 已被忽略。
  • sitemap 是发现与管理工具不是收录保证,不要提交重复页、参数页、错误页、不希望索引的页。网站较大、新站外链少、含大量富媒体时更需要。

国际化与 hreflang

  • 网址结构选择、hreflang 三种实现方式、写法规则、hreflang 与 canonical 的配合、按 IP 自动跳转的风险详见《多地区多语言站点与 hreflang 的做法》。
  • Ahrefs 对 374,756 个域名的 hreflang 研究显示约 67% 的实现有问题(见其 hreflang 指南,2025-03 更新)。

页面体验与速度

  • 核心网页指标的阈值、评估口径和页面体验在排名中的分量详见《核心网页指标与页面体验的官方口径》。
  • Backlinko 2019 年对 520 万个网页的速度研究显示,总页面体积与完整加载时间关系最大,轻页面比大于 3.49MB 的页面快约 486%;每加一个第三方脚本平均增加 34.1 毫秒;移动端加载时间平均比桌面端长约 87.84%。
  • 提速手段,用 CDN 降延迟、减少请求、开启 gzip 或 brotli 压缩并压缩 CSS HTML JS、压缩与响应式图片、用高性能主机、减重定向跳数、移除阻塞渲染的 JS、关键 CSS 内联非关键异步加载、启用浏览器缓存。
  • HTTP/2 通过多路复用在一条连接上并行传多个文件,浏览器上需要 HTTPS 才能启用。

移动优先索引

  • Google 用智能手机代理抓移动版用于索引和排名,移动版与桌面版的内容、title、description、结构化数据、图片 alt 要保持一致。
  • 空间受限用手风琴或标签折叠而非删除内容,不在移动版用 noindex,移动版不是桌面版的简化装饰。

HTTPS

  • HTTPS 是网页体验的一部分,Google 优先选 HTTPS 版本作规范网址。迁移避免混合内容(HTTPS 页引用 HTTP 资源),证书覆盖含 www 与非 www 的各个变体,HSTS preload 谨慎启用,难以回滚。
  • 迁移到 HTTPS 类似一次站点迁移,URL 需重新识别抓取处理,短期排名可能波动需给时间恢复,期间别用 URL 移除工具以免连带隐藏 HTTPS 版。
  • www 与非 www 对 SEO 没有影响,选定一种后用 301 统一,canonical、内链、sitemap 都用同一版本。Search Console 的首选域设置已在 2019 年取消,Google 按这些信号自己选规范版本。非 www 主域有 cookie 泄露到子域的安全隐患,跑了子域服务时优先用 www。

JavaScript 渲染

  • Google 的抓取、渲染、索引三阶段,以及 canonical、noindex、单页应用路由和软 404、链接写法等要点详见《JavaScript 网站的抓取、渲染与索引》。
  • 不是每种爬虫都能执行 JavaScript,关键内容和导航放在服务端渲染或预渲染的 HTML 里,其他 AI 爬虫也更容易读到。

分页与分面、蜘蛛陷阱

  • 分页每页用唯一 URL 如 ?page=n,第一页不要作为所有分页的 canonical,避免 URL 片段 #;Google 已不使用 rel=next/rel=prev;Googlebot 不点击按钮,不触发需用户操作的 JS。分面和排序网址的处理详见《分面导航网址的抓取控制与抓取预算》。
  • 分页归档优于无限滚动,分页让访客和引擎两三次点击就能跳到任意页,无限滚动靠 JS 加载内容。归档分页标题与 meta 重复可在标题里加页码区分。
  • 蜘蛛陷阱是系统生成无限 URL,比如分面参数组合、可一直往回翻的日期页、带搜索框的页面,会造成大量重复并占用抓取,用访问日志只看爬虫命中找重复模式来识别。
  • 解陷阱三招,robots.txt 屏蔽该段 URL、合理用 canonical、从源头不再生成无限 URL(分面用复选框比纯链接好)。

其它

  • 站点架构保持扁平,从任一页到任一页只需 3-4 次点击。提交 XML sitemap 帮搜索引擎理解站点结构是标准动作。
  • 严重 HTML 错误如未闭合或嵌套错乱的标签可能阻断渲染解析,但不影响渲染的软错误不值得花时间,W3C 校验本身不是排名因素。
  • Search Console 移除工具临时屏蔽约 6 个月,需配合永久方案(内容移除或 noindex 或密码保护);robots.txt 不会移除已索引内容;URL 规范化需覆盖大小写、参数、www 与非 www、http 与 https 各个变体。
  • 大量错误链接和死链会降低抓取效率,定期在 Search Console 查并修。

来源

公众号 DTC品牌营销 二维码扫码 / 长按识别

接入知识库

把整套已验证知识接进你自己的 AI

关注公众号「DTC品牌营销」,自动发放知识库 MCP / CLI 接入 key,让你的 AI 直接调用全部已沉淀经验,并持续接收更新。

相关内容