处理404notfound相关的重复或冲突信号,核心不是把所有404都改成301,而是先判断哪些404是正常消失、哪些是错误配置、哪些与已有页面争夺同一批URL。时间和人手有限时,优先检查重复URL的产生方式,再决定保留、重定向还是返回410。下面是一份可以直接执行的清单。
要查的是:服务器对不存在页面返回的状态码,以及页面上是否仍显示正常内容。
怎么查:用浏览器开发者工具的网络面板,或命令行工具请求一个已知不存在的URL,观察响应状态。若返回200但内容是空模板或“未找到”提示,就是软404。
结果说明什么:真实404可以按业务判断处理;软404会让搜索引擎把无效页面当正常页面抓取,属于冲突信号,应先修正为404或410。
要查的是:同一内容是否存在带参数、带大小写、带斜杠、带www与不带www等多个可访问版本。
怎么查:从站内搜索、分页、筛选参数、外链和站点地图中抽取样本URL,逐个请求并对比返回内容与状态码。重点看是否都返回200。
结果说明什么:多个URL返回相同内容且没有规范化信号,会形成重复。此时优先保留一个主URL,其余用301指向主URL,或在页面中设置rel=canonical。canonical是提示而非强制指令,不同搜索引擎处理方式需要分别核查。
要查的是:被屏蔽抓取的URL是否仍出现在站点地图中,已删除页面是否仍被站点地图引用。
怎么查:打开robots.txt逐条核对Disallow规则,再把站点地图中的URL与当前可访问URL做比对。
结果说明什么:robots.txt的抓取限制不等于可靠的索引移除,被屏蔽的URL仍可能因外链出现在结果中。站点地图不保证收录,把404或已屏蔽URL放进站点地图只会增加冲突信号。应把站点地图限制为返回200且希望被收录的规范URL。
要查的是:每个404URL是否有外链、是否有搜索流量、是否对应已迁移的新页面。
怎么查:从服务器日志、外链工具和搜索表现报告中筛出有信号输入的404URL,按“有外链且有替代页”“有外链但无替代页”“无外链无流量”三类归档。
结果说明什么:
假设一个旧产品页被删除,但仍有外部链接指向它,而站内已有同类新产品页,此时301到新产品页是合理选择;若没有任何替代内容,301到首页会被视为软404,效果不如直接返回404或410。
要查的是:重定向链是否过长、是否形成循环、canonical与301是否指向同一URL。
怎么查:对修改过的URL逐一请求,记录每一跳的状态码和最终地址。检查最终页面返回200,且canonical指向自身或同一规范URL。
结果说明什么:出现301到301到301的长链会消耗抓取资源;canonical指向A而301指向B,会制造新的冲突信号。修正后应保证一个URL只有一种明确归宿。
下一步:从服务器日志中导出最近一周返回404的URL列表,按上述五步逐项标注处理方式,先处理有外链且有替代页的部分。