建立页面优化清单时,应把 robot txt 当作第一道检查项:先确认目标页面没有被 robots 规则误挡,再判断它是否已被索引、是否值得投入内容优化。时间和人手有限时,顺序应是“可抓取、可索引、有需求、再优化”,而不是一上来就改标题和正文。
打开站点根目录下的 robots.txt,逐条看 Disallow 与 Allow 规则。重点不是背语法,而是找出三类页面:你希望被收录却被挡的、你不想被收录却放开的、以及规则互相冲突的。
Disallow,而该栏目承担获客任务,应优先处理。这里要区分“可能原因”和“已经定位的原因”。页面没被收录,可能来自 robots 阻挡,也可能来自 noindex、内链太少、内容重复或服务器响应异常,不能只看一个文件就下结论。
抓取是搜索引擎能否取到页面;索引是取到后是否存入可展示的库;排名是索引之后在查询中的相对位置。三者混在一起,清单就会失焦。可以按下面三张卡逐页判断:
noindex、canonical 是否指向自身或正确版本、是否有足够内链。只有抓取和索引都通过,排名优化才有意义。若页面连索引都没有,先改标题通常不是最优先动作。
时间和人手有限时,用“影响面 × 修复成本”排序,而不是按页面列表从上到下改。可执行的做法是:
假设示例:某站点把 /guide/ 整目录写进 Disallow,而该目录是主要入口。此时应优先删除或收窄这条规则,再提交页面复查;如果只是挡了 /guide/?sort= 这类参数地址,优先级可以降低。这个例子只说明判断方法,不代表任何真实站点结果。
每次改动后,记录日期、改动内容、涉及页面和观察结果。复查时不要只问“收录了吗”,而要分项看:robots.txt 是否已更新、页面是否返回正常状态、canonical 是否一致、目标查询下展示的是不是该页面。
如果改动后仍未被索引,先检查是否还有 noindex、是否缺少内链、是否与已有页面高度重复。不同搜索引擎和不同产品对抓取与展示的处理并不相同,网页搜索、平台推荐和付费广告也应分开判断,不能用一个环节的结果推断全部。
下一步:从站点中挑出 10 个最重要页面,逐个填写“抓取卡、索引卡、排名卡”,把 robots.txt 误挡和 noindex 两类问题先清掉,再安排内容层面的优化。