网站不收录时处理重复或冲突信号,核心是让搜索引擎对“哪个网址、哪个版本、哪条指令有效”形成一致判断。先确认页面本身可抓取、可索引,再逐项排查重复内容与互相矛盾的信号;如果同一内容存在多个网址、多个 canonical、robots 与 sitemap 结论相反,收录就可能被推迟或取消。
重复信号指同一内容或高度相似内容出现在多个网址上,例如带参数与不带参数、http 与 https、带 www 与不带 www、列表页分页重复。冲突信号指同一页面上多条指令互相矛盾,例如页面允许索引但 robots.txt 禁止抓取,canonical 指向 A 而 sitemap 只提交 B,页面返回 200 但 meta robots 写 noindex。前者让搜索引擎难以选主版本,后者让它无法确定该听谁。
判断顺序建议是:先看抓取,再看索引,最后看重复与冲突。若页面根本抓不到,讨论 canonical 没有意义;若页面能抓取但未收录,才进入重复与冲突排查。
不要凭感觉猜原因。可以按下面清单收集证据,每项都记录具体网址、发现时间和判断结果:
site: 查询目标网址是否已被收录;没有结果只能说明该查询下未显示,不能单独证明未收录。<meta name="robots">,确认没有 noindex、nofollow 等限制。X-Robots-Tag,它可能与页面 meta 指令冲突。如果同一现象有多个解释,例如“页面未收录”,可能是新页面尚未被抓取,也可能是被 noindex、被 canonical 合并、被 robots.txt 阻挡,或内容与已有页面高度重复。不要在没有日志和状态码证据时断言唯一原因。
先选定一个主版本,再让其他信号向它收敛。假设同一商品页可通过 /product?id=123 和 /product/123 访问,处理方式如下:
/product/123。适用条件是重复网址确实指向相同或近似内容。若两个页面内容不同、面向不同用户,强行合并可能损失有效页面。判断结果是:主版本被抓取和展示,重复版本逐渐减少抓取或不再出现在结果中。
冲突信号往往比重复信号更隐蔽。可以按以下顺序核对:
发现冲突后,只保留一条明确指令。例如页面要收录,就确保可抓取、可索引、canonical 指向自己、sitemap 提交同一网址。页面不要收录,就用 noindex 并确保该页面允许被抓取,以便搜索引擎读到 noindex;若同时用 robots.txt 禁止抓取,noindex 可能无法生效。
修改后不要期待立即见效。可以观察这些信号:目标网址被抓取频率是否恢复,返回状态码是否稳定为 200,canonical 是否被识别为主版本,sitemap 中的网址是否逐渐出现在索引中。不同搜索引擎对 canonical、robots 指令和 sitemap 的支持与处理节奏不同,需要分别核查,不能用一个平台的结果推断另一个平台。
下一步:选一个当前未收录的具体网址,按上面的清单逐项记录抓取状态、meta robots、X-Robots-Tag、canonical、robots.txt 和 sitemap 提交值,先找出互相矛盾的那一条,再决定是合并重复版本还是修正索引指令。