重复页面排查,核心是找出内容高度相同或可互相替代的URL,判断它们是否都能被抓取、被索引,然后决定保留哪个、合并哪个、屏蔽哪个。交接或验收时,不要只看“有没有重复”,而要看一份可复核的清单:哪些URL成组、每组保留谁、其余如何处理、处理后用什么数据验证。
重复不是单指文字一模一样。以下情况都应按重复组处理:
准备阶段要产出一张表,字段至少包括:URL、页面标题、主体内容摘要、状态码、canonical标签值、是否可索引、内部链接来源。没有这张表,后面的判断只能凭印象。
第一步,抓取。用站点地图、服务器日志和站内爬取工具交叉获取URL列表。日志能看出哪些URL真的被访问过,站点地图能看出你希望被收录的集合,两者不一致的地方往往就是问题入口。
第二步,分组。把标题、H1、正文前若干段、主要图片地址做相似度比对。人工抽查时,可以先把标题相同的URL放在一起;标题不同但正文开头相同的,也要并入同一组。
第三步,判断。对每一组回答三个问题:
这里最关键的一步是确定保留页并让其余URL明确指向它。只删URL不处理内部链接,会让旧链接变成死链;只加canonical不改内部链接,权重和用户路径仍然分散。
处理完成后,按下面清单逐项核对:
假设一个页面同时有/product/1和/product/1?color=red两个地址,内容主体相同。若颜色参数不改变正文,可保留前者,让后者301到前者;若颜色确实改变价格或库存,则应把后者视为独立页面并补充独立标题和描述。判断依据是:参数是否带来用户可见的实质内容差异。
重复页面会随新栏目、新筛选、新活动不断产生。维护阶段可以每月做一次抽样:从日志中取访问量最高的若干URL,检查是否存在同标题或同正文的兄弟URL;每次改版、换域名、上线筛选功能后,重新跑一遍分组表。
比较处理前后效果时,要同时看抓取频次、索引状态和自然搜索进入页面的分布。搜索需求本身会波动,季节变化和采集差异也会影响数据,所以不要用单日数据判断成败,应看一段时间的趋势和URL层面的变化。
下一步:从日志中导出最近一个月被抓取过的URL,按标题和正文摘要分组,先找出标题完全相同的组,再逐组填写保留页、处理方式和验证结果。