把百度爬虫检查清单做成可复用的资产,核心不是记住更多现象,而是固定“证据采集—判断—记录—复跑”四步。推荐优先采用“分层清单”方案:先做站点级可达性,再做页面级抓取与收录状态,最后做日志与流量交叉验证。若站点规模很小、更新频率低,可以用“单页模板清单”替代,但两种方案都必须留下可对比的原始记录,否则下次排查仍要从头猜。
假设某站点改版后,百度爬虫抓取量下降。运维先发现服务器返回大量 503,于是判断是爬虫被封。这个判断可能过早:503 也可能来自源站过载、CDN 回源失败或维护窗口。此时清单应记录:异常时间段、状态码分布、User-Agent 字段、请求路径、响应耗时、robots.txt 当前内容、站点地图更新时间。把“可能原因”和“已经定位的原因”分开写,前者允许并列,后者必须有日志或抓取工具结果支撑。
常见错误是只截一张监控图就下结论,或者把 robots.txt 的抓取限制当成索引移除手段。robots.txt 只表达抓取意愿,不等于页面会从索引中消失;要移除索引,应使用对应的移除工具并确认页面状态。站点地图提交也不保证收录,它只是发现入口之一。
分层清单按“站点—目录—页面”三级组织,每级只保留能复跑的检查项。
适用条件:栏目多、模板多、改版频繁。判断结果时,若站点级正常而目录级异常,优先查模板与内链;若日志显示抓取正常但索引不更新,再查内容质量与重复问题。
单页模板清单只保留一个页面样本,把检查项压缩成可复制表格:URL、返回状态、canonical、meta robots、正文可见性、内链数量、最近抓取时间。每次排查替换 URL 即可。
第一,字段必须可对比,例如状态码用数字、时间用统一时区,不要写“正常”“有点慢”。第二,每个检查项要写明判定阈值,例如“robots.txt 返回 200 且未屏蔽目标目录”才算通过。第三,记录必须包含执行人和执行时间,便于区分环境变化与真实故障。
技术示例中,若要在清单里说明页面结构,可写成 <h2> 是否包含目标主题,而不是只检查标题标签是否存在。这样下次复跑时,判断依据仍然成立。
从站点级五项开始:robots.txt、站点地图、HTTPS 证书、首页状态码、日志中百度爬虫抓取量。连续复跑两次后,再把出现异常的目录和页面加入清单。不要一次把所有 SEO 检查项塞进去,否则清单会变成无法执行的通稿。