死链检测工具怎样取得可复查的状态证据

📍 WDQWDWQD987AAAAA:216.73.216.133
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /76cf3831996b.html
📄

死链检测工具怎样取得可复查的状态证据

可复查的状态证据,指的是任何人拿到你保存的原始响应,都能独立判断某个URL当时是404、410、超时还是被拦截,而不是只看到一句“检测到死链”。做法是:让工具输出每一条URL的HTTP状态码、请求时间、最终跳转地址和响应头摘要,把原始结果按批次保存,再对可疑项做第二次独立请求。只截图或只导出“错误数量”,都不算可复查。

先确认工具输出里必须有的四个字段

无论用命令行工具、爬虫软件还是在线检测服务,合格的导出结果至少应包含:

如果工具只给出“失效链接:37个”这类汇总,没有逐条明细,就不具备复查基础。此时应换用能导出CSV或JSON的方式,或者用命令行工具自行抓取状态码。

用两次独立请求区分“真失效”和“临时异常”

单次检测结果可能是网络抖动、目标站限流或CDN节点问题,不能直接判定为死链。可行的判断方法是:

  1. 第一次用检测工具批量跑完整站,保存原始导出文件。
  2. 把状态码为404、410之外的异常项(超时、403、429、5xx)单独列出来。
  3. 间隔一段时间后,对这些异常项做第二次请求,最好换一个网络出口或工具。
  4. 两次结果一致且为404或410,才作为优先处理对象;两次结果不一致,标记为“待观察”,不急着改链接。

适用条件:站点规模不大、人手有限时,优先处理两次都确认失效的链接,能避免把时间花在临时故障上。判断结果:两次都是410,说明对方明确表示资源已移除,应尽快替换或删除入口;两次都是404但对方站点正常,说明路径已变,可尝试查找新地址。

保存证据时保留原始响应,而不只是结论

可复查的关键在于保留“原料”。建议每次检测建立一个独立目录,存放:

注意:HEAD请求和GET请求返回的状态码偶尔不同,部分服务器对HEAD处理不规范。如果两次结果矛盾,以GET请求为准,并在记录中注明。这一步能解释“为什么工具说404,浏览器却能打开”之类的分歧。

把状态证据和抓取规则分开核对

检测结果异常时,先排除自身配置造成的假死链:

不同搜索引擎对410和404的处理并不一致,需要分别核查各自站长平台的抓取与索引报告,不能用一个平台的结论推断另一个平台。

按影响面排优先级,先处理这三类

时间和人手有限时,按以下顺序处理可复查证据支持的失效项:

  1. 有内部链接指向、且曾带来访问的404或410页面。
  2. 出现在导航、栏目页或站点地图中的失效URL。
  3. 被外部引用、但已确认410的地址。

判断依据是链接位置和引用来源,而不是失效数量本身。一个位于主导航的404,影响通常大于几十个无人引用的旧页面。处理完成后,对修改过的URL再做一次检测,把新的状态码追加到同一份记录中,形成前后对照。

下一步:选一个能导出逐条状态码的工具,对全站跑一次并保存原始文件,然后只挑出两次请求结果一致的404和410,按上面的顺序开始处理。

图1 图2

nginx