用死链工具取得可复查的状态证据,核心是让每一次检测都能被第三方按同样的输入、同样的规则重新跑一遍,并得到可对照的输出。具体做法是:固定待检URL清单和检测时间,记录每个URL的HTTP状态码、重定向链、检测来源IP或User-Agent,再把原始响应头和抓取日志一起存档。只截一张“404数量”的汇总图不算证据,因为它无法回答“哪个URL、什么时候、由谁、用什么方式测出来的”。
“可复查”意味着别人能沿着你的记录复现结论。因此要先写清楚待证命题,常见有三类:某URL当前返回404或410;某URL经过跳转后落到无效目标;某批链接在站内被引用但目标已失效。命题不同,需要的证据字段也不同。
如果只想知道“站内有没有坏链”,用爬虫型死链工具扫描全站即可;如果要向他人证明某个具体链接确实失效,手动请求加存档更可靠。两者代价不同:全站扫描覆盖广但结果随时间变化,单URL核验范围窄但证据链完整。
无论用哪类死链工具,建议把以下字段固定成一张表,逐条填写而不是只留汇总:
Location、Content-Type、X-Robots-Tag。把这些字段导出为CSV或表格文件,和原始响应文本一起保存。复查者只要在相近条件下重跑,就能判断结论是否仍然成立。若结果不一致,先核对出口网络和User-Agent,再判断是链接真的恢复了,还是检测条件变了。
不依赖任何平台界面时,可以用命令行留下原始记录。下面命令只作示例,实际字段以你所用工具的输出为准:
curl -sSIL --max-redirs 10 "https://example.com/old-page" > check-20250101.txt
-I只取响应头,-L跟随跳转,--max-redirs限制跳转层数避免死循环。输出重定向到文件后,文件本身就带时间戳和完整跳转记录。复查时用同样命令再跑一次,对比两个文件的差异即可。注意:-I发的是HEAD请求,部分服务器对HEAD和GET返回不同状态,若怀疑这一点,改用-o /dev/null -w "%{http_code}"发GET请求核对。
拿到检测结果后,用下面几条快速判断能不能算“可复查”:
如果任何一条是否定的,证据就只能作为线索,不能作为结论。特别是当汇总数字来自不同时间、不同工具的多次扫描时,数字之间不可直接比较。
第一,把robots.txt的抓取限制当成索引移除证据。robots.txt只约束爬虫抓取行为,不等于页面已从索引中删除,两者需要分别核查。第二,把站点地图当作收录保证。提交站点地图只表示告知,不保证收录。第三,看到HTTPS就认为链接安全或排名有保障,证书有效性与链接是否失效是两回事。第四,用单一搜索引擎的结果推断所有搜索引擎,不同搜索引擎对同一URL的处理可能不同,需要分别核查。
适用条件上,命令行方式适合少量、需要精确证据的URL;爬虫型死链工具适合大批量发现线索,但结论仍需抽样复核。两者结合,先用工具扫出候选,再对关键URL做单条存档,代价和可靠性比较平衡。
下一步:挑出你当前最需要证明的一个失效URL,按上面的字段表做一次单URL检测并存档,再决定是否需要扩大到全站扫描。