链接抓取测试工具 – 检查页面能否被搜索引擎抓取与收录

首页 » 链接抓取测试工具

🕷️ 链接抓取测试工具

输入任意页面地址,选一个搜索引擎或 AI爬虫抓取测试,看它能否被搜索引擎抓,抓到之后会不会收录 —— 一次性把 robots.txt 规则、HTTP 响应、noindex 与 canonical 全查清

通常 3–8 秒出结果 · 会真实请求一次目标页面与 robots.txt · 结果缓存 10 分钟

📚 批量检测(最多 20 条)

每行填一个地址,逐条检测并汇总成表格。适合发布前把新站的栏目页、文章页一次性过一遍,看看哪些页面被误屏蔽、哪些被 noindex。

💡 相关工具:如果你想从「整个站点」的角度检查 robots.txt 本身写得对不对(乱码行、无效规则、Sitemap 声明、AI 爬虫策略),请使用➡️ robots.txt 检测与生成工具。本工具负责单个页面的抓取判定,两者配合使用效果最好。

这个工具能查什么

输入一个页面地址,工具会做三件事:读取该站点根目录的 robots.txt 并判断这个路径对该爬虫是允许还是禁止;用该爬虫真实的 User-Agent 去请求这个页面,拿到状态码与响应头;解析页面里的索引控制信号。最后合成一句结论 —— 能被抓取吗,能被收录吗。

检测项能看到什么
robots.txt 判定这个路径命中了哪一条 Allow / Disallow、规则写在第几行、用的是哪个 User-agent 分组,以及为什么是它胜出(最具体匹配优先、同长度 Allow 优先)
真实抓取结果以该爬虫的 UA 请求后返回的真实状态码、完整跳转链、最终地址、Content-Type、服务器标识与返回体积
爬虫被拦截检测识别 CDN / WAF 返回的「人机校验页」—— 这类页面状态码是 200,但正文是需要执行 JS 的验证脚本,爬虫读不到任何内容
索引控制信号X-Robots-Tag 响应头、meta robots 标签、canonical 规范地址是否指向自己,这三项决定页面「抓到之后要不要收录」
页面基础质量title 长度、H1 数量、meta description 有无 —— 影响页面能不能被理解、能不能拿到点击
批量体检一次最多 20 条地址,逐条检测并汇总成表格,适合发布前统一过一遍

「能抓取」和「能收录」是两件事

很多人把这两个概念混在一起,导致排查方向完全跑偏。真实的链路是四道门,缺一道都进不了搜索结果:

  1. robots.txt 决定爬虫「能不能来抓」。这是约定,主流搜索引擎都会遵守。
  2. 服务器响应 决定「抓的时候拿到了什么」。403、5xx、跳转环、人机校验页都会让这次抓取失败。
  3. noindex(来自 meta robots 或 X-Robots-Tag)决定「抓到了要不要放进索引」。这是比 robots.txt 更硬的一道门 —— 页面能被抓,但不会出现在搜索结果里。
  4. canonical 决定「这个地址的权重算给谁」。如果 canonical 指向了别的地址,收录也会归到那边去。
结论含义典型成因
可抓取 · 可收录一切正常,页面具备进入搜索结果的条件——
可抓取 · 不收录爬虫会来读,但读完后按指示不放进索引noindex、canonical 指向他处
不可抓取 · 不收录爬虫根本拿不到这个页面被 robots.txt 禁止、HTTP 4xx / 5xx、人机校验页拦截

robots.txt 是怎么判定一个网址的

规则不是「有写就生效」,而是按一套明确的优先级来判。理解这三条,就能看懂工具给出的判定依据:

  • 先选分组:robots.txt 里可以有多个 User-agent 分组。爬虫会先找与自己令牌匹配的分组,多个都匹配时取「最具体(最长)的 user-agent 值」;都没有匹配的,才退回到 User-agent: * 分组。
  • 再比具体程度:分组内所有命中该路径的 Allow / Disallow 规则一起比较,路径值最长的那条胜出。
  • 同长度 Allow 优先:如果两条规则路径一样长(比如 Allow: /abc/ 和 Disallow: /abc/),Allow 赢。

举个例子:

User-agent: *
Disallow: /blog/
Allow: /blog/public/

访问 /blog/public/x 时两条规则都命中,/blog/public/(13 个字符)比 /blog/(6 个字符)更具体,所以 允许抓取;而访问 /blog/private/x 只有 Disallow: /blog/ 命中,禁止抓取。这就是「用 Allow 给 Disallow 开例外」的标准写法。

抓取失败的 5 种常见原因

工具看到的实际发生了什么怎么办
HTTP 403服务器或安全插件直接拒绝了这次请求。如果连 Googlebot 都被拒,页面不可能被收录。在 WAF / 安全插件的白名单里放行搜索引擎 UA 与官方 IP 段
HTTP 5xx服务器端出错。持续 5xx 会让页面逐步从索引里掉出去。查服务器错误日志;修复后用本工具复测
HTTP 200 + 「人机校验页」状态码看起来正常,但正文是需要执行 JavaScript 的验证页。爬虫不执行 JS,等于什么都没拿到。在 CDN / WAF 的 Bot 管理里把该爬虫加入白名单
跳转次数过多HTTP→HTTPS、带 www→不带 www 互相跳,形成环。爬虫会放弃这次抓取。把跳转规则理顺,只保留一跳
robots.txt 里被 Disallow规则命中,爬虫主动不来抓。加一条更具体的 Allow 放宽,或删掉这条 Disallow

为什么「网站收录正常」却「AI 搜不到我」

这是近几年最容易被忽略的一类问题。传统搜索引擎的爬虫往往被 CDN 的白名单主动放行,而 AI 爬虫(OAI-SearchBot、ChatGPT-User、PerplexityBot、ClaudeBot 等)经常被同一套「防爬虫」策略一起拦下。被拦后它们拿到的是人机校验页,不执行 JS 就永远读不到内容。

后果是:你精心准备的 llms.txt、结构化数据、清晰的内容结构,在 ChatGPT 搜索和 Perplexity 那边一个字都看不到 —— 整个 GEO(生成式引擎优化)工作在这一层就断了。

用本工具把爬虫切到 OAI-SearchBot 或 PerplexityBot 测一次,如果结论是「被安全校验页拦截」,就说明问题不在内容,而在 CDN / WAF 的 Bot 管理策略上。

title、H1、description 为什么也算进来

它们不决定「能不能被抓取」,但决定「被抓取之后表现如何」。搜索引擎需要靠 title 和 H1 判断页面在讲什么,靠 description 决定搜索结果里显示哪段摘要。缺失或过长不会导致不收录,却会实打实地压低点击率。工具把它们放在优化建议一档,就是为了和「必须处理」的问题区分开。

常见问题

工具显示的结论,和搜索引擎实际行为一致吗?
robots.txt 的判定部分是确定的 —— 规范(RFC 9309)对分组选择、匹配优先级都有明确定义,本工具严格按规范实现。HTTP 抓取部分用的是各爬虫官方公布的 User-Agent 字符串,能真实反映「这个 UA 能不能拿到内容」,但不等于搜索引擎的完整抓取策略(真实爬虫还会校验 IP、有独立的抓取配额)。所以它是一份可靠的诊断参考,不是搜索引擎后台的官方数据。
为什么同一个页面,换成不同爬虫结论就不一样?
两种情况:一是 robots.txt 里给不同 User-agent 写了不同规则,判定自然不同;二是 CDN / WAF 只放行了部分爬虫 UA,导致有的爬虫能拿到内容、有的一律被拦。第二种情况正是最值得警惕的 —— 它会让你「Google 收录正常,AI 却完全读不到」。
检测结果为什么 10 分钟内不变?
为了不给目标站造成压力,同一个地址 + 同一个爬虫的结果会缓存 10 分钟。改完配置想立刻验证,点结果下方的「重新检测(跳过缓存)」即可。
批量检测里的地址有数量限制吗?
单次最多 20 条,且是逐条串行请求(不是为了慢,而是为了不给目标站造成并发压力,也让结果更稳定)。如果一次填了几百条,超出的部分会被忽略。
页面被 robots.txt 禁止了,删掉规则就能恢复收录吗?
新抓取会立刻恢复,但已经被移出索引的页面需要等下一次抓取与重新评估,通常在几天到几周不等。可以在 Google Search Console 里提交该地址请求重新抓取,加快这个过程。
工具目录 返回工具资源目录

链接抓取测试工具 - 检查页面能否被搜索引擎抓取与收录
WordPress外贸建站服务
WordPress网站维护服务(长期托管)
WordPress网站维护服务(长期托管)
链接抓取测试工具 - 检查页面能否被搜索引擎抓取与收录
免费WordPress外贸建站课程

客服微信 客服微信
客服微信
公众号 公众号
公众号
内容搜索 内容搜索
内容搜索
您好,有什么可以帮您? 请问有什么想了解的吗?
🤖AI客服 7*24小时在线为您服务
尊贵的VIP客户: -

Contact Us

Contact Image