robots.txt 检查工具
发布 robots.txt 前,按精确 product token 与路径检查粘贴文本中的 Allow 和 Disallow 规则。
robots.txt 检查工具用浏览器内的一段规则检查逻辑处理粘贴文本。它会合并相同 product token 的多个规则组;没有精确组时才使用星号组,并显示最终命中的规则行。
浏览器本地处理
robots.txt 检查工具
User-agent: * Disallow: /preview/ User-agent: AuditBot Allow: /preview/public/
Googlebot
/preview/public/page?draft=1
规则判断
使用方法
三步完成处理
- 01
粘贴准备发布的 robots.txt 文本,保留会影响目标路径的 User-agent、Allow 和 Disallow 行。
- 02
输入一个精确 product token 和路径;粘贴完整 HTTP URL 时,工具只取路径与查询字符串参与匹配。
- 03
检查命中的行,再用一个应公开路径、一个应禁止路径和每个计划支持的 product token 重复测试。
product token 规则组如何选择?
工具对输入 token 做不区分大小写的精确比较。相同 token 出现在多个规则组时会合并这些组;只有没有精确组时才回退到星号组。因此 NotGooglebot 不会误选 Googlebot 组。
可复现的最长规则示例
如果 AuditBot 的匹配组同时含有 `Disallow: /reports/` 与 `Allow: /reports/public/`,路径 `/reports/public/q2.pdf` 会因后者更长而允许。同长度的 Allow 与 Disallow 冲突时 Allow 优先;空 Disallow 不生效,路径模式可用星号与末尾美元符。
浏览器内处理的精确边界
本工具 handler 读取输入框并在当前浏览器计算,不请求站点 robots.txt、不提交 URL,也不调用爬虫 API。页面仍可能加载常规站点资源或已配置的统计脚本,因此这不是“整页绝对零网络”承诺;不要输入密码、令牌或私钥。
错误、忽略项与上线复核
缺少可用 User-agent 组或完整 URL 无效时会报错。注释、Sitemap、Crawl-delay 等 unsupported 字段不参与判断;完整 URL 的 fragment 也不参与。矩阵通过后仍要另行核对线上文件的状态码与正文,并用服务器日志或官方工具验证真实抓取。
常见问题
关于这个工具
多个同名 User-agent 组会怎样处理?
工具会合并所有含相同精确 product token 的组,再从合并后的 Allow 和 Disallow 中选择最长匹配;不会只取第一组。
为什么输入完整 URL 后看不到 fragment?
匹配使用 pathname 与 query;井号后的 fragment 不会发送给服务器,也不进入这个规则检查。请对照输出里的“路径”确认实际测试值。
显示允许是否代表会被收录?
不代表。允许只说明所选规则没有禁止这个样例路径。页面发现、HTTP 响应、页面级指令、canonical、内容质量与外部平台策略都要另行取证。
工具为什么不检查 Sitemap 或 Crawl-delay?
本试点只实现 User-agent、Allow 与 Disallow 的路径决策。Sitemap 地址要单独检查,Crawl-delay 与其他 crawler 方言也应以目标爬虫的当前官方说明为准。
延伸阅读
相关文章
继续探索
相关工具
最后更新: