robots.txt生成器
robots.txt 生成器
工具简介
robots.txt 生成工具帮助网站管理员快速生成符合 RFC 9309 标准的 robots.txt 文件。robots.txt 是用在网站根目录的文本文件,告诉搜索引擎爬虫哪些路径可以抓取、哪些不能抓取。工具提供可视化配置:添加 User-agent(如 Googlebot/Bingbot/Baiduspider/* 通用规则)、设置 Allow/Disallow 路径规则、指定 Sitemap 地址、设置 Crawl-delay(抓取延迟)。配置后实时预览文件内容,一键复制或下载。也支持上传已有 robots.txt 进行语法校验。适用于网站 SEO 优化、爬虫流量管理、敏感路径保护等场景。
使用步骤
1
添加爬虫规则
点击「添加规则」,选择 User-agent(或自定义),设置 Allow/Disallow 路径。可添加多条规则。
2
配置额外选项
可选填写 Sitemap 地址、Crawl-delay(秒),支持添加注释说明。
3
生成与导出
右侧实时预览 robots.txt 文件内容。确认无误后点击「复制代码」或「下载文件」保存到本地。
常见问题
robots.txt 能完全阻止爬虫抓取吗?
不能。robots.txt 是一个自律协议,遵守的爬虫(如 Google、Bing、百度)会遵循规则,但恶意爬虫可以完全无视它。重要页面应结合其他方式(如登录验证、IP 白名单)保护。
Disallow 和 Allow 的优先级是什么?
在同一 User-agent 下,最精确的匹配优先。如果冲突,较短的路径优先。建议避免 Allow 和 Disallow 的复杂嵌套。最简单的方法是:先 Disallow 全部,再 Allow 允许访问的子目录。
Sitemap 必须写在 robots.txt 里吗?
不必须。Sitemap 可以通过多种方式提交给搜索引擎(如 Google Search Console),但写在 robots.txt 中是最简单也最通用的方式,所有主流搜索引擎都会读取。
Crawl-delay 对所有爬虫都有效吗?
Crawl-delay 不是所有爬虫都支持的指令。Google 会忽略它(Google 通过 Search Console 控制爬速),百度、Bing 等部分爬虫可能遵守。想限制 Google 的抓取速度,请用 Google Search Console。