引言
robots.txt 是网站与搜索引擎爬虫的“君子协定”,规范哪些路径可爬、哪些不可爬。正确配置能提升抓取效率,防止资源浪费。HeronTool 提供了一站式解决方案,让规则生成变得简单。
步骤指南
- 打开工具:访问 HeronTool 官网,点击“Robots.txt”工具。
- 输入站点信息:在“域名”框填写你的网站地址(如
https://example.com),工具会自动识别根路径。 - 配置规则:
- 允许爬虫:在“User-agent”中填写
*(所有爬虫)或指定名称(如Googlebot)。 - 禁止路径:在“Disallow”列表中添加不想被索引的目录,如
/admin、/private。 - 添加允许例外:若需禁止整个目录但允许其中某个文件,可在“Allow”中指定,例如
Allow: /public/sample.pdf。
- 高级选项:设置“Crawl-delay”(抓取延迟)控制爬虫访问频率,避免服务器过载。
- 生成与下载:点击“生成”,工具即时输出标准 robots.txt 文本,你可以复制或下载。
- 校验测试:使用 HeronTool 的“校验”功能粘贴已有文件,检查语法错误或冲突规则。
常见问题 (FAQ)
Q: 如何让所有爬虫禁止访问整个网站?
A: 在 User-agent 中写 *,Disallow 填 /。
Q: 生成后需要上传到哪里?
A: 将生成的 robots.txt 文件放在网站根目录(如 https://example.com/robots.txt),并确保文件名为 robots.txt。
Q: 如果我不想让百度抓取,但允许谷歌,怎么设置?
A: 分别添加两个 User-agent 块:User-agent: Baiduspider 加 Disallow: /;User-agent: Googlebot 留空或写允许规则。
结语
HeronTool 的 Robots.txt 工具让规则生成与校验不再繁琐,助你快速构建友好的爬虫访问策略。立即体验,提升站点 SEO 效能!
文章标签