网站robots.txt配置指南:语法规则与实操要点

📍 WDQWDWQD987AAAAA:216.73.216.187
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /ed75fb0794de.html
📄

robots.txt 是一个放在网站根目录的纯文本文件,作用是以简单指令告知搜索引擎爬虫哪些路径可以抓取、哪些应当避开。它不是安全工具,但能有效保护非公开目录、节省抓取配额并降低服务器压力。管理网站前,掌握这个文件的配置规则十分必要。

1. robots.txt 的核心语法要素

该文件格式简单,本质是固定关键词的组合。掌握以下三个要素,即可应对多数配置场景。

需留意,每个 User-agent 分组后至少要有一条 Disallow 或 Allow 语句,否则分组无效。同时务必牢记,此文件只约束搜索引擎程序,用户通过浏览器访问不受任何影响,真正的机密内容不能依赖它保护。

2. 创建并部署你的第一份配置文件

无论站点规模大小,建议从简洁的初始版本开始。以下基础模板可作为参照。

  1. 新建一个纯文本文件,将下方内容粘贴进去:
User-agent: *
Disallow: /cgi-bin/
Disallow: /temp/
Sitemap: https://www.yourdomain.com/sitemap.xml
  1. 将示例域名替换为你的真实网址,并仔细核对目录名称拼写。
  2. 将文件命名为 robots.txt,通过 FTP 工具或主机管理面板上传至域名根目录。

检查方法与易错点:完成后,在浏览器输入 你的域名/robots.txt,若内容原样显示即部署成功。新手常犯的错误是写成 Disallow: /,这会导致整站被搜索引擎屏蔽。另外,路径末尾的斜杠不可遗漏,如 /temp 无法覆盖 /temp/ 目录。

3. 助 Allow 指令实现灵活放行

当目录结构日趋复杂,全放或全挡往往难以满足需求,Allow 指令便派上用场。常见场景:隐藏整个图片库,但希望其中一张品牌宣传图被收录。

User-agent: *
Disallow: /assets/img/
Allow: /assets/img/brand.png

使用要点:Allow 的优先级高于同组的 Disallow,因此上述配置可达成精准放行。建议先写较宽的 Disallow 规则,再用 Allow 补充例外,逻辑更清晰。若需放行多个文件,逐条列举即可,但过多规则会增加维护成本。

4. 配置后的测试与日常维护

上线后并非万事大吉,定期检查和更新同样重要。推荐借助搜索引擎站长工具检验效果,例如谷歌搜索控制台或百度搜索资源平台,均提供 robots 检测功能。

有个实际案例:某电商站点曾因误将 Disallow: /product/ 写成 Disallow: /product,导致商品详情页全部掉出索引,纠正后数周才逐步恢复。可见路径细节的准确性直接关系到收录效果。

5. 常见问题

5.1 robots.txt 能完全阻止他人查看敏感页面吗?

不能。它只对遵守协议的搜索引擎爬虫生效,任何人仍可直接输入网址访问。若要真正保护页面,应采用登录验证或服务器端权限控制。

5.2 文件大小和规则数量有限制吗?

建议保持精简。大型搜索引擎一般只读取前 500 条规则且文件上限约 500KB,超出部分可能被忽略。过长的配置也增加排查难度,能合并的尽量合并。

5.3 修改 robots.txt 后多久生效?

通常爬虫会在下次抓取时重新读取该文件,短则数小时,长则数天。如需加速,可通过搜索引擎站长工具提交更新请求。

6. 总结

配置 robots.txt 并非难事,关键在把握语法细节并持续验证。从基础模板起步,逐步熟悉 Allow 和 Disallow 的组合运用,同时利用站长工具定期排查。务必记住,它服务于爬虫管理而非安全防线,敏感数据另寻可靠保护手段。先在测试环境验证规则,再部署到正式站点,能避免许多不必要的收录事故。

图1 图2

nginx