robots.txt 是一个放在网站根目录的纯文本文件,作用是以简单指令告知搜索引擎爬虫哪些路径可以抓取、哪些应当避开。它不是安全工具,但能有效保护非公开目录、节省抓取配额并降低服务器压力。管理网站前,掌握这个文件的配置规则十分必要。
该文件格式简单,本质是固定关键词的组合。掌握以下三个要素,即可应对多数配置场景。
需留意,每个 User-agent 分组后至少要有一条 Disallow 或 Allow 语句,否则分组无效。同时务必牢记,此文件只约束搜索引擎程序,用户通过浏览器访问不受任何影响,真正的机密内容不能依赖它保护。
无论站点规模大小,建议从简洁的初始版本开始。以下基础模板可作为参照。
User-agent: *
Disallow: /cgi-bin/
Disallow: /temp/
Sitemap: https://www.yourdomain.com/sitemap.xml
检查方法与易错点:完成后,在浏览器输入 你的域名/robots.txt,若内容原样显示即部署成功。新手常犯的错误是写成 Disallow: /,这会导致整站被搜索引擎屏蔽。另外,路径末尾的斜杠不可遗漏,如 /temp 无法覆盖 /temp/ 目录。
当目录结构日趋复杂,全放或全挡往往难以满足需求,Allow 指令便派上用场。常见场景:隐藏整个图片库,但希望其中一张品牌宣传图被收录。
User-agent: *
Disallow: /assets/img/
Allow: /assets/img/brand.png
使用要点:Allow 的优先级高于同组的 Disallow,因此上述配置可达成精准放行。建议先写较宽的 Disallow 规则,再用 Allow 补充例外,逻辑更清晰。若需放行多个文件,逐条列举即可,但过多规则会增加维护成本。
上线后并非万事大吉,定期检查和更新同样重要。推荐借助搜索引擎站长工具检验效果,例如谷歌搜索控制台或百度搜索资源平台,均提供 robots 检测功能。
有个实际案例:某电商站点曾因误将 Disallow: /product/ 写成 Disallow: /product,导致商品详情页全部掉出索引,纠正后数周才逐步恢复。可见路径细节的准确性直接关系到收录效果。
不能。它只对遵守协议的搜索引擎爬虫生效,任何人仍可直接输入网址访问。若要真正保护页面,应采用登录验证或服务器端权限控制。
建议保持精简。大型搜索引擎一般只读取前 500 条规则且文件上限约 500KB,超出部分可能被忽略。过长的配置也增加排查难度,能合并的尽量合并。
通常爬虫会在下次抓取时重新读取该文件,短则数小时,长则数天。如需加速,可通过搜索引擎站长工具提交更新请求。
配置 robots.txt 并非难事,关键在把握语法细节并持续验证。从基础模板起步,逐步熟悉 Allow 和 Disallow 的组合运用,同时利用站长工具定期排查。务必记住,它服务于爬虫管理而非安全防线,敏感数据另寻可靠保护手段。先在测试环境验证规则,再部署到正式站点,能避免许多不必要的收录事故。