零基础学会robots.txt正确配置允许收录
如果你的网站迟迟不被搜索引擎收录,问题可能出在根目录下的 robots.txt 里。
这个文本文件专门告诉爬虫哪些页面能抓、哪些不能。
一旦写错,整个网站都可能被拒绝抓取。
下面按步骤教你完成 robots.txt 正确配置允许收录,全程零基础可操作。
为什么 robots.txt 会阻挡收录?
搜索引擎蜘蛛访问网站时,第一件事就是读取 /robots.txt。
如果文件中写了 Disallow: /,等于告诉所有爬虫“本站禁止访问”。
很多新手在屏蔽测试环境时误用了这条规则,上线后忘记改回来,导致整站不被收录。
另外,某些 CMS 默认生成的 robots.txt 也可能限制过严,需要手动调整。
准备工作:找到文件与确认路径
你需要一个能编辑网站根目录文件的方式:
- 使用 FTP 客户端(如 FileZilla)连接服务器,定位到网站根目录(通常是
public_html、www或域名对应的文件夹)。 - 或者使用宝塔面板、cPanel 等控制面板的“文件管理器”进入根目录。
- 如果根目录下已有
robots.txt,先下载备份;如果没有,需要手动创建(注意文件名大小写:全部小写,扩展名.txt)。
一步步配置:让搜索引擎允许收录全站
最安全的配置是允许所有爬虫抓取所有内容,除非你有特殊需求。
打开或新建 robots.txt,输入以下内容:
User-agent: *
Allow: /
User-agent: *表示规则适用于所有搜索引擎蜘蛛(百度、谷歌、必应等)。Allow: /明确允许抓取根目录及以下所有路径。
如果想让某个目录不被抓取(比如后台 /admin),可以追加:
User-agent: *
Allow: /
Disallow: /admin/
特别注意: Disallow 必须放在 Allow 之后才会生效,而且路径需要以斜杠结尾(表示目录)。
更常见的做法是只写 Allow: / 即可,因为默认就是允许所有。
保存文件后,务必检查文件编码为 UTF-8 无 BOM,避免爬虫解析乱码。
常见配置错误与避坑指南
- 错误1:只写
Disallow: /→ 直接封杀全站,必须改成Allow: /或删除该行。 - 错误2:路径写错 → 比如
/admin没带末尾斜杠,可能不会屏蔽/admin/目录下的文件。建议统一使用/目录名/格式。 - 错误3:文件不在根目录 → robots.txt 必须放在网站根目录下,否则爬虫找不到。
- 错误4:允许多个爬虫时规则冲突 → 例如先写
User-agent: Baiduspider禁止某些路径,再写User-agent: *允许全站,优先匹配更具体的 User-agent。如果你只想针对百度做限制,确保先写百度规则。
验证配置是否生效
上传或保存后,立即验证:
- 浏览器直接访问
https://你的域名/robots.txt,回车后应显示刚才的内容。如果出现 404,说明文件不在根目录或文件名错误。 - 使用 Google Search Console(站长工具):添加网站后,进入“检查 robots.txt” 工具,输入文件 URL 测试规则是否能被正确读取。百度站长平台也提供类似功能。
- 观察收录变化:配置正确后,通常需要等待 1-3 天,爬虫重新抓取。你可以用“site:你的域名”搜索是否有新页面出现。
如果你正在处理 robots.txt 正确配置允许收录的问题,建议先按本文步骤完整执行,再根据自己的环境做微调;
遇到异常时优先回看避坑和高频问题部分。
只要不写反路径,绝大多数收录问题都能迎刃而解。