robots.txt规范配置允许搜索引擎抓取全站页面指南

为什么需要专门配置 robots.txt

很多网站上线后,搜索引擎迟迟不收录某些页面,或者收录速度很慢。
其中一个常见原因是 robots.txt 文件没有正确配置,导致爬虫被错误屏蔽。

robots.txt 是一个放在网站根目录的纯文本文件,它告诉搜索引擎爬虫哪些路径可以访问、哪些不可以。
如果你希望搜索引擎正常抓取全站内容,就需要在文件中明确允许所有爬虫访问所有路径。

前置准备:找到并备份现有文件

操作前先确认 robots.txt 是否已存在。

通过 SSH 登录服务器检查:

cat /www/wwwroot/你的域名/robots.txt
# 如果提示 No such file,说明尚未创建

通过宝塔面板查看:

  1. 进入宝塔后台 → 网站 → 选择对应站点 → 文件管理。
  2. 在网站根目录(通常是 /www/wwwroot/你的域名)下寻找 robots.txt
  3. 如果存在,建议先用右键 → 下载到本地备份,避免改错后无法恢复。

分步操作:配置允许全站抓取

创建或编辑 robots.txt 文件

在网站根目录新建(或修改)robots.txt 文件。
最简单的允许全站抓取的内容如下:

User-agent: *
Disallow:

解释:

  • User-agent: * 表示这条规则适用于所有搜索引擎爬虫。
  • Disallow: 后面没有任何内容,表示不禁止任何路径,即允许抓取全站。

如果你希望同时指定抓取频率(可选),可以加上 Crawl-delay

User-agent: *
Disallow:
Crawl-delay: 10

Crawl-delay 的单位是秒,表示爬虫两次抓取之间至少间隔 10 秒,可降低服务器压力。
数字可以根据站点性能调整,新手可以先不加。

保存并验证文件可访问

保存后,在浏览器访问 http://你的域名/robots.txt,应该能看到刚才写入的内容。
如果出现 404 或 403,说明文件没有放对位置或权限不足。

避坑指南:最容易犯的四个错误

错误一:Disallow 后面留空格或写 /

User-agent: *
Disallow: /

这种写法会禁止所有爬虫抓取任何页面,等于让搜索引擎彻底忽略你的站点。

错误二:使用了 Sitemap 指令但路径写错

如果你想同时告知爬虫站点地图,可以追加一行 Sitemap: http://你的域名/sitemap.xml,但必须确保该路径真实可访问。

错误三:在同一文件中写了多条冲突规则

对于同一个 User-agent,文件中的 Disallow 行数不宜过多。
通常一行 Disallow: 空值就足够。
如果混入了多个 Disallow: /wp-admin 之类的规则,会导致部分路径被屏蔽。

错误四:把 robots.txt 写成了 robot.txtrobots.txt.txt

文件名必须完全匹配 robots.txt,大小写敏感(Linux 系统区分大小写)。

效果验证:确认爬虫已按预期工作

方法一:使用 Google Search Console 测试

  1. 进入 Search Console → 选择站点 → 左侧“检查网址”工具。
  2. 输入任意一个页面 URL,点击“测试”。
  3. 在结果中查看“抓取”标签页,如果显示“允许”,说明 robots.txt 未阻止。

方法二:使用 Bing Webmaster Tools 测试

登录 Bing 站长工具 → 配置和诊断 → Robots.txt 测试工具,输入 URL 查看结果。

方法三:命令行快速检查

curl -I http://你的域名/robots.txt
# 返回 200 OK 表示可正常访问

如果以上工具都显示允许,同时你的网站没有其他屏蔽设置(如 meta robots noindex、HTTP 认证),那么搜索引擎爬虫就能正常抓取全站页面了。

补充说明: 修改 robots.txt 后,爬虫通常需要一段时间(几小时到几天)才会重新读取,因此耐心等待即可。如果急需生效,可以在站长工具中请求重新抓取。

高频问题解答

Q:我用了 CDN,robots.txt 放哪里?

A:必须放在源站服务器的网站根目录。
CDN 会缓存该文件,如果只放在 CDN 回源不到的目录则无效。

Q:配置完后已经收录的页面会受影响吗?

A:不会。
robots.txt 只影响爬虫未来的抓取决策,已经抓取并索引的页面依然保留在搜索结果中。

Q:我的网站用宝塔建站,直接在面板里创建文件可以吗?

A:可以。
宝塔文件管理器中新建文件,命名为 robots.txt,粘贴上述内容保存即可。
注意检查文件权限至少为 644。

如果你按照本文步骤操作后,依然发现搜索引擎抓取异常,建议优先回看避坑部分,检查文件位置和内容格式。
不同站点环境可能略有差异,但核心配置逻辑是一致的。

分享到:
上一篇
多PHP版本切换解决老旧外贸程序兼容报错完整教程
下一篇
Git仓库自动部署更新网站前端代码文件定时任务
1
系统公告

机房迁移升级通知

尊敬的用户: IP 段 103.23.148.x、156.224.29.x 原香港一区线路波动、攻击频繁,平台定于 7 月 5 日凌晨分批迁移至香港 GIA 机房,硬件升级 AMD 铂金机型。 迁移均在凌晨操作,最大程度降低业务影响,迁移期间服务器临时关机; 升级后配置不降低、费用不涨价,数据默认同步迁移; 迁移后 IP 全部更换,请及时修改域名解析、防火墙白名单; 建议提前备份重要数据,有问题可联系在线客服。 感谢理解与支持! 泽御云科技 2026.06.30
服务中心
客服
在线客服
24小时为您服务
咨询
联系我们
联系我们,为您的业务提供专属服务。
24/7 技术支持
如果您遇到寻求进一步的帮助,请过工单与我们进行联系。
24/7 即时支持
泽御云
售前客服
泽御云
泽御云
售后客服
泽御云
技术支持
评价
您对当前页面的整体感受是否满意?
😞
非常不满意
😕
不满意
😐
一般
🙂
满意
😊
非常满意