网站不想被爬虫扒取?robots.txt完整教程,爬虫UA直接抄
正规爬虫访问你的网站,第一步就会读取网站根目录的robots.txt,按照文件里写的规则,判断哪些页面抓取、哪些不去抓取。
⚠️非常重要:robots.txt只是一份君子协议。
只有守规矩的爬虫才会遵守规则。恶意采集爬虫、扫描器完全无视robots.txt。它挡不住爬虫访问服务器,只是告诉爬虫不要收录页面。真正拦截恶意爬虫,需要服务器Nginx/Apache层面处理UA或者封IP。
robots.txt基础规则
- 文件必须放在网站根目录,子文件夹里面的robots.txt不会生效,访问路径是
你的域名/robots.txt。 - 4个核心指令:
User-agent:指定爬虫名称,*代表匹配全部爬虫Disallow:禁止抓取路径,/等于禁止抓取整个网站;/admin/禁止整个admin文件夹Allow:允许抓取指定路径,一般用来在禁止目录里单独放行页面Crawl-delay:爬虫抓取延时,降低爬虫访问频率,减轻服务器压力
全网常见爬虫UA对照表
| 爬虫标识 | 爬虫来源 |
|---|---|
| Baiduspider | 百度网页爬虫 |
| Baiduspider-image | 百度图片爬虫 |
| Googlebot | 谷歌网页爬虫 |
| Googlebot-Image | 谷歌图片爬虫 |
| Bingbot | 必应爬虫 |
| Sogouspider | 搜狗爬虫 |
| Yisouspider | 360搜索爬虫 |
| Bytespider | 字节跳动(头条、抖音)爬虫 |
| Applebot | 苹果爬虫 |
| YandexBot | Yandex搜索引擎 |
| DuckDuckBot | DuckDuckGo爬虫 |
| GPTBot | OpenAI GPT网页爬虫 |
| Claude-Bot | Claude AI爬虫 |
| CCBot | AI训练数据集爬虫 |
直接复制使用robots配置示例
示例1:测试站、内部演示站,禁止全部爬虫抓取整站
User-agent: * Disallow: /
示例2:搜索引擎正常收录,只屏蔽AI爬虫
User-agent: GPTBot Disallow: / User-agent: Claude-Bot Disallow: / User-agent: CCBot Disallow: / User-agent: * Allow: /
示例3:网站正常收录,禁止抓取后台、缓存、安装目录
User-agent: * Disallow: /admin/ Disallow: /backend/ Disallow: /install/ Disallow: /temp/ Disallow: /cache/ Allow: /
示例4:单独屏蔽字节爬虫,其余搜索引擎正常抓取
User-agent: Bytespider Disallow: / User-agent: * Allow: /
新手容易踩坑的注意事项
- 目录末尾斜杠区分:
/admin/代表整个文件夹;/admin代表叫admin的单个文件,写的时候不要漏写斜杠。 - robots.txt路径区分大小写,
/Admin/和/admin/视为不同路径,配置时注意。 - robots.txt不会删除已经收录的页面。页面已经被搜索引擎收录,修改robots之后,需要去对应搜索引擎站长平台提交删除请求。
- robots.txt不是安全防护。后台目录不能只靠Disallow屏蔽,一定要加上登录权限验证。
- 文件保存编码选择UTF‑8纯文本,不要用Word保存,避免出现隐藏符号导致规则失效。
- 修改完robots.txt,建议去搜索引擎站长平台提交robots地址,加速规则生效。
总结
robots.txt是给合规爬虫看的规则文件,把它放到网站根目录就可以生效。可以单独屏蔽某一家搜索引擎,也可以专门屏蔽AI训练爬虫。
记住:robots只能“劝告”爬虫,对付恶意采集爬虫,需要服务器层面做拦截。
© 版权声明
THE END














![表情[baoquan]-服务器测评_云 VPS 推荐_运维技术教程与源码分享 - 环球云域数据平台 cloudidc.vip](https://cloudidc.vip/wp-content/themes/zibll/img/smilies/baoquan.gif)


暂无评论内容