网站不想被爬虫扒取?robots.txt 爬虫屏蔽教程

网站不想被爬虫扒取?robots.txt完整教程,爬虫UA直接抄

正规爬虫访问你的网站,第一步就会读取网站根目录的robots.txt,按照文件里写的规则,判断哪些页面抓取、哪些不去抓取。

⚠️非常重要:robots.txt只是一份君子协议。
只有守规矩的爬虫才会遵守规则。恶意采集爬虫、扫描器完全无视robots.txt。它挡不住爬虫访问服务器,只是告诉爬虫不要收录页面。真正拦截恶意爬虫,需要服务器Nginx/Apache层面处理UA或者封IP。

robots.txt基础规则

  1. 文件必须放在网站根目录,子文件夹里面的robots.txt不会生效,访问路径是你的域名/robots.txt。
  2. 4个核心指令:
    • User-agent:指定爬虫名称,*代表匹配全部爬虫
    • Disallow:禁止抓取路径,/等于禁止抓取整个网站;/admin/禁止整个admin文件夹
    • Allow:允许抓取指定路径,一般用来在禁止目录里单独放行页面
    • Crawl-delay:爬虫抓取延时,降低爬虫访问频率,减轻服务器压力

全网常见爬虫UA对照表

爬虫标识 爬虫来源
Baiduspider 百度网页爬虫
Baiduspider-image 百度图片爬虫
Googlebot 谷歌网页爬虫
Googlebot-Image 谷歌图片爬虫
Bingbot 必应爬虫
Sogouspider 搜狗爬虫
Yisouspider 360搜索爬虫
Bytespider 字节跳动(头条、抖音)爬虫
Applebot 苹果爬虫
YandexBot Yandex搜索引擎
DuckDuckBot DuckDuckGo爬虫
GPTBot OpenAI GPT网页爬虫
Claude-Bot Claude AI爬虫
CCBot AI训练数据集爬虫

直接复制使用robots配置示例

示例1:测试站、内部演示站,禁止全部爬虫抓取整站

User-agent: *
Disallow: /

示例2:搜索引擎正常收录,只屏蔽AI爬虫

User-agent: GPTBot
Disallow: /

User-agent: Claude-Bot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: *
Allow: /

示例3:网站正常收录,禁止抓取后台、缓存、安装目录

User-agent: *
Disallow: /admin/
Disallow: /backend/
Disallow: /install/
Disallow: /temp/
Disallow: /cache/
Allow: /

示例4:单独屏蔽字节爬虫,其余搜索引擎正常抓取

User-agent: Bytespider
Disallow: /

User-agent: *
Allow: /

新手容易踩坑的注意事项

  • 目录末尾斜杠区分:/admin/代表整个文件夹;/admin代表叫admin的单个文件,写的时候不要漏写斜杠。
  • robots.txt路径区分大小写,/Admin/和/admin/视为不同路径,配置时注意。
  • robots.txt不会删除已经收录的页面。页面已经被搜索引擎收录,修改robots之后,需要去对应搜索引擎站长平台提交删除请求。
  • robots.txt不是安全防护。后台目录不能只靠Disallow屏蔽,一定要加上登录权限验证。
  • 文件保存编码选择UTF‑8纯文本,不要用Word保存,避免出现隐藏符号导致规则失效。
  • 修改完robots.txt,建议去搜索引擎站长平台提交robots地址,加速规则生效。

总结

robots.txt是给合规爬虫看的规则文件,把它放到网站根目录就可以生效。可以单独屏蔽某一家搜索引擎,也可以专门屏蔽AI训练爬虫。

记住:robots只能“劝告”爬虫,对付恶意采集爬虫,需要服务器层面做拦截。

文章广告横幅
网络违法犯罪举报平台 广告
© 版权声明
THE END
喜欢就支持一下吧
点赞182 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容