别让恶意爬虫薅秃内容!ZBlog网站高效防爬设置分享
时间:2026年06月12日 08:58:05
来源:易频IT社区
你有没有发现,刚用心更新几篇原创,没过两天就被搬得干干净净?甚至有些爬得凶的,还把你服务器带宽占满,后台卡成PPT?这事儿吧,对小站站长来说太闹心了,辛辛苦苦养的号,凭啥给别人做嫁衣?
今天就掏心窝子说ZBlog的防爬设置,不用花钱买插件,免费自带的功能就能先挡90%的普通爬虫。
先聊聊robots.txt文件,这就像你家门口贴的「告示牌」,告诉正经爬虫哪些能进哪些不能碰。
ZBlog默认是没这个文件的,得自己手动建。用记事本或者代码编辑器新建一个txt,命名全小写的robots,然后传到网站根目录就行。根目录就是你放zb_system、zb_users这些文件夹的地方,别传错了哦。
文件里的内容可以这么写:
```
User-agent:
Disallow: /zb_system/
Disallow: /zb_users/cache/
Disallow: /zb_users/logs/
Disallow: /search.php
Disallow: /?
Sitemap: https://你的域名/sitemap.xml
```
User-agent后面的代表所有爬虫,Disallow就是禁止访问的目录,比如系统目录、缓存、日志这些都是没用的,别给爬虫浪费资源。最后一行放你的网站地图链接,方便正经搜索引擎收录。
接下来是ZBlog后台自带的「禁止访问的用户代理」功能,这个相当于「门禁系统」,看不顺眼的ID直接拦在门外。
打开ZBlog后台,找到「网站设置」——「全局设置」,往下拉找到「系统安全」区域,这里有个输入框叫「禁止访问的用户代理」。
普通新手不知道加啥?没关系,先给你几个高频恶意爬虫的UA放进去,注意用英文逗号隔开:
```
MJ12bot,AhrefsBot,SEMrushBot,Scrapy,HTTrack,WebStripper
```
MJ12bot这些是比较有名的商业采集爬虫,爬得猛又不尊重robots.txt,必须拉黑。以后如果发现还有漏网之鱼,可以去网站日志里找User-agent字段,复制可疑的加进去就行。
然后是设置伪静态加参数过滤,很多爬虫喜欢带一堆乱七八糟的参数爬,比如?page=10086这种不存在的页面,既浪费带宽又影响收录。
如果你已经开了伪静态(这个建议一定要开,对SEO好),可以顺手把后台的「禁止动态访问」勾上。同样在「网站设置」——「全局设置」——「系统安全」里,找「URL规则」相关的,勾上「强制伪静态(禁止动态访问)」,这样带?的动态页面就打不开了,爬虫爬了也是404,慢慢就不会来了。
最后说个稍微进阶但不用写代码的小技巧,给重要的原创内容加个简单的验证码。比如在文章页底部的评论框旁边,或者文章中间加个“需解锁查看全文”的小模块,用ZBlog自带的插件中心搜「验证码查看全文」,找个免费靠谱的装上就行。这样普通爬虫就爬不到完整内容了,只有真人输入验证码才能看,虽然对用户体验有一点点影响,但比起内容被全薅走,这点牺牲完全值得。
对了,别忘了定期更新ZBlog系统和插件,旧版本可能有漏洞被爬虫利用,保持最新版本也是防爬的重要一步哦。