搜索引擎与爬虫

检测爬虫 IP

检测爬虫 IP

这篇文章我们将详细介绍如何识别爬虫 ip。

我们在网站运营的时候,经常有各种各样的爬虫来光顾,有好的爬虫,例如:搜索引擎爬虫营销类的爬虫屏幕快照类爬虫监控类爬虫信息流类爬虫链接检查类爬虫工具类爬虫速度测试类爬虫漏洞类爬虫。恶意的爬虫,例如:抓取类爬虫、伪造爬虫等。

我们将爬虫分为两类,但也不是绝对的,有一些搜索引擎爬虫在国内没什么问题,但是在国外由于过度抓取,而被列入黑名单。而被站长加入黑名单,所以最终还是要根据自己的实际情况。

如何识别爬虫ip

我们经常在检查日志的时候,看到 User-agent 是爬虫的,但是 IP 不确定是不是这个爬虫的 IP,这个时候,我们需要查询爬虫的IP地址,我们可以直接到爬虫识别这个网站上查询。

首先我们点击首页上的爬虫查询,之后输入ip地址,就可以看到是不是真实的爬虫,下面是示例:

例如,我们输入:116.179.32.100就是百度蜘蛛的 IP 地址,截图如下:

百度蜘蛛IP查询结果

同时还可以通过查询的结果始于什么类别,是否遵守 robots.txt 协议等,有了这样一个工具,伪造爬虫也逃不过你的火眼金睛。

例如:下面是一个伪造百度蜘蛛的 IP 地址,通过查询结果如下:

伪造百度蜘蛛IP查询结果

通过上图可以看出不仅查询出了伪造百度蜘蛛,还可以看到最近活跃时间,可以为站长提供很好的参考作用。

通过上面的方法查询之后,基本就可以检查出来爬虫的IP是否正确,即使伪造的爬虫IP也可以被我们精准识别出来。

搜索引擎爬虫类目下面也整理出了各种各样爬虫的 User-agent,这样站长通过 User-agent + 爬虫 IP 识别的方式,就可以检测爬虫。

总结

这篇文章主要介绍了如何通过爬虫识别这个工具精准识别爬虫,同时也介绍了如何查找各类爬虫的 UA(User-agent),为我们的网站运营如虎添翼。