Python爬虫入门教程 63-100 Python字体反爬之一,没办法,这个必须写,反爬第3篇

梦想橡皮擦 2019-11-12

python 浏览器 Image

背景交代

在反爬圈子的一个大类,涉及的网站其实蛮多的,目前比较常被爬虫coder欺负的网站,猫眼影视,汽车之家,大众点评,58同城,天眼查......还是蛮多的,技术高手千千万,总有五花八门的反爬技术出现,对于爬虫coder来说,干!就完了,反正也996了~

作为一个系列的文章,那免不了,依旧拿猫眼影视“学习”吧,为什么?因为它比较典型~

猫眼影视

打开猫眼专业版,常规操作,谷歌浏览器,开发者工具,抓取DOM节点,

https://piaofang.maoyan.com/?ver=normal

注意下图所有的数字位置,在DOM结构中,都是方块。
image

字体反爬扫盲

字体反爬,是一种常见的反爬技术,网站采用了自定义的字体文件,在浏览器上正常显示,但是爬虫抓取下来的数据要么就是乱码,要么就是变成其他字符。采用自定义字体文件是CSS3的新特性,熟悉前端的同学

登录 后评论
下一篇
云栖号
8464人浏览
2020-03-04
相关推荐
大规模爬虫流程总结
929人浏览
2017-08-01 16:34:00
和我一起入门python爬虫
1226人浏览
2019-03-20 15:04:56
0
0
0
1432