[Python] 抖音字体反爬,爬虫字体反爬策略——每周一个爬虫小教程系列
作者:精品下载站 日期:2020-06-17 00:00:00 浏览:79 分类:编程开发
在B站上看到一个关于抖音字体反爬的视频,看完之后,精神抖擞,不禁感觉,我又行了,于是在模拟器上下载了一个抖音,打开了我尘封已久的抖音号。
可以看见显示的数字是正常的,但是查看源码就是错误的。
既然是字体反爬,那就得去找下字体,双击下载
然后用在线字体编辑器打开看一下。
我们看到这个数字1的Unicode是$E602,是不是和源代码中的差不多呢。
在教程里面说到对于字体反爬,需要用模块将字体转为xml,相当于字典,然后就这样替换吧。
将字体文件转换为xml文件需要用到的模块是fonttoole,这里需要自行安装一下。
fromfontTools.ttLibimportTTFont font=TTFont('iconfont_9eb9a50.woff') font.saveXML('DouYinFont.xml')
转换完成之后的XML文件。
我们来搜索一下我们之前的数字1,他的Unicode就是E602,然后可以发现这里和之前在线字体网站上的结果是一样的
然后我们来将XML文件提取出来,并输出一下(XML提取我目前也不会,所以是跟着教程写的,后期再去了解一下吧)
a=font['cmap'].getBestCmap() print(a)
这个时候发现似乎这些都变成了数字,而不是之前的$E602这样子的,是因为进制转换了,由原始的16进制,转成了10进制。
然后我们需要将这个字典中的十进制数字转成这种16进制,然后还得把0x替换为&#x
然后用代码实现就是酱紫的,大概就是提取出cmap这个节点的信息,然后遍历这个字典,然后重新转换成16进制然后变成字符串,在替换一下。
a=font['cmap'].getBestCmap() b={} forkey,valueina.items(): b[str(hex(key)).replace('0x','&#x')]=value print(b)
然后就是用代码将num_这些转换为数字,参照这张字体在线编辑器的即可
c={ 'num_':'1', 'num_1':'0', 'num_2':'3', 'num_3':'2', 'num_4':'4', 'num_5':'5', 'num_6':'6', 'num_7':'9', 'num_8':'7', 'num_9':'8', }
然后改进一下之前的代码:
forkey,valueina.items(): b[str(hex(key)).replace('0x','&#x')]=c[value] print(b)
然后为了和网页源码里面一样()所以还需要做一些修改,在后面加一个分号和空格。
forkey,valueina.items(): b[str(hex(key)).replace('0x','&#x')+';']=c[value] print(b)
然后就是请求源码,然后替换了。
headers={ 'User-Agent':'Mozilla/5.0(WindowsNT10.0;Win64;x64)AppleWebKit/537.36(KHTML,likeGecko)Chrome/83.0.4103.97Safari/537.36', } url='https://www.iesdouyin.com/share/user/91723415754' res=requests.get(url=url,headers=headers).text forkey,valueinb.items(): ifkeyinres: res=res.replace(key,value+'') print(res)
猜你还喜欢
- 03-29 [编程相关] Winform窗体圆角以及描边完美解决方案
- 03-29 [前端问题] has been blocked by CORS policy跨域问题解决
- 03-29 [编程相关] GitHub Actions 入门教程
- 03-29 [编程探讨] CSS Grid 网格布局教程
- 10-12 [编程相关] python实现文件夹所有文件编码从GBK转为UTF8
- 10-11 [编程算法] opencv之霍夫变换:圆
- 10-11 [编程算法] OpenCV Camshift算法+目标跟踪源码
- 10-11 [Python] python 创建 Telnet 客户端
- 10-11 [编程相关] Python 基于 Yolov8 + CPU 实现物体检测
- 03-15 [脚本工具] 使用go语言开发自动化脚本 - 一键定场、抢购、预约、捡漏
- 01-08 [编程技术] 秒杀面试官系列 - Redis zset底层是怎么实现的
- 01-05 [编程技术] 《Redis设计与实现》pdf
取消回复欢迎 你 发表评论:
- 精品推荐!
-
- 最新文章
- 热门文章
- 热评文章
[短剧] 2025年06月03日 精选+付费短剧推荐25部
[软件合集] 25年6月3日 精选软件44个
[短剧合集] 2025年06月2日 精选+付费短剧推荐39部
[软件合集] 25年6月2日 精选软件18个
[软件合集] 25年6月1日 精选软件15个
[短剧合集] 2025年06月1日 精选+付费短剧推荐59部
[短剧] 2025年05月31日 精选+付费短剧推荐58部
[软件合集] 25年5月31日 精选软件66个
[电影] 黄沙漫天(2025) 4K.EDRMAX.杜比全景声 / 4K杜比视界/杜比全景声
[风口福利] 短视频红利新风口!炬焰创作者平台重磅激励来袭
[剧集] [央视][笑傲江湖][2001][DVD-RMVB][高清][40集全]李亚鹏、许晴、苗乙乙
[电视剧] 欢乐颂.5部全 (2016-2024)
[电视剧] [突围] [45集全] [WEB-MP4/每集1.5GB] [国语/内嵌中文字幕] [4K-2160P] [无水印]
[影视] 【稀有资源】香港老片 艺坛照妖镜之96应召名册 (1996)
[剧集] 神经风云(2023)(完结).4K
[剧集] [BT] [TVB] [黑夜彩虹(2003)] [全21集] [粤语中字] [TV-RMVB]
[资源] B站充电视频合集,包含多位重量级up主,全是大佬真金白银买来的~【99GB】
[影视] 内地绝版高清录像带 [mpg]
[书籍] 古今奇书禁书三教九流资料大合集 猎奇必备珍藏资源PDF版 1.14G
[美图] 2W美女个美女小姐姐,饱眼福
[电视剧] [突围] [45集全] [WEB-MP4/每集1.5GB] [国语/内嵌中文字幕] [4K-2160P] [无水印]
[剧集] [央视][笑傲江湖][2001][DVD-RMVB][高清][40集全]李亚鹏、许晴、苗乙乙
[电影] 美国队长4 4K原盘REMUX 杜比视界 内封简繁英双语字幕 49G
[电影] 死神来了(1-6)大合集!
[软件合集] 25年05月13日 精选软件16个
[精品软件] 25年05月15日 精选软件18个
[绝版资源] 南与北 第1-2季 合集 North and South (1985) /美国/豆瓣: 8.8[1080P][中文字幕]
[软件] 25年05月14日 精选软件57个
[短剧] 2025年05月14日 精选+付费短剧推荐39部
[短剧] 2025年05月15日 精选+付费短剧推荐36部
- 最新评论
-
- 热门tag