This topic created in 3171 days ago, the information mentioned may be changed or developed.
写的爬虫程序经常会遇到编码错误,想想谷歌蜘蛛要爬那么多国家语言的网页,是怎么保证网页编码的正确呢?
自己用的方法就是用 Nchardet 这样的工具先检测下,再者解析 ContentType,最后是强制 utf-8 解析下,搞不定就 pass。做不到 100%的可靠。
毕竟中文网页常用的就那么几个编码方式,谷歌爬虫要解析那么多国家语言的网页,可以做到 100%准确识别网页编码方式吗?
7 replies • 2017-11-29 14:45:45 +08:00
 |
|
1
yu099 Nov 29, 2017 via Android
你网页打开是怎么识别编码的?别人可是有搞 chrome 的。
|
 |
|
3
fiht Nov 29, 2017
哪啥...试试 tika... 我觉得应该是都可以识别的...
|
 |
|
4
billion Nov 29, 2017 via iPhone
Google 的工程师来自全球各个国家。而你只是一个中国人。
|
 |
|
5
imn1 Nov 29, 2017
其实这个问题如果预设错误就显得很“无知”“幼稚”了 怎么能把 google 的爬虫预设跟一般人写的爬虫一样呢?
如果用中国大陆境内的服务器,爬境内的网站,简繁英以外的编码占比多少?需要所有编码逐个试一遍么? 除了 GeoIP 外,优化的方法还有很多
|
 |
|
6
binux Nov 29, 2017 via Android 1
直接用 chrome 就好了,如果爬虫看到的是乱码,用户看到的也是。那还爬它做什么?
|
 |
|
7
rogwan Nov 29, 2017 via Android
谷歌没有楼主想像的那么完美,Chrome 对没有设定 charset 的页面,一样会解出乱码。
|