This topic created in 3689 days ago, the information mentioned may be changed or developed.
比如,我每天爬新闻,爬文章,内存中可以用 set 或者算法来做过滤,但是已经存到数据库的数据,如何保证你抓取的时候不重复呢?
目前我是把网址 hash 之后存了个字段在数据库,每次网址的时候都去做判断。感觉太粗糙,而且数据量大了,就算 hash 做了索引,每次判断也很拖性能吧?
大家有啥好的办法么?
9 replies • 2016-06-25 15:56:12 +08:00
 |
|
1
binux Jun 24, 2016
读一下能耗多少性能啊。你爬的数据量大还是用户的访问量大。
|
 |
|
2
ooonme Jun 24, 2016 via iPhone
一般爬的时候不判重,下游数据清洗的时候解决重复问题
|
 |
|
6
ooonme Jun 24, 2016 via iPhone
5 楼说了,用过滤就好了,数据分析一般不修改数据只做转换
|
 |
|
7
keysona Jun 24, 2016
url 判重的看布隆过滤器吧。 数据的话查一下就好吧....
|
 |
|
8
warmheartli Jun 25, 2016
看你是想过滤 url 重复的还是过滤内容重复的,过滤 url 那就 url 去重没什么好说的,如果想对内容去重,可以先粗算再精算,粗算就是采取找到正文里句子最长的那个句子,算签名去重,精算就是当发现签名一样的时候再挨个句子判断
|
 |
|
9
askfermi Jun 25, 2016
网址的话用 Bloom Filter
|