SimHash文档去重

作者: 本熊本 | 来源:发表于2018-03-18 11:27 被阅读0次

SimHash文档去重
simHash 文档指纹去重算法
文本去重
simhash算法原理及实现
文档排重之SimHash算法
simHash海量文本去重
基于hash的文档判重——simhash
海量文档的去重
simhash与Google的网页去重
基于simhash的文本去重原理

1. 首先SimHash的算法生成图如下图所示：

Image.jpg

生成步骤如下：

对于每篇文章，选择分词作为该篇文章的特征，获取去掉噪音的词做为文档特征，为每个词赋予一个权重，该权重可以使用TFIDF来对应

根据机器的存储以及性能，可以选择使用哪种hash算法，计算出每个词的hash值，可以是32位的也可以是64位的

对于上述hash值的每一位乘以相应的权重，得到新的hash序列，最后将每个词的每一位hash序列相加求和

对于求和后的hash序列，如果该位>0，最终的simhash的该位=1,否则simhash=0

simhash可以用来衡量两篇文档的相似程度，如果两篇文档比较相似，那么他们的simhash值也相似，这种hash算法与MD5算法不同：

对于MD5算法，稍微对某个字符串修改一点，那么得出的MD5戳就会发生很大的变化。

2.如何通过两篇文档的simHash来检查两篇文档是否相似呢？使用海明距离。

海明距离：两个hash串异或之后1的个数，也就是两个simhash串不同的位数。根据经验，一般海明距离<=3或者4的时候，两篇文档相似。

如何高效计算某个二进制串中为1的个数呢？

int getHammingDistance(BigInteger hash1, BigInteger hash2){

    BigInteger data = hash1.xor(hash2);

    int tot = 0;

    while (data != 0) {

             tot += 1;

             data = data&(data-1);

    }

    return tot;

}

时间复杂度为o(n), 我们知道一个二进制数减掉1之后和该二进制数去&操作,相当于把最右边的一位1变成了0,因此能执行多少次这样的操作就有多少个1存在.