B2B网络软件

 找回密码
 立即注册 审核网站号:QQ:896757558
搜索
查看: 4759|回复: 75
打印 上一主题 下一主题

[软件技术分享] 百度原来是这样检测内容重复的您还不快来看看

[复制链接]

15

主题

15

帖子

68

积分

新手会员

Rank: 7Rank: 7Rank: 7

积分
68
跳转到指定楼层
楼主
发表于 2016-6-5 06:00:16 | 只看该作者 |只看大图 回帖奖励 |倒序浏览 |阅读模式

在这个科技高度发达的时代,百度已经成为人们能获取消息的主要途径。但如今的百度,到处充斥着一些重复的内容,对用户的访问造成很大的困扰。因此,百度需要对网页重复进行判断,对重复的网页,只选取一些高质量的我那工业,共用户浏览。然而,现有技术中一般是通过比较两个页面的内容和借点,来确认两个页面的相似度。

百度原来是这样检测内容重复的您还不快来看看 B2B网络软件

这种方法能够计算的比较准确,可时间复杂度太高,计算很费时间。通过对一个页面中的某些重要信息进行签名,然后比较两个页面的签名,来计算相似度,这种方式比较简单高效,计算速度比较快,比较适合百度这种海量信息的应用场景。

1,网站重复内容的判断

A,获取多个网页;

B,分别提取网页的网页正文;

C,从网页正文中提取一个或多个句子,并根据一个或多个句子计算网页正文句子签名;

D,根据网页正文句子签名对多个网页进行聚类;

E,针对每一类下的网页,计算网页的附加签名;

F,根据附加签名判断每一类下的网页是否重复。

通过上述方式,网页重复的判断系统及其判断方法通过包括网页正文句子签名在内的多维度签名有效且快速地判断网页是否重复。

百度原来是这样检测内容重复的您还不快来看看 B2B网络软件

网页基本架构图

提取正文

A,对网页进行分块;

B,对分块后的网页进行块过滤,以获取包含网页正文的内容快;

C,从内容块中提取网页正文。

正文分句

A,对网页正文进行分句;

在本步骤中,可利用分号,句号,感叹号等表示句子完结的标志符号来对网页正文进行分句。此外,还可以通过网页正文的视觉信息来对网页正文进行分句。

B,对分句后的网页正文进行过滤及转换;

在步骤中,首先过滤掉句子中的数字信息;版权信息以及其他对网页重复判断不起决定性作用的信息。随后,对句子进行转换,例如,进行全角/半角转换或者繁体/简体转换,以使得转换后的句子的格式统一。

C,从过滤及转换后的网页正文中提取最长的一个或多个句子;

在本步骤中,过滤及转换后的网页正文提取出最长的一个句子或者做场的预定数量连续句子的组合。例如,某个网页实例中,经过过滤及转换后的某段最长,远超其他句子,因此可选择该段为网页正文句子,或者选择最长的连续句子组合作为网页正文句子。

D,对一个或多个句子进行hash签名运算,以获取网页正文句子签名。

simhash算法就是比较各网页的附加签名是否相同或相似来判断网页是否重复。具体来说,在比较利用simhash签名运算获得的网页正文签名时,比较网页正文签名的不同位数,不同位越少,表示网页重复的可能性越高,河南头条消息:,在比较其他的附加签名时,若附加签名相等,表示网页在该纬度上重复。

在这个科技高度发达的时代,百度已经成为人们能获取消息的主要途径。但如今的百度,到处充斥着一些重复的内容,对用户的访问造成很大的困扰。因此,百度需要对网页重复进行判断,对重复的网页,只选取一些高质量的我那工业,共用户浏览。然而,现有技术中一般是通过比较两个页面的内容和借点,来确认两个页面的相似度。

百度原来是这样检测内容重复的您还不快来看看 B2B网络软件

这种方法能够计算的比较准确,可时间复杂度太高,计算很费时间。通过对一个页面中的某些重要信息进行签名,然后比较两个页面的签名,来计算相似度,这种方式比较简单高效,计算速度比较快,比较适合百度这种海量信息的应用场景。

1,网站重复内容的判断

A,获取多个网页;

B,分别提取网页的网页正文;

C,从网页正文中提取一个或多个句子,并根据一个或多个句子计算网页正文句子签名;

D,根据网页正文句子签名对多个网页进行聚类;

E,针对每一类下的网页,计算网页的附加签名;

F,根据附加签名判断每一类下的网页是否重复。

通过上述方式,网页重复的判断系统及其判断方法通过包括网页正文句子签名在内的多维度签名有效且快速地判断网页是否重复。

百度原来是这样检测内容重复的您还不快来看看 B2B网络软件

网页基本架构图

提取正文

A,对网页进行分块;

B,对分块后的网页进行块过滤,以获取包含网页正文的内容快;

C,从内容块中提取网页正文。

正文分句

A,对网页正文进行分句;

在本步骤中,可利用分号,句号,感叹号等表示句子完结的标志符号来对网页正文进行分句。此外,还可以通过网页正文的视觉信息来对网页正文进行分句。

B,对分句后的网页正文进行过滤及转换;

在步骤中,首先过滤掉句子中的数字信息;版权信息以及其他对网页重复判断不起决定性作用的信息。随后,对句子进行转换,例如,进行全角/半角转换或者繁体/简体转换,以使得转换后的句子的格式统一。

C,从过滤及转换后的网页正文中提取最长的一个或多个句子;

在本步骤中,过滤及转换后的网页正文提取出最长的一个句子或者做场的预定数量连续句子的组合。例如,某个网页实例中,经过过滤及转换后的某段最长,远超其他句子,因此可选择该段为网页正文句子,或者选择最长的连续句子组合作为网页正文句子。

D,对一个或多个句子进行hash签名运算,以获取网页正文句子签名。

simhash算法就是比较各网页的附加签名是否相同或相似来判断网页是否重复。具体来说,在比较利用simhash签名运算获得的网页正文签名时,比较网页正文签名的不同位数,不同位越少,表示网页重复的可能性越高,在比较其他的附加签名时,若附加签名相等,表示网页在该纬度上重复。

总结:

1、两个网页的真实标题签名相同。

2、两个我那工业的网页内容签名相同。

3、两个网页的网页正文签名的不同位数小于6.。

4、两个网页的网页位置签名相同,并且url文件名签名相同。

5、评论块签名、资源签名、标签标题签名、摘要签名、url文件名签名中有三个签名相同。

附加信息整站判断重复标准:

通过两两页面比较,可以得到真重复url的集合。一般来说,如果这个真重复url集合中的网页的数量/整个网页集中网页的数量大于30%,则认为整个网页集都是真重复,否则就是假重复。

总结:

1、两个网页的真实标题签名相同。

2、两个我那工业的网页内容签名相同。

3、两个网页的网页正文签名的不同位数小于6.。

4、两个网页的网页位置签名相同,并且url文件名签名相同。

5、评论块签名、资源签名、标签标题签名、摘要签名、url文件名签名中有三个签名相同。

附加信息整站判断重复标准:

通过两两页面比较,可以得到真重复url的集合。一般来说,如果这个真重复url集合中的网页的数量/整个网页集中网页的数量大于30%,则认为整个网页集都是真重复,否则就是假重复。

回复

使用道具 举报

0

主题

1万

帖子

1万

积分

新手会员

Rank: 7Rank: 7Rank: 7

积分
14319
沙发
发表于 2016-6-5 07:31:21 | 只看该作者
解释:第一次快递上门的时候,亲回了老家,电话无法接通,快递没有办法联系到你本人,又把件退了回来,当客服再次能够联系到你的时候,我们又进行了2次邮寄。给亲造成的不便,请原谅,谢谢 亲对金蝶的支持和理解!
回复 支持 反对

使用道具 举报

0

主题

1万

帖子

1万

积分

新手会员

Rank: 7Rank: 7Rank: 7

积分
14324
板凳
发表于 2016-6-5 21:43:47 | 只看该作者
开始安装不能用,又重装了系统,可以用了。
回复 支持 反对

使用道具 举报

地板
发表于 2016-6-6 14:59:27 | 只看该作者
税务要查账,再做账,结果一月份结完后,要再打开账套,说什么文件路劲有错打不开,都 快急死了,结果问客报说售后星期1-5才上班,唉,都 不知道要怎么办了?
回复 支持 反对

使用道具 举报

0

主题

1万

帖子

1万

积分

新手会员

Rank: 7Rank: 7Rank: 7

积分
14648
5#
发表于 2016-6-6 16:03:05 | 只看该作者
电脑没光驱,发个网址给我又是带病毒的,电脑都开不了了!不敢用。回去用我笔记本电脑试试才可以哦
回复 支持 反对

使用道具 举报

0

主题

1万

帖子

1万

积分

新手会员

Rank: 7Rank: 7Rank: 7

积分
12354
6#
发表于 2016-6-7 21:25:28 | 只看该作者
不错,正版
回复 支持 反对

使用道具 举报

0

主题

1万

帖子

1万

积分

新手会员

Rank: 7Rank: 7Rank: 7

积分
14361
7#
发表于 2016-6-8 17:49:37 | 只看该作者
未折转。把生产成本只好重做成营业成本。反正一个差!!差!!差!!上了一个大大的当!
回复 支持 反对

使用道具 举报

0

主题

1万

帖子

1万

积分

新手会员

Rank: 7Rank: 7Rank: 7

积分
14529
8#
发表于 2016-6-9 01:21:08 | 只看该作者
不好意思,支付晚了。
回复 支持 反对

使用道具 举报

0

主题

2104

帖子

2104

积分

新手会员

Rank: 7Rank: 7Rank: 7

积分
2104
9#
发表于 2016-6-10 16:00:07 | 只看该作者
基本功能有,操作有点麻烦,而且感觉工具栏快捷键不太好使,稍微多一点操作功能就好了
回复 支持 反对

使用道具 举报

0

主题

1万

帖子

1万

积分

新手会员

Rank: 7Rank: 7Rank: 7

积分
14392
10#
发表于 2016-6-11 18:31:06 | 只看该作者
客服很有耐心。用后再来追加
回复 支持 反对

使用道具 举报

高级模式
B Color Image Link Quote Code Smilies |上传

本版积分规则

QQ|»营销软件综合讨论|»营销软件有问必答|»营销软件教程专区|»营销软件POST脚本分享|»营销软件普通脚本分享|»营销软件软件资讯|»营销软件精品软件|»营销软件更新公告|营销软件|B2B软件|B2B网络软件 ( 京ICP备09078825号 )本网站开发的营销软件是一款新的网络营销软件,这款营销可以去网站软件,博客软件,B2B软件,分类信息网发贴,可以抢沙发,可以到百度文库上传WORD文档,可以到一些是相册网站自动上传图片,这个自动发帖软件自带云蜘蛛,加快收录,有6种对接打码接口,方便,效率高,速度快,而且对拖动的验证码全网第一家独家支持,全部原创技术,独家研发,正版原创带版权软件。选择万能营销软件,就选择了一种赚钱的效率,从没有被超越过,一直在努力研发新技术。放飞梦想,解放双手,来点创意,成就你的梦想,就在万能营销软件开始

map2

GMT+8, 2024-4-25 11:59 , Processed in 0.194996 second(s), 32 queries .

快速回复 返回顶部 返回列表