第一站 - 轻松上网从此开始!

上网第一站

当前位置: > SEO >

百度如何判断网页文章的重复度

时间:2016-05-26 17:07来源:A5创业网 作者:跌名 点击: 我来投稿获取授权
以下内容来自网络或网友投稿,www.swdyz.com不承担连带责任,如有侵权问题请联系我删除。投稿如果是首发请注明‘第一站首发’。如果你对本站有什么好的要求或建议。那么都非常感谢你能-联系我|版权认领
在这个科技高度发达的时代,百度已经成为人们能获取消息的主要途径。但如今的百度,到处充斥着一些重复的内容,对用户的访问造成很大的困扰。因此,百度需要对网页重复进行判断,对

  在这个科技高度发达的时代,百度已经成为人们能获取消息的主要途径。但如今的百度,到处充斥着一些重复的内容,对用户的访问造成很大的困扰。因此,百度需要对网页重复进行判断,对重复的网页,只选取一些高质量的我那工业,共用户浏览。然而,现有技术中一般是通过比较两个页面的内容和借点,来确认两个页面的相似度。

u=1429713172,1272127219&fm=21&gp=0

  这种方法能够计算的比较准确,可时间复杂度太高,计算很费时间。通过对一个页面中的某些重要信息进行签名,然后比较两个页面的签名,来计算相似度,这种方式比较简单高效,计算速度比较快,比较适合百度这种海量信息的应用场景。

  1,网站重复内容的判断

  A,获取多个网页;

  B,分别提取网页的网页正文;

  C,从网页正文中提取一个或多个句子,并根据一个或多个句子计算网页正文句子签名;

  D,根据网页正文句子签名对多个网页进行聚类;

  E,针对每一类下的网页,计算网页的附加签名;

  F,根据附加签名判断每一类下的网页是否重复。

  通过上述方式,网页重复的判断系统及其判断方法通过包括网页正文句子签名在内的多维度签名有效且快速地判断网页是否重复。

广告图

  网站页面基本架构

  提取正文

  A,对网页进行分块;

  B,对分块后的网页进行块过滤,以获取包含网页正文的内容快;

  C,从内容块中提取网页正文。

  正文分句

  A,对网页正文进行分句;

  在本步骤中,可利用分号,句号,感叹号等表示句子完结的标志符号来对网页正文进行分句。此外,还可以通过网页正文的视觉信息来对网页正文进行分句。

  B,对分句后的网页正文进行过滤及转换;

  在步骤中,首先过滤掉句子中的数字信息;版权信息以及其他对网页重复判断不起决定性作用的信息。随后,对句子进行转换,例如,进行全角/半角转换或者繁体/简体转换,以使得转换后的句子的格式统一。

  C,从过滤及转换后的网页正文中提取最长的一个或多个句子;

  在本步骤中,过滤及转换后的网页正文提取出最长的一个句子或者做场的预定数量连续句子的组合。例如,某个网页实例中,经过过滤及转换后的某段最长,远超其他句子,因此可选择该段为网页正文句子,或者选择最长的连续句子组合作为网页正文句子。

  D,对一个或多个句子进行hash签名运算,以获取网页正文句子签名。

  simhash算法就是比较各网页的附加签名是否相同或相似来判断网页是否重复。具体来说,在比较利用simhash签名运算获得的网页正文签名时,比较网页正文签名的不同位数,不同位越少,表示网页重复的可能性越高,在比较其他的附加签名时,若附加签名相等,表示网页在该纬度上重复。

  总结:

  1、两个网页的真实标题签名相同。

  2、两个我那工业的网页内容签名相同。

  3、两个网页的网页正文签名的不同位数小于6.。

  4、两个网页的网页位置签名相同,并且url文件名签名相同。

  5、评论块签名、资源签名、标签标题签名、摘要签名、url文件名签名中有三个签名相同。

  附加信息整站判断重复标准:

  通过两两页面比较,可以得到真重复url的集合。一般来说,如果这个真重复url集合中的网页的数量/整个网页集中网页的数量大于30%,则认为整个网页集都是真重复,否则就是假重复。

责任编辑:chenlong666
作者:涪陵之窗

延伸阅读:

关键词:

如何应对百度广告位消减的后推广策略

百度贴吧加速商业化:必须平衡好用户体验

悟空保获1亿元pre-A轮融资 凤凰祥瑞领投、风云天使跟投

支付宝否认将冻结不绑大陆银行卡账户 称可多种方式实名验证

“视频+电商” 如何玩转网红经济?

图文推荐

 

央视:病毒通过360免杀认证 点击后支付宝被盗

不拼颜值拼才华的新一代网红,真的迎来资本春天吗

“e租宝”案侦破进展:已有18万投资人登记信息

蔡文胜:世界互联网只有两个半市场中国、美国和半个印度

互联网到底有多大?美媒:已知网页至少46亿个

Facebook入华唯一之路:境内服务器、合资及内容审查

古巴、朝鲜、伊朗 互联网在这些国家是怎样的存在

垂直招聘竞争更加激烈 拉勾网融资2.2亿备粮草

雷军程序人生:编程工作和石匠相似 是体力活

起底骗贷黑色产业链:1万可骗贷千万?

艺术家、偏执狂、产品教父他做了一款APP解决1745万人就业

了了青年李一男:是什么导致了他神话的破灭?

Airbnb的生意越来越好 它究竟是怎么抓住用户的?

阿里持股神州专车迷局:到底有还是没有?

揭秘地推扫码:扫成一个可得5元 有人月入过万

微信已经没有竞争对手——除了QQ原来无敌也是一种寂寞

 

专题推荐 更多 >

晒沙发照片 赢精美礼品

微信应用号前瞻

互联网创业败局

移动支付 群雄四起难称霸

信息推荐

文章推荐

百度如何判断网页文章的重复度

社区运营的3大要点:用户、内容、机制

百度如何判断网页文章的重复度

十大H5制作平台横评体验,H5小白上手必备!

百度如何判断网页文章的重复度

99%的站长不会写软文 你真的会吗

百度如何判断网页文章的重复度

想让你的网站logo出现在百度快照的左侧吗?

百度如何判断网页文章的重复度

6 个月内实现用户翻番,Expensify 是如何做...

百度如何判断网页文章的重复度

腾讯产品经理:真正的运营就是直面人的七情...

分类排行榜

1百度捞钱新品-URL定向推广开始内测

2如果百度竞价排名取消了 会怎么样

3A5营销:不同行业的网站是如何做排名的!

4为什么有的SEO,做了3年,还是没有流量

5巧用百度经验做推广的几种新方法

6百度排名机制变了 更多的还是机会

72016年SEO从业者必备知识要点归纳总结

8A5营销:初入新手村,SEO基础培训课程

92016新站SEO方案(纯干货)

10企业做好SEO了吗? 谈到网络营销就不得不说的SEO优化那些事

专栏文章更多>

把握青春脉搏 教你玩转APP校园推广  

作者:苗元威

自媒体常见的7大误区 成不了大咖别怪我没告...  

作者:

这13个微信运营NB技巧,老板用了都说好!  

作者:木木博客

2016年互联网行业草根的机会和行业有哪些?  

作者:朱海涛

58到家买了嘟嘟美甲,一场“奇葩”的合并?  

作者:王吉伟

服务推荐

(责任编辑:admin)

织梦二维码生成器
顶一下
(0)
0%
踩一下
(0)
0%
------分隔线----------------------------
发布者资料
第一站编辑 查看详细资料 发送留言 加为好友 用户等级:注册会员 注册时间:2012-05-22 19:05 最后登录:2014-08-08 03:08
栏目列表
推荐内容
分享按鈕