站长基础说说之百度的三种中文分词技术【微发信息网】
推广 热搜: 广州  SEO  贷款  深圳    医院  用户体验  网站建设  贵金属  机器人 

站长基础说说之百度的三种中文分词技术

   日期:2018-10-03 02:36:02     来源:互联网    作者:微发信息网    浏览:13    评论:0    
核心提示:中文分词技术是搜索引擎对于用户提交查询的关键词,搜索引擎用中文分词把词按照一定的规格,将一个长尾词分割成几个部分,从而概
 中文分词技术是搜索引擎对于用户提交查询的关键词,搜索引擎用中文分词把词按照一定的规格,将一个长尾词分割成几个部分,从而概括一段话的主要内容,让用户能更快速度的找到想要的内容。
中国IDC圈7月21日消息:中文分词技术是搜索引擎对于用户提交查询的关键词,搜索引擎用中文分词把词按照一定的规格,将一个长尾词分割成几个部分,从而概括一段话的主要内容,让用户能更快速度的找到想要的内容。
搜索引擎最常用的几种分词方法有三种:
一、字符串匹配的方法;(字符串匹配的分词一般为3种:1.正向最大匹配法;2.逆向最大匹配法;3.最少切分)
二、理解分词方法;
三、统计分词方法。
字符串匹配方法:在百度中搜索“我喜欢玩宠物连连看”而在百度排名第一位的是http://cn.yixiin.com/news/以标题和搜索的长尾词相符合,说明在网站条件相当的情况下,先显示标题匹配的网页。这样文章标题中的长尾是在排名中非常重要的。而在百度第二页“我喜欢玩宠物连连看”用百度快照查看,很显然长尾词已经被分成“我喜欢,玩,宠物连连看”而在外后已经被分成:“我,喜欢玩,宠物,连连看”,这种匹配方法是最少切分方式。
理解分词方法:当输入的字符串中包含≤3个中文字符的话百度分词就会直接接到数据库索引词汇;而当字符串长度》4个中文字符的时候,百度中分词会会把这个词分成若干个字符。如:百度搜索“电动车”。
统计分词方法:相邻的字同时出现的次数越多,中文分词就会可能把出现相邻的字当成你一个词。例如在百度中输入一个字符“网”而在下面百度也把“网站”标红了,这样可以看得出“网”与“站”这两个字符相邻出现的次数非常多,统计分词已经把“网站”纳入了词库。
对于百度中文分词的理解:
中文分词中强调一点:“按照不同长度优先匹配的情况,可以分为最大(最长)匹配和最小(最短)匹配”;长尾词在文章中的间距也是决定文章排名的因素。如:“我喜欢玩宠物连连看”在百度第十三页的时候已经被分词成“我,喜欢,玩,宠物,连连,看”
全字匹配得到的词的权重会高于分开的词的权重。http://cn.yixiin.com/
根据自己的观察现在百度大部分都是使用的是正向匹配。
百度分词对于一句话分词之后,还会去掉句子中的没有意义的词语。
 
免责声明:以上所展示的信息由网友自行发布,内容的真实性、准确性和合法性由发布者负责。微发信息网对此不承担任何保证责任。任何单位或个人如对以上内容有权利主张(包括但不限于侵犯著作权、商业信誉等),请与我们联系并出示相关证据,我们将按国家相关法规即时移除。

本文地址:http://www.wlchinahc.com/news/SEOyouhua/201810/43369.html

打赏
 
更多>同类资讯
0相关评论

推荐图文
推荐资讯
点击排行

网站首页  |  付款方式  |  关于我们  |  联系方式  |  使用协议  |  版权隐私  |  网站地图  |  排名推广  |  广告服务  |  积分换礼  |  RSS订阅  |  违规举报  |  粤ICP备11090451号
免责声明:本站所有信息均来自互联网搜集,产品相关信息的真实性准确性均由发布单位及个人负责,请大家仔细辨认!并不代表本站观点,微发信息网对此不承担任何相关法律责任!如有信息侵犯了您的权益,请告知,本站将立刻删除。
友情提示:买产品需谨慎
网站资讯与建议:3123798995@qq.com 客服QQ:3123798995点击这里给我发消息3123798995点击这里给我发消息