亚洲综合社区欧美综合色-欧美逼逼一区二区三区-国产老熟女高潮精品网站-国产日韩最新视频在线看

始創(chuàng)于2000年股票代碼：831685

咨詢熱線：0371-60135900 注冊(cè)有禮登錄

掛牌上市企業(yè)
60秒人工響應(yīng)
99.99%連通率
7*24h人工
故障100倍補(bǔ)償

全部產(chǎn)品

您的位置：網(wǎng)站首頁(yè) > 幫助中心>文章內(nèi)容

文章內(nèi)容

淺談中文搜索引擎的分詞原理

發(fā)布時(shí)間: 2012/9/17 14:51:20

了解百度分詞技術(shù),對(duì)于我們標(biāo)題的寫法是很重要的。我們知道,百度中文分詞算法是指搜索引擎為了更好的辨別用戶的需求，并且為了快速提供給用戶需求性信息而使用的算法。要在單位時(shí)間內(nèi)處理千萬(wàn)億級(jí)的頁(yè)面數(shù)據(jù)量，因此搜索引擎擁有一個(gè)中文詞庫(kù)。比如百度現(xiàn)在大約有9萬(wàn)個(gè)中文詞，那么搜索引擎就可以對(duì)千億級(jí)的頁(yè)面進(jìn)行分析，按照中文詞庫(kù)進(jìn)行了分類。中文分詞基于以下三個(gè)原理:

一、完全匹配。比如搜索“圖書館”。

二、高度匹配。比如搜索“圖書館標(biāo)準(zhǔn)”。

三、模糊匹配。比如搜索“中國(guó)圖書館標(biāo)準(zhǔn)”。

另外，分詞原理：一些專有詞是不可分割的，比如杰出人物（如：周恩來(lái)），明星（如：劉德華），檢索量大的詞（如：買票難）。
這些只是百度中文分詞原理的一部分。以上只是對(duì)百度分詞技術(shù)看法，百度算法是不可能透露出來(lái)，所以以上并不一定是對(duì)的。

本文出自：億恩科技【1tcdy.com】

服務(wù)器租用/服務(wù)器托管中國(guó)五強(qiáng)！虛擬主機(jī)域名注冊(cè)頂級(jí)提供商！15年品質(zhì)保障！--億恩科技[ENKJ.COM]

上一篇 >> 百度識(shí)別偽原創(chuàng)的方法有哪些
下一篇 >> 2011年云計(jì)算在線應(yīng)用誰(shuí)將最給力？

同類文章

您可能在找

域名購(gòu)買

服務(wù)器托管/租用

虛擬主機(jī)

億恩云建站

億恩北京公司：

經(jīng)營(yíng)性ICP/ISP證：京B2-20150015

億恩鄭州公司：

經(jīng)營(yíng)性ICP/ISP/IDC證：豫B1.B2-20060070

億恩南昌公司：

經(jīng)營(yíng)性ICP/ISP證：贛B2-20080012

服務(wù)器/云主機(jī) 24小時(shí)售后服務(wù)電話：0371-60135900

虛擬主機(jī)/智能建站 24小時(shí)售后服務(wù)電話：0371-60135900

專注服務(wù)器托管17年

掃掃關(guān)注-微信公眾號(hào)

0371-60135900

Copyright© 1999-2019 ENKJ All Rights Reserved 億恩科技版權(quán)所有　地址：鄭州市高新區(qū)翠竹街1號(hào)總部企業(yè)基地億恩大廈　法律顧問(wèn)：河南亞太人律師事務(wù)所郝建鋒、杜慧月律師

京公網(wǎng)安備41019702002023號(hào)

億恩公告

在線客服

服務(wù)器托管
服務(wù)器租用
云服務(wù)器
域名/空間
云建站

0371-60135900
7*24小時(shí)客服服務(wù)熱線