%0 Journal Article %A 任禾 %A 曾隽芳 %T 一种基于信息熵的中文高频词抽取算法 %D 2006 %R %J 中文信息学报 %P 42-45,92 %V 20 %N 5 %X 为扩展分词词典,提高分词的准确率,本文提出了一种基于信息熵的中文高频词抽取算法,其结果可以用来识别未登录词并扩充现有词典。我们首先对文本进行预处理,将文本中的噪音字和非中文字符转化为分隔符,这样文本就可以被视为用分隔符分开的中文字符串的集合,然后统计这些中文字符串的所有子串的相关频次信息,最后根据这些频次信息计算每一个子串的信息熵来判断其是否为词。实验证明,该算法不仅简单易行,而且可以比较有效地从文本中抽取高频词,可接受率可达到91.68%。 %U http://jcip.cipsc.org.cn/CN/abstract/article_2039.shtml