%0 Journal Article
%A 任禾
%A 曾隽芳
%T 一种基于信息熵的中文高频词抽取算法
%D 2006
%R 
%J 中文信息学报
%P 42-45,92
%V 20
%N 5
%X 为扩展分词词典,提高分词的准确率,本文提出了一种基于信息熵的中文高频词抽取算法,其结果可以用来识别未登录词并扩充现有词典。我们首先对文本进行预处理,将文本中的噪音字和非中文字符转化为分隔符,这样文本就可以被视为用分隔符分开的中文字符串的集合,然后统计这些中文字符串的所有子串的相关频次信息,最后根据这些频次信息计算每一个子串的信息熵来判断其是否为词。实验证明,该算法不仅简单易行,而且可以比较有效地从文本中抽取高频词,可接受率可达到91.68%。
%U http://jcip.cipsc.org.cn/CN/abstract/article_2039.shtml