摘 要:以网络评论为研究对象,试图把隐马尔科夫模型从已经成功应用的模式识别领域推广到语义倾向性分析系统。与传统倾向性识别系统不同的是,此理论通过建立隐马尔科夫分类模型,将未知文本进行状态序列化,得到文本中所有的词语所对应的倾向性,然后选定多数词的倾向性来作为文本的总体语义倾向。实验表明,当训练数据越全面、规模越大时,识别率越高。
关键词:语义倾向性;隐马尔科夫模型;序列化
网络媒体被公认为是继报纸、广播、电视之后的“第四媒体”,成为反映社会舆情的主要载体之一。人们希望能快速高效地在浩如烟海的网络信息中提取对于诸如人物、事件、传媒、产品等有价值的评价信息。如何有效地提取文本信息,推断其语义倾向,已经成为当前自然语言与信息安全研究领域的热点问题[1]。
当前流行的语义倾向性分析系统可以分为两个步骤:首先是识别词汇的语义(短语)倾向性[2],然后利用不同的策略根据词汇(短语)的倾向性给出整个文本的语义倾向评价。目前主要有三种研究思路:(1)对所有词汇的倾向性评分进行统计求和,根据最终的得分正负来评价文本的倾向性[3]。(2)采用机器学习的方式根据词汇的倾向性训练出语义倾向分类器[4],这是目前比较流行的思路,总体效果比统计求和要好。这两种思路是基于概率统计的,领域性限制小。(3)基于“格语法”分析的思路。该思路很难全面反应样本空间规律,具有一定的领域限制性。
本文利用隐马尔科夫模型HMM(Hidden Markov Models)在文本处理方面的优势,首先对其理论进行介绍,然后根据现有学者对HMM在文本分类中的应用和文本分类技术在倾向性分析中应用的研究结果,提出将HMM应用于文本倾向性研究的理论,并用实验证明此理论的可行性。
1 理论基础
1.1 隐马尔科夫模型
隐马尔可夫模型[5]作为一种统计模型,非常适合处理时变信号,用于动态过程时间序列建模并具有强大的时序模式分类能力,理论上可处理任意长度的时序。HMM是一个双重随机过程,其中之一是Markov链,其基本随机过程为描述状态的转移;另一个随机过程描述状态与观察值之间的统计对应关系,只能看到观察值,而不能看到状态,即通过一个随机过程去感知状态的存在及其特性。
1.2 HMM在文本分类中的应用
罗双虎[6]把待分类文本描述成一系列状态演化的隐Markov过程,其中状态以特定的概率产生代表文本的特征项。用序列模式来描述文本类,文本序列通过与隐Markov模型的匹配,求出其对应状态序列和最大输出概率,以比较各个文本类的结果,达到文本分类的目的。
龙丽君[7]对关键字所在的句子构成的词序列建立HMM,以判断句子所属的类别。为了建立HMM,将词语所属的类别理解为状态,将所选择的关键字理解为输出值。这样就把要判定一个观测序列(一个句子)的整体所属的类别转换为己知模型和观测序列,求出全局最优的整体序列。观测序列的整体所属类别即为关键字所属类别,或者说观测序列的整体类别即为状态序列中居多数的状态对应的类别。
1.3 文本分类技术在倾向性分析中的应用
1997年,Hatzivassiloglou和McKeown尝试使用监督学习的方法对词语进行语义倾向判别,通过对训练语料的学习进行语义倾向判别,准确率约82%,在加入篇章中形容词之间的接续信息后,准确率提升到约90%[2]。2003年,Turney在其论文[8]中提出了利用统计信息对单词进行语义倾向判断的新方法。文本的语义倾向判别也可被看作一个褒贬的分类问题,因此,文本分类中的方法同样被应用到了语义倾向判别研究中。
2 HMM在语义倾向性研究的应用