信息网络安全 ›› 2014, Vol. 14 ›› Issue (9): 17-21.doi: 10.3969/j.issn.1671-1122.2014.09.004
王明元, 贾焰, 周斌, 黄九鸣
WANG Ming-yuan, JIA Yan, ZHOU Bin, HUANG Jiu-ming
摘要: 对微博话题的立场进行精确研判是短文本挖掘的重点之一。文章提出了一种基于主题相关性对微博分类研判的方法,旨在识别网民对于微博话题的立场,是支持还是反对。微博和主题的相关性大小,常常会导致其文本特征有较大差异。文章首先利用关键词提取技术和互信息计算方法获取话题主题词集,接着对话题语料按是否与主题相关进行分类,然后分别采用机器学习和词典规则两种方法进行研判,综合得到话题的立场。实验结果表明,主题相关文本采用机器学习而主题无关文本采用词典规则的方法可以大大提高研判准确率。以此为基础,文章构建了一个微博话题立场研判模型,可用于政府有关部门监测互联网舆情以及企业评估产品市场等方面。