情感倾向分析回答的是舆论以什么态度看待一件事,正面、负面与中性三类划分构成舆情报告中最常见的态度描述。三类标签看似简单,实际判断中的边界并不清晰:同一句话换个语境,倾向可能完全改变;同一段文字里,对不同对象的态度还可能相互矛盾。情感判断的准确程度直接影响后续态势研判的方向,其边界问题因此值得专门讨论。
正面倾向的主要陷阱在于反讽。网络表达中,字面的赞扬经常承担实际的批评功能,"处理得真及时"一类语句在特定语境下传递的是完全相反的态度,仅凭词汇的正负属性无法识别这种倒置。负面倾向的难点则是层次混杂:对具体事件处理方式的批评、对某政府部门整体工作的质疑、与事件本身无关的情绪宣泄,三者在情感读数上同为负面,其含义与所需要的研判关注却差别明显,不加区分地统计会把性质不同的声音压进同一个数字。以涉及某政府部门的话题为例,针对具体办事流程的抱怨与针对部门整体的否定在自动统计中无法区分,研判含义却完全不同。中性类别的问题最容易被忽视,大量中性表达只是陈述事实或转述信息,看似不携带态度,但其中一部分实际扮演着议题设置的角色,持续转述某类事实本身就是一种立场的表达;另有相当比例的中性内容处于态度形成过程之中,属于潜在的倾向转化对象。三类各自的边界模糊地带说明,情感标签之间的分界并不是语言表面的属性,而需要从表达与语境的关系中去辨认。
从操作方法看,情感判断需要以态度指向为准,而不能只依据词汇色彩。一句话的情感归属,取决于它评价的对象与所持的立场,"措施出台很快"指向效率时可能是正面,同一发言者紧接着质疑措施内容时,整体倾向就需要重新评估,多对象、多层次的表达无法用一个标签概括。语境依赖是另一项需要正视的条件,相同的措辞在不同事件中承载不同态度,流行语的含义还会随时间漂移,数月前的褒义用法在当下可能已成调侃,判断依据因此需要保持更新。比例解读同样存在边界问题:负面占比上升固然值得关注,中性占比的变化却往往包含更多信息,一个中性比例长期偏高的话题可能处于观望积累阶段,其走向取决于后续信息的性质,而不取决于当前态度的静态分布。情感比例与热度数据的交叉观察常常提供额外信息,负面占比高但传播量低的话题,与负面占比相近却高速扩散的话题,研判含义并不相同。这些边界情形提示,情感倾向在报告中以分布形式呈现比单点结论更为稳妥,正面、负面、中性各自的占比及其变化方向,比一句笼统的舆情偏负面判断保留了更多可供决策参考的信息。
在分析系统中,情感识别依赖对大规模文本的自动处理,其稳定的方面在于口径一致、覆盖完整,上万条评论可以在同一套标准下完成分类,人工难以承担的规模问题由此得到解决。自动判断的失效点同样具体:反讽语句会被按字面归入正面,新出现的网络表达在规则更新前得不到识别,一句话同时褒贬多个对象时,情感归属可能张冠李戴。这三类偏差在高热度内容上造成的影响最大,越是传播广泛的表达,越可能使用反讽、隐喻等非常规修辞。针对这些具体环节,人工校验有明确的介入位置:对热度排序靠前的内容逐条复核,对自动分类结果按比例抽检,发现的系统性偏差再反馈到识别规则的调整之中。校验样本的选择也有讲究,仅复核系统判定为高置信度的内容会遗漏反讽集中的区域,高热度与高争议的内容应进入必查范围。蚁坊软件的舆情分析服务将情感倾向作为基本分析维度,报告中以分布与变化呈现情感数据,并对统计口径作出说明。情感判断由此处于一种持续的校准状态,系统的规模处理能力与人工的语境理解各自作用于不同环节,边界在哪一侧失效,校正就在哪一侧发生。
总体来看,情感倾向的三分法是一种工作性的简化,其价值取决于分析者对边界的清醒程度,知道标签在哪里失效,判断才有可靠的起点。随着网络表达方式持续翻新,情感识别的口径需要不断调整,分析方法与表达现实之间的这种追赶,在可以预见的时间内仍将是一个常态。
(部分文字、图片来自网络,如涉及侵权,请及时与我们联系,我们会在第一时间删除或处理侵权内容。电话:4006770986 负责人:张明)