情感评分在AI搜索中的工作原理

当您向 ChatGPT、Perplexity 或 Gemini 询问产品类别时,这些AI引擎不仅决定是否提及您的品牌,还会决定如何在回答中定位您的品牌。一个竞争对手被描述为"功能强大的领先解决方案",而另一个则被描述为"值得考虑的备选方案"。这种差异源于情感评分:将句子转化为正面、负面或中性值的算法过程。

本指南是一次方法论深度解析。我们假设您已经了解什么是AI品牌情感 以及它为何重要——在这里,我们将打开引擎盖,深入探究模型如何从原始文本得到一个数字。

关键要点

  • 情感评分通过四步流程(预处理、特征提取、分类和聚合)为文本分配正面、负面或中性值。
  • 存在三种核心方法(基于词典、机器学习、深度学习/Transformer模型),在速度、可解释性与准确性、成本之间各有取舍。
  • 评分通常以 -1 到 +1 的极性量表、0 到 1 的概率量表表示,或聚合为 -100 到 +100 的净情感得分(NSS)。
  • 讽刺、特定领域语言、否定结构和文化差异仍然是所有方法(从基于词典到基于Transformer)的最大局限。
  • AI搜索引擎将情感与其他排名信号(E-E-A-T、时效性、权威性)结合使用,而非孤立运用——仅凭正面分数并不能保证获得有利的引用。

什么是AI搜索中的情感评分?

定义与核心概念

情感评分是分析文本并为其分配一个数值或分类值的过程,用以表示其情感基调。其目标是将一段内容对某个话题、产品、品牌或想法表达的情感归类为正面、负面或中性。

其核心是,情感评分回答一个简单的问题:这段文本是赞同、反对还是中立的?

三种情感类别为:

  • 正面: 赞许、认可、热情或赞赏的语气(例如:“这款产品绝对令人惊叹!")
  • 负面: 反对、批评、失望或不赞成的语气(例如:“糟糕的客户服务和有缺陷的功能。")
  • 中性: 客观事实、既不赞许也不反对(例如:“该产品有蓝色和黑色可选。")

情感评分广泛应用于各种数据源:客户评论、社交媒体帖子、AI生成的搜索回复和摘要、新闻文章、支持工单以及产品描述。

情感评分输出的通常是情感标签(正面/负面/中性)配合一个置信度分数(0–1 或 –1 到 +1),表示模型对该分类的确信程度。

与传统情感分析的区别

传统情感分析侧重于理解人类生成的反馈:分析客户评论、监控社交媒体对话或处理问卷调查回复。输入的是人类撰写的文本,目标是对他们所说的内容进行评分——这是一种与下文所述根本不同的评分目标。

AI搜索中的情感评分则评估完全不同的输入:AI模型本身在其生成的回复中如何描述您的品牌或产品。当 Perplexity 生成"最好的CRM软件是什么?“的回答时,情感评分衡量的是该回答对提到的每个CRM是持赞同还是批评态度——被评分的文本是机器生成的,而非人类撰写的。

  • 传统情感输入: “优秀的产品,强烈推荐!"(客户评论)→ 正面
  • AI情感输入: Perplexity 的回答:“虽然使用广泛,但该平台因定价高昂和定制能力有限而受到批评。"(生成摘要)→ 混合到负面

在机制上,无论源文本来自人类还是模型,分类的数学原理是相同的。不同的是输入流程:AI搜索情感评分必须首先从较长的生成回答中提取提及您品牌的句子或从句,然后对该摘录应用与任何其他文本相同的内容质量和语气标准进行评分。

Logo

Ready to Monitor Your AI Visibility?

Track how AI chatbots mention your brand across ChatGPT, Perplexity, and other platforms.

情感评分的工作原理

理解情感评分的机制是理解其有效性和局限性的关键。该过程包括四个主要步骤:文本摄入、特征提取、分类和聚合。

第一步:文本摄入与预处理

第一步是收集原始文本并准备分析。这可能是一篇客户评论、AI生成的回复、社交媒体帖子或新闻文章。

原始文本是杂乱无章的。它包含大小写不一致、标点符号和特殊字符、不携带意义的填充词,以及同一单词的不同形式(例如,“running”、“runs”、“ran”)。预处理会清洗和标准化这些文本,以便情感模型能够有效分析。

预处理流程通常包括:

  1. 分词: 将文本拆分为单个单词或短语(词元)。例如:“I love this product!” 变为 [“I”, “love”, “this”, “product”, “!”]
  2. 小写化: 将所有文本转换为小写以统一标准。“AMAZING” 和 “amazing” 被视为相同。
  3. 停用词移除: 移除不携带情感的常见词,如"the”、“a”、“is”、“and"等。(注意:某些模型保留这些词,因为它们可能对上下文有影响。)
  4. 词干提取或词形还原: 将单词还原为其词根形式。“Running”、“runs” 和 “ran” 都变为 “run”。
  5. 命名实体识别(NER): 识别并标记专有名词(人名、公司名、地名),使模型知道正在讨论什么。

示例: 评论"This product is absolutely amazing!“经过预处理变为:

  • 分词后:[“this”, “product”, “is”, “absolutely”, “amazing”]
  • 停用词移除后:[“product”, “absolutely”, “amazing”]
  • 词形还原后:[“product”, “absolutely”, “amazing”]

现在文本已标准化,可供情感模型处理。

第二步:特征提取与表示

预处理之后,文本需要转换为机器学习和深度学习模型能够理解的数值格式,这称为特征提取:将文本转化为数值向量(数字数组)。

存在多种特征提取方法,各有取舍:

词袋模型(BoW)和TF-IDF:

  • 创建一个向量,其中每个位置代表一个词,其值为该词出现的频率(BoW)或其重要性(TF-IDF)。
  • 优点:简单、可解释、快速。
  • 缺点:忽略词序和上下文。“I love this” 和 “this love I” 会被同等对待。

词嵌入(Word2Vec、GloVe):

  • 将每个词映射到一个稠密向量(例如300维),其中含义相近的词在向量空间中彼此靠近。
  • 优点:捕捉语义关系。“Amazing” 和 “fantastic” 在向量空间中位置相近。
  • 缺点:仍然无法捕捉长距离上下文或句子级别的含义。

上下文嵌入(BERT、RoBERTa、GPT):

  • 基于Transformer的模型,根据上下文生成嵌入。同一个词根据其用法获得不同的嵌入。
  • 优点:捕捉细微差别、讽刺和复杂含义。“I love waiting 2 hours” 会被理解为讽刺/负面。
  • 缺点:计算成本高;需要大量资源。

示例: 短语"This product is absolutely amazing!“可能被表示为:

  • BoW: [1, 0, 1, 1, 0, …, 1](词语存在/计数)
  • Word2Vec: [[0.25, -0.15, 0.88, …], [0.10, 0.92, -0.03, …], …](每个词的语义向量)
  • BERT: 理解"absolutely amazing"在此上下文中为强烈正面情感的上下文嵌入

第三步:情感分类与评分

在将文本表示为数值特征后,情感模型将其归入三种情感类别之一并生成评分。此步骤取决于所使用的具体方法——详见下文三种方法的完整对比。

输出通常是一个情感标签和一个置信度分数。例如:

  • “This product is amazing!” → 标签:正面,置信度:0.94
  • “The product is blue.” → 标签:中性,置信度:0.87
  • “Worst purchase ever.” → 标签:负面,置信度:0.96

某些系统输出一个连续的分数量表(例如,–1 到 +1,其中 –1 = 非常负面,0 = 中性,+1 = 非常正面):

  • “This product is amazing!” → 分数:+0.92
  • “The product is blue.” → 分数:0.05
  • “Worst purchase ever.” → 分数:–0.89

第四步:聚合与趋势分析

单个情感评分很少被孤立分析。相反,它们会被聚合以理解更广泛的模式。

聚合方法:

  1. 简单平均: 将所有情感评分相加并除以数量。
  2. 加权平均: 为更新、更具权威性或更突出的来源赋予更高权重。
  3. 情感细分: 计算正面、负面和中性分类的百分比(例如:“65% 正面,20% 中性,15% 负面”)。
  4. 净情感得分(NSS): 计算公式为(正面 − 负面)/ 总数 × 100。范围从 –100(全部负面)到 +100(全部正面)。

趋势分析跟踪聚合得分随时间的变化:

月份NSS解读
1+45总体正面
2+38仍为正面,但呈下降趋势
3+22正面但持续减弱

从数学角度看,这种下降趋势无论原因如何都是危险信号——聚合层不关心原因是一场公关危机还是训练数据更新,它只报告趋势。

评分方法:三种核心途径

情感评分可通过三种根本不同的方式实现,每种方式在速度、准确性、可解释性和成本方面各有取舍。

基于词典(基于规则)的情感评分

工作原理: 基于词典的情感评分使用预先构建的词汇表,其中词语被打上正面、负面或中性的标签。算法扫描文本以匹配这些词语,并根据匹配结果分配情感,同时考虑程度词(例如"非常”、“绝对”)和否定词(例如"不”、“没有”)。

示例评分:

  • “This product is amazing!” → 包含"amazing”(正面)→ 评分:正面
  • “This product is not amazing.” → 包含"not” + “amazing” → 否定翻转情感 → 评分:负面
  • “The product is blue.” → 无情感词 → 评分:中性

优点: 快速且轻量(无需机器学习)、可解释且透明(您能看出为何分配该分数)、无需训练数据、对简单直接的情感效果良好。

缺点: 错过上下文和细微差别(“I love how this product doesn’t work"是讽刺,但词典看到的是"love”)。无法处理特定领域语言——在平价品类中,“cheap"是正面含义;在奢侈品中则是负面含义。难以处理复杂的混合情感句子,且需要手动维护词典。

最适合: 对直接文本进行快速情感分析,速度比完美准确性更重要的场景。

基于机器学习的情感评分

工作原理: 机器学习模型在带标签的文本示例(正面、负面、中性)上进行训练,学习识别指示情感的规律。常见算法包括朴素贝叶斯(概率性,假设词之间独立)、支持向量机(寻找情感类别之间的最优决策边界)和逻辑回归(预测各类别的概率)。

训练过程:收集数千个带标签的示例,提取特征(TF-IDF 或词嵌入),训练模型学习特征与标签之间的关系,然后在未见过的数据上测试以评估准确性。训练完成后,模型可以对从未见过的文本进行分类。

优点: 比基于词典的方法更好的上下文感知能力、自动学习模式(无需手动维护词典)、在基准数据集上通常达到80-90%的准确率、可针对特定领域进行微调。

缺点: 需要带标签的训练数据(创建成本高)、比基于规则的方法可解释性差、可能延续训练数据中存在的偏见、在领域外文本上性能下降。

最适合: 对准确性有要求且可获取带标签训练数据的生产系统。

深度学习与基于Transformer的评分

工作原理: 深度学习模型使用神经网络学习文本中复杂的非线性模式。目前最强大的方法是使用Transformer——一种擅长理解语言的神经架构——流行模型包括BERTRoBERTa和基于GPT的分类器。

这些模型能够理解上下文(同一个词在不同句子中有不同含义)、长距离依赖、语义含义,以及——关键地——讽刺和细微差别。BERT可以区分 “This product is amazing!"(正面)、“I love how this product doesn’t work."(讽刺性负面)和 “The product is blue, and the customer service is terrible."(混合,依赖方面的情感)。

优点: 最先进的准确性(在基准数据集上达94-96%)、理解细微差别和讽刺、可获取预训练模型(无需从零开始训练)、跨语言和跨领域适用。

缺点: 计算成本高(需要GPU/TPU)、推理速度慢于基于规则或简单ML模型、可解释性差(“黑箱”)、在边缘情况下仍可能犯错。

最适合: 对准确性要求高的关键应用,且具备计算资源——目前大多数AI搜索情感评分和品牌声誉监控都运行在这类模型上。

评分量表:从 –1 到 +1(及更广)

情感评分在不同的系统中使用不同的量表。理解这些量表对于正确解读结果至关重要。

量表范围解读
极性分数–1 到 +1–1 = 非常负面;0 = 中性;+1 = 非常正面
概率分数0 到 10 = 非常负面;0.5 = 中性;1 = 非常正面
置信度分数0 到 1分类的确信程度(0 = 不确定;1 = 确信)
百分比0% 到 100%正面情感百分比(0% = 全部负面;100% = 全部正面)

示例解读: +0.85 = 强烈正面;+0.45 = 弱正面或偏中性;0.02 = 接近中性;–0.60 = 中等负面;–0.95 = 非常强烈的负面。

分类评分分配一个离散标签(正面/负面/中性)——简单且可解释,但丢失了细微差别。连续评分在量表上分配一个数值,允许精细分层,更适用于趋势分析和聚合。混合方法(在实际中最有用)同时分配标签和置信度分数,例如:“The product is okay.” → 标签:中性,置信度:0.72。低置信度分数(例如0.55)表示情感模糊或混合,可能需要人工审查。

多维情感评分

除了简单的正面/负面之外,高级系统还增加了情感检测(喜悦、愤怒、沮丧、失望)、基于方面的情感(分别对特定方面评分——“功能出色,但价格太高"得出功能 = +0.85,价格 = –0.70,整体 = 混合)和强度评分(情感的强烈程度:“我喜欢这个” vs “我非常喜欢这个”)。尤其是基于方面的评分比单一的总体分数更具可操作性,因为它告诉您数字背后的原因,而不仅仅是正负符号。

作为AI搜索排名信号的情感

情感评分正日益融入AI搜索引擎评估和排名来源的方式中。在机制上,它分为三个步骤:

  1. 来源评估: 当AI引擎遇到一个来源(文章、评论、产品页面)时,会对其内容进行情感评分。正面、平衡的情感表明内容质量高。
  2. 收录决策: 该来源是否应在AI生成的摘要中被引用?情感有助于决策——高度负面的来源可能被排除,除非它提供重要的反面论点。
  3. 排名与措辞框架: 具有正面情感(尤其是结合高权威性)的来源排名更高,并获得更热情的语言描述。具有负面情感的来源仍可能被引用,但会附带条件性说明(“然而,一些用户反映……")。

情感并非单独排名。它与E-E-A-T(经验、专业度、权威性、可信度)、时效性参与度指标主题权威性结合,形成完整的排名图景。简化版的组合公式如下:

最终排名分数 =(情感 × 0.20)+(E-E-A-T × 0.30)+(时效性 × 0.15)+(参与度 × 0.20)+(权威性 × 0.15)

这个公式的实际含义是:来自低权威来源的高情感分数,其排名仍然低于来自权威性强来源的较低情感分数;而具有负面情感的高度权威来源可能仍会排名,但会附带条件性说明。权重配置也是为什么情感评分更多地塑造来源被描述的有利程度,而非单独决定其是否被引用——模型不仅需要决定是否收录每个候选来源,还需要决定如何有利地呈现它们。

工作示例:计算净情感得分

为了让计算更具体,以下展示如何从原始提及次数计算出净情感得分。假设一家软件公司对三个竞争性CRM平台在100个ChatGPT回答(针对"哪款CRM最适合小企业?")中的描述进行评分:

CRM正面中性负面NSS = (正 − 负) / 总数 × 100
CRM A453010(45−10)/85 × 100 = +41
CRM B255015(25−15)/90 × 100 = +11
CRM C354020(35−20)/95 × 100 = +16

需要注意的是,在某些实现中,NSS按惯例将中性类别排除在分母之外,而在其他实现中则包含在内——这正是方法细节上的差异,使得来自不同工具的两个NSS数字无法直接比较,除非您了解其底层公式。CRM A的正面提及数量更高、负面提及更少,使其得分远高于其他两者,这最终会转化为ChatGPT回答中的措辞差异(“领先的解决方案” vs “值得考虑的备选方案”)。

情感评分的挑战与局限

情感评分功能强大,但并非完美。五种局限性在所有三种方法中都存在,程度递减但永远不会归零:

  • 上下文与讽刺: “I love waiting 2 hours for customer support”——基于词典的模型看到"love”(正面)而错过讽刺;即使是ML模型也可能难以识别。深度学习模型因能理解上下文而更好,但边缘情况仍会出错。
  • 特定领域语言: 同一个词在不同领域带有不同情感——“cheap"在平价品类中是正面的,在奢侈品中则是负面的;“simple"对用户界面是正面的,但在描述功能深度时则是负面的。在通用文本上训练的模型无法捕捉这一点,除非进行特定领域的微调。
  • 否定与修饰词: 否定翻转情感(“not bad” ≠ “bad”),修饰词改变强度(“slightly” vs “very disappointed”)。“功能好,但支持差"是真正的混合情感——基于词典的方法在此处最难应对;基于方面的评分则处理得最好。
  • 混合情感与中性灰色区域: “设计精良、价格实惠,但功能不如竞品丰富”——正面还是负面?置信度分数0.55恰好表明这种模糊性,低置信度预测应标记为需要人工审查,而非直接采信。
  • 语言与文化差异: 表情符号的隐含意义、表达直白程度、习语和礼貌规范都因文化而异。在英语文本上训练的模型在没有适配的情况下无法很好地应用于其他语言——在多样化数据上训练的多语言模型是标准的缓解措施。
  • 模型偏见: 主要在主流品牌评论上训练的模型可能系统性地误判较小或少数族裔品牌的所有权评论,或者根据关联的实体而对相同的文本给出不同的评分。按人群审查性能、使用多样化训练数据,以及让人类参与边缘情况的判断是标准的缓解措施——没有任何模型是完全没有偏见的。

选择与验证评分方法

三个考量因素决定三种方法(词典、ML、深度学习)中哪一种适合给定系统:速度(实时处理 vs. 批量处理)、准确性要求(锦上添花 vs. 业务关键)和可用资源(词典无需任何资源;深度学习需要GPU/TPU能力,并理想情况下需要特定领域的微调数据)。

无论选择哪种方法,时间上的一致性才能使趋势比较有效。在分析中切换模型、工具或提示会破坏前后数据的可比性——“情感提升了20个点"如果测量方法也随之改变,就毫无意义。这是一个纯数学约束,而非流程建议:用方法A计算的NSS和用方法B计算的NSS并非同一单位,即使它们恰好共享同一个量表。

情感评分也是一个信号,而非绝对真理。标准的验证循环是:抽样一组经过评分示例,由人类独立对同一组进行分类,然后测量一致率。如果一致率低于大约85%,则很可能需要针对该特定领域重新审视模型或其特征提取步骤。

结论

情感评分是AI搜索引擎、传统搜索算法和内容分析系统评估和排名信息的基础机制。理解其工作原理——从文本预处理到特征提取、分类再到聚合——可以解释为什么两个不同的工具可能对同一品牌提及报告出不同的数字,以及为什么原始情感标签不如分数、置信度和背后的方法论更有用。

三种核心方法(基于词典、机器学习、深度学习)在速度、成本和可解释性与准确性之间各有取舍。挑战——讽刺、特定领域语言、否定、混合情感和模型偏见——在所有三种方法中都存在,程度递减但永远不会归零。

如果您想了解更宏观的背景——为什么AI情感对于品牌在AI搜索中的可见度如此重要——请从什么是AI品牌情感及其重要性 开始。如果您想将此方法论应用于具体的监控流程,请参阅逐步情感跟踪操作手册 。如果您正在评估是手动评分、购买平台还是自建流程,请参阅如何选择AI情感跟踪工具

Frequently asked questions

Arshia 是 FlowHunt 的 AI 工作流工程师。凭借计算机科学背景和对人工智能的热情,他专注于打造高效的工作流程,将 AI 工具融入日常工作,从而提升生产力与创造力。

Arshia Kahani
Arshia Kahani
AI Workflow Engineer

查看您品牌在各AI平台上的情感评分

Am I Cited 对您的品牌在 ChatGPT、Perplexity 和 Google AI Overviews 中的每次提及进行情感评分,让您不仅获得原始文本,还能看到标签和分数。

Learn more

AI情感差异
AI情感差异:衡量AI平台上的品牌认知

AI情感差异

了解什么是AI情感差异以及它对品牌声誉的重要性。发现如何衡量并监控AI回答与传统搜索结果之间的品牌情感差异。

1 min read
AI 口碑修复
AI 口碑修复:提升 AI 回应中品牌情感的技术

AI 口碑修复

了解如何识别并修复 AI 生成答案中的负面品牌情感。探索提升 ChatGPT、Perplexity 和 Google AI Overview 描述您品牌方式的技巧,包括内容优化、情感监测与竞争力基准对比策略。...

1 min read
竞争性情感对比
竞争性情感对比:AI 如何描述您的品牌与竞争对手

竞争性情感对比

了解 AI 系统如何描述您的品牌与竞争对手。理解情感差距、衡量方法,以及 AI 驱动搜索中品牌声誉的战略影响。

2 min read