情感分析这个词有点误导性。大部分工具做的是「这条评论是正面还是负面」——这个结论你扫一眼就知道,不需要工具。
真正值钱的是从情绪里剥出事实。买家说「质量太差了,气死我了」,情绪是愤怒,事实是什么?不知道。得继续往下挖。

一、三层拆解:情绪 → 事实 → 根因
1.1 第一层:情绪归类
这一步最简单,也最没价值。正面、负面、中性,工具几秒钟跑完。它的用处是筛选,不是结论。
1.2 第二层:从事实到问题点
买家说的具体是什么事?
| 情绪表达 | 剥离后的问题点 |
|---|---|
| 「质量太差了」 | 用了三天就开裂 |
| 「不值这个价」 | 尺寸比预期小 |
| 「物流太慢」 | 下单后 12 天才到 |
| 「一般般」 | 功能和描述一致,但没惊喜 |
剥离情绪的关键动作:把评价性形容词还原成具体事件。 让工具做这件事的指令是:「把以下评论中的评价性表述还原为具体事实描述,保留所有数字、时间、部位信息。」
1.3 第三层:从问题点到根因
这是最值钱的一层。开裂是现象,根因可能是材料选型、模具精度、运输包装三种完全不同的东西。
根因判断需要产品知识,工具只能给候选。我的指令是:「针对以下每个问题点,列出 3 个可能的根因,并说明每个根因对应的验证方法。」
列出验证方法很重要。 想不出验证方法的根因,就是猜测。

二、为什么三星评论比一星更值得分析
2.1 一星评论的两个问题
一是样本偏差:留一星的人往往是遇到了极端情况,不能代表大多数买家。
二是信息已经污染:情绪太强,事实描述往往失真。「用了两天就坏了」可能是真的两天,也可能是两周。
2.2 三星评论的价值
三星评论的人通常是认真想买、认真用了、认真写了。他们的描述更具体、更接近真实体验,而且往往包含「哪里好 + 哪里不好」的完整结构。
这批人是你的产品最诚实的用户。 他们的意见对迭代最有参考价值。
2.3 实操建议
分析时给三星评论更高的权重。我的做法是:统计问题点时,三星评论的权重设为 1.5,一星和二星设为 1.0。

三、实操:一次完整的情感分析
第一步:导出评论,至少 200 条,覆盖 6 个月。
第二步:三段式指令。
第一段:「把以下评论按情绪分为正面、中性、负面三类,输出每类条数。」
第二段(只对负面):「把负面评论中的评价性表述还原为具体事实描述,保留数字、时间、部位信息。输出:原句、还原后描述、涉及的产品部件。」
第三段:「把还原后的描述按问题点聚类,输出每个问题点的出现次数、典型案例、可能的根因、验证方法。」
第三步:人工判断根因。
工具给的根因是候选,最终判断要人做。这一步一定要结合你对供应链的了解。
第四步:排出优先级。
排序公式很简单:出现次数 × 严重程度。严重程度用三个等级:影响安全=3,影响功能=2,影响体验=1。
四、注意事项
- 别只看负面:正面评论里反复出现的那个词,是你应该写进标题的卖点
- 注意时间趋势:同一个问题点如果在逐月上升,说明是近期改款或换供应商导致的
- 区分站点:美国站抱怨尺寸,德国站可能抱怨说明书语言,问题不一样
- 变体评论共享规则变了:2026 年 2 月 12 日起核心功能不同的变体不再共享评论,分 ASIN 统计时口径要跟着调整
- 分析结果要闭环:改完之后三个月再跑一次,看那个问题点的出现次数有没有降。没有闭环的分析等于没做
FAQ
Q:评论太少(不到 50 条)能做分析吗?
能做但结论不稳。这种情况建议把竞品的评论一起捞进来,同品类的痛点高度重合,虽然不是自己的产品,参考价值仍然很大。
Q:工具给出的根因靠谱吗?
一半靠谱。它能列出候选,但判断需要产品知识。它的强项是模式识别(找出反复出现的表述),弱项是因果推断。
Q:分析一次要多久?
200 条评论,从导出到出结论,熟练之后 40 分钟左右。第一次做可能要两小时,主要耗在调指令上。
Q:情感分析能预测评分走势吗?
能做个粗略判断。如果近期负面评论的问题点开始集中在一个新出现的部件上,评分大概率会往下走。建议每月跑一次做趋势监控。