先说结论
AI情绪识别(affective computing 中的一个分支)做的事情,是从可以被传感器采集的外部信号里,找出与人工标注的情绪标签之间的统计关联,然后对新的输入做出概率性猜测。它识别的是“外显信号像哪一类”,而不是“这个人内心真实的感受”。
因此,把AI给出的情绪标签当成参考性的观察结果比较合适,把它当成对一个人心理状态的判定则并不合适。
它到底在读什么
目前常见的技术路径主要有三条,实际产品往往把它们混合使用:
- 面部与身体信号:模型从图像中提取眉毛、眼周、嘴角等区域的形变特征,再映射到预先定义好的情绪类别上。早期的方法依赖手工设计的面部动作编码,近年则大多交给深度神经网络自行学习特征。
- 语音信号:不分析说了什么,而是分析怎么说的——音高、语速、能量、停顿和音色的抖动,都会被转成数值特征。
- 文本信号:从措辞、句式和上下文中判断情感倾向,这也是聊天类产品最常用的方式。
无论哪条路径,模型的能力上限都取决于训练数据里的情绪标签是怎么打上去的。而这些标签本身来自人的主观判断,不同标注者对同一段素材的判断经常不一致。
为什么它在个体身上容易失准
心理学界近年有一个越来越明确的共识:表情与内在情绪之间并不存在固定的一一对应关系。同样是皱眉,可能是愤怒,也可能是专注、疑惑或阳光太刺眼;同样是笑,可能是开心,也可能是尴尬或礼貌。情绪的外显方式还会受到文化、场合、性别期待和个人习惯的强烈影响。
模型学到的是训练数据所代表的那个群体的平均规律。当被识别的人在文化背景、表达习惯或身体条件上偏离这个平均值时,误判率会明显上升。这也是为什么在教育、招聘、司法等高风险场景中使用情绪识别,会引起相当大的伦理争议。
常见问题
AI说我情绪低落,是不是意味着我需要看医生?
不能这样推断。AI给出的是基于外部信号的概率性标签,它既不了解你的处境,也没有任何诊断资质。如果你自己感到持续的困扰,判断依据应该是你实际的感受和生活功能受影响的程度,并向精神科医生或心理咨询师这样的专业人士求助,而不是依据一个App的输出。
为什么同一张照片,不同的情绪识别工具给出的结果不一样?
因为它们的训练数据、情绪分类体系和模型结构都不同。有的工具把情绪分成六到七个基本类别,有的用效价与唤醒度这样的连续维度来描述,结果自然无法直接对齐。这种不一致本身就说明了这类判断的不确定性。
参考来源
- 美国心理学会(APA)· Topics — 情绪心理学与表情研究的权威科普入口
- 美国国立精神卫生研究所(NIMH)· Health Topics — 心理健康工具与测评相关议题的官方资料