近日,智能康复系统感知与控制国际联合研究中心谢远伦老师以第一作者身份完成的研究论文《FER-FL: Robust federated learning for facial expression recognition in heterogeneous environments》已在中科院一区期刊《Pattern Recognition》官网在线发表。
该研究聚焦异构客户端分布下联邦人脸表情识别面临的非独立同分布(non-IID)问题。受不同用户数据分布差异影响,联邦训练容易出现客户端漂移、收敛缓慢和识别精度下降。为此,研究团队提出了一种面向人脸表情识别的鲁棒联邦学习框架——FER-FL。该框架将客户端侧方差缩减的原始-对偶优化与服务器侧公共数据校准相结合,在无需交换客户端原始人脸图像的前提下,提高了模型识别准确率、训练稳定性和收敛效率。

图1 论文在《Pattern Recognition》期刊官网的在线发表页面
人脸表情识别是计算机视觉与情感计算领域的重要研究方向,广泛应用于人机交互、智能监测、健康辅助等场景。然而,传统深度学习方法通常依赖集中汇聚的大规模人脸数据,实际应用中面临原始数据共享受限等问题。联邦学习允许多个客户端在不直接共享原始图像的情况下协同训练模型,为降低原始人脸数据集中汇聚的需求提供了新的技术路径。但由于不同用户在年龄、性别、身份、光照以及个体表情风格等方面存在明显差异,各客户端数据往往呈现较强的非独立同分布(non-IID)特性,容易导致客户端漂移、模型收敛缓慢及识别精度下降。
针对上述问题,研究团队提出FER-FL框架,主要从以下三个方面实现改进:
1. 方差缩减的梯度校正机制缓解客户端漂移。FER-FL利用客户端历史更新与上一轮参与客户端平均更新之间的差异构建梯度校正项,以减弱非独立同分布数据引起的客户端更新偏移。
2. 原始-对偶局部优化提升局部-全局一致性。FER-FL为每个客户端引入局部对偶变量,并结合近端项约束局部模型相对全局模型的偏移;校正梯度、近端项与对偶变量共同作用于客户端本地更新,从而增强局部模型与全局模型的一致性。
3. 服务器端公共数据校准细化全局决策边界。服务器完成客户端模型聚合后,利用与客户端训练数据相互独立的公共代理数据,计算各客户端模型在该数据上的软预测并形成预测共识,再通过基于Kullback-Leibler(KL)散度的知识蒸馏,使全局模型预测逼近客户端预测共识,从而对聚合后的全局模型进行校准。

图2 FER-FL总体框架
研究团队在FERPlus、RAF-DB和FER2013三个公开人脸表情识别数据集上进行了系统验证,并与FedAvg、SCAFFOLD、FedDyn、FedCM、FedSpeed、FedGamma和FedGloss等代表性联邦学习方法进行了对比。实验结果表明,FER-FL在不同数据异构程度和客户端参与率设置下均表现出稳定的性能优势。相较于FedAvg,Top-1准确率最高提高约7.0个百分点;同时,在部分设置下实现最高约5.1倍的收敛加速。

图3 FER-FL与不同联邦学习方法的性能对比
进一步实验表明,FER-FL在FERPlus数据集上的Macro-F1达到67.7%,并改善了Fear(恐惧)、Contempt(轻蔑)等较难识别表情类别的分类表现。消融实验进一步验证了梯度校正、对偶正则和服务器端公共数据校准等核心机制的有效性,表明各组成部分能够协同提升异构环境下联邦人脸表情识别的准确率与收敛效率。
该研究为异构环境下的联邦人脸表情识别提供了新的解决思路,在无需不同用户或机构直接交换原始人脸图像的前提下,提升了模型在数据异构、类别不平衡及相近表情易混淆等复杂条件下的识别性能与训练稳定性,可为分布式人脸表情分析、人机交互及智能健康辅助等应用提供技术参考。未来,相关思路还可进一步拓展至视频人脸表情识别、多模态情感识别及个性化情感建模等任务。
论文链接:
https://doi.org/10.1016/j.patcog.2026.114547
一 审:周 楠
二 审:罗浚溢
三 审:施开波