1. 公平性问题的基本形态
1.1. 种族与群体歧视
机器学习模型对偏见十分敏感。即使未显式使用种族等敏感属性,模型仍可能在预测与决策中隐式引入这些因素。典型表现包括:
- 误判与标准单一:如将某族裔的犯罪风险系统性高估,或仅以某一群体的审美/标准作为判定依据,使其他群体在 AI 决策中处于劣势。
- 数据偏差的传导:若训练数据以某一群体为主(如仅用某族裔数据训练),模型在面对其他群体时容易产生错误或歧视性判断。
- 偏见的放大:在招聘筛选等场景中,模型可能无意识地「学习」并放大既有社会偏见。
1.2. 边缘群体被忽视
长期被边缘化的群体若未被充分纳入数据与学习过程,模型会缺乏其代表性,导致对这些群体的服务不足或歧视加剧。
1.3. 联邦场景下的客户端公平
在联邦学习中还存在客户端维度的公平问题:
- 数据重叠与遗忘冲突:客户端间数据可能重叠。满足某一客户端的遗忘请求(删除某类数据)时,可能损害依赖该数据的其他客户端的性能与精度。
- 非 IID 与模型偏向:客户端数据多为非独立同分布(Non-IID),模型容易偏向数据量或特征更「强势」的客户端,导致对弱势客户端不公平。
2. 公平性与联邦遗忘学习的关系
联邦遗忘学习(Federated Unlearning)与公平性存在双向关系:既可被用来促进公平,也可能加剧不公平。
2.1. 利用遗忘学习促进公平
- 事后去偏:传统公平性研究侧重在训练阶段预防偏见。遗忘学习提供了一种事后思路——在训练结束后,针对性地削弱或移除与偏见相关的参数或数据影响,在尽量保持模型性能的前提下实现去偏。
- 缓解过拟合:联邦遗忘还能用于主动遗忘过时、冗余或有害的样本,修复过拟合,间接有利于泛化与公平。
2.2. 遗忘学习可能损害公平
- 过度遗忘:若遗忘程度过深,可能删掉代表性本就不足的群体数据,导致对这些群体的预测准确性下降,加剧不公平。
- 遗忘不足:若遗忘不彻底,偏见相关影响仍有残留,公平性目标难以达成。
- 高敏感场景:招聘、信用评分、医疗 AI 等场景中,公平性极为关键,上述风险的影响尤为突出。
2.3. 直接删除偏见内容的局限
单纯删除「偏见内容」或敏感标签(如种族、肤色)往往不够:
- 偏见转移:模型可能不再直接使用种族,转而依赖与种族高度相关的代理变量(如居住地区、姓名、语言、生活习惯等),使偏见从明处转向暗处,难以检测与治理。
- 防御设计困难:若模型完全失去「反面教材」或可解释的偏见表征,针对性的公平性防御与审计会变得更难设计。
3. 维持公平性的主要技术手段
3.1. 数据预处理
从源头介入,在模型训练之前通过调整数据的构成来改善公平性,属于**预处理(Pre-processing)**方法。常见策略包括:
- 重采样(Resampling):对代表性不足的群体进行过采样,或对主导群体进行欠采样,使各群体在训练集中的比例更加均衡。
- 重标注(Relabeling):识别并修正训练数据中存在偏见的标签,从根源消除偏差。
- 公平主动学习(Fair Active Learning):在标注预算有限的情况下,优先选取能够提升弱势群体代表性的样本交由专家标注,以最小的标注成本最大化公平性收益。
3.2. 公平遗忘感知重训
在遗忘过程中同时优化公平性:边做「遗忘手术」边施加公平约束或重训,使删除/更新后的模型在统计特性上仍满足既定公平准则(如不同群体间性能差距可控)。
3.3. 基于正则化的遗忘
在遗忘算法中引入数学约束,强制模型在参数更新或「模糊化」过程中遵守公平性准则,避免遗忘操作破坏公平指标。
3.4. 遗忘后去偏
采用两阶段策略:先完成数据/参数层面的遗忘,再对所得模型做一次专门的去偏或公平性微调,作为「做完手术再打磨」的补充步骤。



