Domain Adaptation

📅 2026/7/28 18:51:15
Domain Adaptation
Domain Adaptation在经典的机器学习问题中我们往往假设训练集和测试集分布一致在训练集上训练模型在测试集上测试。然而在实际问题中测试场景往往非可控测试集和训练集分布有很大差异这时候就会出现所谓过拟合问题模型在测试集上效果不理想。以人脸识别为例如果用东方人人脸数据训练用于识别西方人相比东方人识别性能会明显下降。当训练集和测试集分布不一致的情况下通过在训练数据上按经验误差最小准则训练的模型在测试上性能不好因此出现了迁移学习技术。领域自适应Domain Adaptation是迁移学习中的一种代表性方法指的是利用信息丰富的源域样本来提升目标域模型的性能。领域自适应问题中两个至关重要的概念源域source domain表示与测试样本不同的领域但是有丰富的监督信息目标域target domain表示测试样本所在的领域无标签或者只有少量标签。源域和目标域往往属于同一类任务但是分布不同。根据目标域和源域的不同类型领域自适应问题有四类不同的场景无监督的有监督的异构分布和多个源域问题。通过在不同阶段进行领域自适应研究者提出了三种不同的领域自适应方法1样本自适应对源域样本进行加权重采样从而逼近目标域的分布。2特征层面自适应将源域和目标域投影到公共特征子空间。3模型层面自适应对源域误差函数进行修改考虑目标域的误差。样本自适应其基本思想是对源域样本进行重采样从而使得重采样后的源域样本和目标域样本分布基本一致在重采样的样本集合上重新学习分类器。样本迁移Instance based TL在源域中找到与目标域相似的数据把这个数据的权值进行调整使得新的数据与目标域的数据进行匹配然后加重该样本的权值使得在预测目标域时的比重加大。优点是方法简单实现容易。缺点在于权重的选择与相似度的度量依赖经验且源域与目标域的数据分布往往不同。特征自适应其基本思想是学习公共的特征表示在公共特征空间源域和目标域的分布要尽可能相同。特征迁移Feature based TL假设源域和目标域含有一些共同的交叉特征通过特征变换将源域和目标域的特征变换到相同空间使得该空间中源域数据与目标域数据具有相同分布的数据分布然后进行传统的机器学习。优点是对大多数方法适用效果较好。缺点在于难于求解容易发生过适配。链接https://www.zhihu.com/question/41979241/answer/247421889模型自适应其基本思想是直接在模型层面进行自适应。模型自适应的方法有两种思路一是直接建模模型但是在模型中加入“domain间距离近”的约束二是采用迭代的方法渐进的对目标域的样本进行分类将信度高的样本加入训练集并更新模型。模型迁移Parameter based TL假设源域和目标域共享模型参数是指将之前在源域中通过大量数据训练好的模型应用到目标域上进行预测比如利用上千万的图象来训练好一个图象识别的系统当我们遇到一个新的图象领域问题的时候就不用再去找几千万个图象来训练了只需把原来训练好的模型迁移到新的领域在新的领域往往只需几万张图片就够同样可以得到很高的精度。优点是可以充分利用模型之间存在的相似性。缺点在于模型参数不易收敛。