位置偏差估计与无偏排序学习——WSDM 2018谷歌论文阅读笔记

📅 2026/8/7 16:55:14
位置偏差估计与无偏排序学习——WSDM 2018谷歌论文阅读笔记
位置偏差估计与无偏排序学习——WSDM 2018谷歌论文阅读笔记论文Position Bias Estimation for Unbiased Learning to Rank in Personal Search来源WSDM 2018Google整理阅读笔记一、WSDM 会议背景WSDMInternational Conference on Web Search and Data Mining是搜索、数据挖掘与机器学习领域的顶级会议2008年首次举办至今已有11届历史。根据谷歌学术搜索的数据WSDM 目前是数据挖掘领域仅次于 KDD 的学术会议。WSDM 的一大特点是大量工业界学者参与从投稿、论文发表到评审委员会、组委会均有大量工业界背景人员这也是其备受关注的重要原因。二、作者群信息论文全部作者来自 Google作者背景摘要王选珲Xuanhui Wang2015年加入 Google此前 Facebook 3年广告系统、Yahoo 2年科学家2009年 UIUC 博士导师翟成祥纳达夫·古尔班迪Nadav Golbandi2016年加入 Google此前 Yahoo 研究院 8年主任级研究工程师、IBM 以色列研究院 6年迈克尔·本德斯基Michael Bendersky2012年加入 Google负责 Google Drive 搜索2011年 UMass Amherst 博士导师 Bruce Croft唐纳德·梅泽尔Donald Metzler2012年加入 Google负责 Google Drive 搜索质量曾在 Yahoo 研究院和 USC 任职2007年 UMass Amherst 博士导师 Bruce Croft马克·诺瓦克Marc Najork2014年加入 Google研发总监此前微软研究院硅谷 13年、DEC 研究院 8年曾任 ACM Transactions on the Web 主编引用数 7000三、论文核心贡献3.1 问题背景所有搜索系统都存在各种偏差Bias如何对偏差进行有效建模是搜索系统机器学习的核心挑战。现有三类处理方式人工标注相关度——不依赖人机交互获取相关度信息无需估计偏差但成本高传统点击模型Click Model——概率图模型同时估计相关度和偏差但主要关注相关度提取对偏差估计精度不重视因果推断 排序学习——最近几年的新方向直接对偏差建模WSDM 2017 最佳论文即为该思路但未深入探讨偏差估计与点击模型的关系3.2 本文贡献本文的核心思路是利用点击模型中的方法来更准确地估计偏差从而学习到更好的排序结果。同时探索如何在较少使用随机数据的情况下更好地估计偏差提出了**基于回归的期望最大化Regression-based EM**算法。四、核心方法4.1 位置偏差假设如果已知偏差值Propensity Score“——用户看到每个文档的概率就可以构造无偏差指标如无偏差精度Unbiased Precision”。核心假设是位置偏差Position Bias无论什么文档放在较高位置时都可能获得更多点击因此低位文档被点击更加难得。通过权重调整实现无偏差高位文档权重低低位文档权重高。4.2 位置偏差模型位置偏差模型Position Bias Model的假设用户对某个查询关键词在某位置的文档点击概率可分解为两个概率的乘积用户看到该位置的概率文档本身相关度的概率模型的核心任务就是估计这两个概率值。4.3 三种估计策略策略做法优缺点完全随机化所有结果位置随机排列直接用点击率估计相关度不依赖位置概率估计但严重损害用户体验配对随机化仅相邻位置互换第1和第2、第2和第3…用户体验损失较小但仍不可忽视直接参数估计不对结果随机化直接估计位置概率和相关度概率本文采用的方法对用户体验无影响4.4 基于回归的期望最大化Regression-based EM由于需要同时估计位置概率和相关度概率两个变量作者采用了**期望最大化EM**算法。传统 EM 的问题需要对每个查询关键词和文档配对进行估计而用户数据中这种配对可能非常有限导致数据不足。解决方案利用回归模型来估计文档和查询关键词的相关度即EM 负责估计位置偏差回归模型负责估计相关度五、实验效果数据集Google 邮件和文件存储的搜索数据2017年4月两周日志约 400万查询关键词每个关键词约 5个结果结果利用该方法训练的排序模型比不考虑偏差的模型提升 1%2%六、要点总结搜索系统中的位置偏差会严重影响排序模型的训练质量因果推断与排序学习结合是解决偏差问题的新方向位置偏差模型将点击概率分解为看到位置的概率和文档相关度概率直接参数估计避免了对搜索结果的随机化不影响用户体验Regression-based EM 解决了用户数据稀疏的问题EM 估计偏差回归模型估计相关度在 Google 个人搜索场景中该方法带来 1%2% 的效果提升参考文献[1] Thorsten Joachims, Adith Swaminathan, and Tobias Schnabel.Unbiased Learning-to-Rank with Biased Feedback. WSDM 17, ACM, 781-789, 2017.