RETAIL: Towards Real-world Travel Planning for Large Language Models

📅 2026/8/27 13:17:54
RETAIL: Towards Real-world Travel Planning for Large Language Models
文章主要内容与创新点总结一、主要内容本文聚焦大型语言模型(LLMs)在招聘评估中的文化偏见问题,通过系统分析印度和英国求职者的面试转录文本,探究LLMs在跨文化与身份维度下的评估差异,具体内容如下:数据与研究设计:收集200份面试转录文本(印度、英国各100份),使用GPT-4o和Gemini Flash 1.5两款LLM,从“可雇佣性”“积极印象”“自我推销”“故事讲述”四个与求职相关的维度对文本评分;同时在印度数据集中进行姓名替换(涵盖性别、种姓、地域维度),并提取词汇多样性、句子复杂度等语言特征,分析其对评分的影响。核心研究发现跨文化评分差异:即使文本经过匿名处理,印度求职者的转录文本在所有评估维度上的得分均显著低于英国求职者,且该差异在两款LLM中均存在。语言特征的影响:词汇多样性(通过类符/形符比衡量)、句子复杂度(平均句长)、可读性(Flesch阅读难易度评分)与LLM评分显著相关。不过,即便控制这些语言特征,英国文本的评分仍更高,说明LLM中存在文化条件性偏好。身份线索的影响:在印度数据集中,仅改变姓名所蕴含的性别、种姓、地域身份线索,并未对LLM评分产生统计学上的显著影响,表明孤立的姓名信息不足以触发LLM的偏见。讨论与建议:指出LLM的文化偏见可能导致非西方求职者