PoETa v2: Toward More Robust Evaluation of Large Language Models in Portuguese

📅 2026/8/17 23:47:16
PoETa v2: Toward More Robust Evaluation of Large Language Models in Portuguese
文章主要内容与创新点总结一、主要内容研究背景:大型语言模型(LLMs)在不同语言和文化背景下性能差异显著,葡萄牙语作为代表性低资源语言,存在训练数据代表性不足、评估体系零散等问题,缺乏系统的评估基准和大规模对比分析。核心贡献:推出葡萄牙语LLM评估基准PoETa v2,包含44项任务(12项原生葡萄牙语任务+32项翻译适配任务),覆盖多领域技能与区域文化特征;对20余种不同规模、训练策略的开源/商业LLM进行大规模评估,分析计算投入、语言特异性适配等因素对葡萄牙语性能的影响。任务设计:原生任务聚焦葡萄牙语区域知识(如本地考试、谚语、口语表达),翻译任务源自经典英语基准,涵盖推理、阅读理解、常识等领域;任务类型包括回归、选择题、问答、文本蕴含、分类等7类,同时标注细分领域标签(如数学、巴西区域知识、伦理等)。评估方法:采用标准化指标,包括计算成本(基于FLOPs的训练资源估算)和归一化首选指标(NPM),解决不同任务评分尺度不一致的问题,确保跨模型/跨任务可比性。关键发现:计算成本与葡萄牙语性能呈强正相关,但模型架构和训练数据构成同样关键(如Qwen系列表现优于同规模Llama模型);葡萄牙语专项预训练能显著提升性能,尤其对初始多语言支持较弱的模型(如Sabiá 7B相对Llama 1 7B提升12.5个NPM点);英