Different types of syntactic agreement recruit the same units within large language models

📅 2026/8/25 16:52:20
Different types of syntactic agreement recruit the same units within large language models
文章总结与翻译一、主要内容本文聚焦大型语言模型(LLMs)中语法知识的表征机制,核心探究不同句法现象是否调用模型内共享或独特组件。研究采用受认知神经科学启发的功能定位法,对7个开源LLM(参数规模1.5B-7.2B)展开分析,主要内容如下:句法响应单元识别:针对英语67种句法现象,识别出模型中对语法/非语法句子激活差异显著的单元,这些单元在同类句法现象的不同句子中持续被调用,且通过消融实验证实其对句法任务表现有因果支持作用。一致关系作为功能类别:主语-动词、照应语、限定词-名词等不同类型的句法一致关系,会调用重叠的模型单元,表明一致关系是LLMs表征空间中的重要功能类别。该模式在英语、俄语、汉语中均成立。跨语言一致性探究:跨57种语言的分析显示,句法结构越相似的语言,在主语-动词一致关系上共享的模型单元越多;一致关系相关单元在不同语言间存在部分重叠,其中英语与俄语的重叠度高于英语与汉语。补充验证:通过0.5%、5%不同比例的单元定位、注意力/MLP模块细分分析、多基准数据集(如SyntaxGym、RuBLiMP、SLING)验证等,证实核心发现的稳健性。二、创新点方法论创新:将认知神经科学中的“功能定位”方法系统应用于LLMs句法表征研究,通过对比语法/非语法句子的单元激活差异定位关键单元,结合消融实验验证