高通AI研究院揭示:视觉AI也有“近视眼“?

📅 2026/7/29 17:41:42
高通AI研究院揭示:视觉AI也有“近视眼“?
这项由高通AI研究院Qualcomm AI Research完成的研究发表于2026年欧洲计算机视觉大会ECCV 2026论文编号为arXiv:2607.09061有兴趣深入了解的读者可通过该编号查询完整论文。你有没有想过当你看一张复杂的图片时你的眼睛并不是一瞬间把整张图拍进大脑的事实上你的眼睛每秒会进行好几次快速跳动每次只聚焦在一个小区域——先扫左上角再跳到中间然后移到右下角……就这样一点一点把信息拼凑起来最终形成对整张图的理解。这种行为叫做视觉扫视是人类视觉系统几百万年演化出来的核心机制。然而当今几乎所有主流的AI视觉模型都是把整张图一口气吞进去处理的——就好像用一台广角相机把整个场景同时拍下来再从这张大照片里提取所有信息。这和人类的方式截然不同。那么这种一口吞的方式到底有什么隐患高通AI研究院的研究团队决定深挖这个问题。他们的发现令人深思现有的AI视觉模型包括当下最先进的大型视觉语言模型在面对比训练时见过的更复杂的图片时会出现明显的性能崩溃。而他们提出的解决方案正是让AI模型学会像人眼一样逐步扫视图像并配合一种能够记住每一步状态的循环计算结构——这个组合才是让模型真正理解视觉信息、并举一反三的关键所在。一、为什么AI模型看图会失灵——从一道数学题说起要理解这项研究在解决什么问题先来看一个类比。假设老师教你学加法从一位数加到十位数你练习了很多次之后能很熟练地算出375895。但如果老师突然出了一道三位数加法比如374586你还能做吗当然可以因为你掌握了加法的规则本身而不只是记住了每道题的答案。这种把规则本身学会、然后在更复杂的情况下也能用的能力研究者把它称为长度泛化——意思是模型在训练时只见过短的情况但在测试时面对长的情况依然能正确作答。在语言AI领域研究者早就发现像GPT这样的Transformer模型在面对比训练时更长的序列时会表现大幅下滑。高通团队的这项研究则首次系统地把这个问题搬到了视觉领域当一张图里需要处理的信息量超过了模型训练时见过的复杂程度会发生什么为了研究这个问题团队设计了一套视觉推理测试题这些题目的共同特点是答案不在图片的某个角落而是分散在整张图的多个位置必须把所有位置的信息综合起来才能得出正确答案。任务的长度就是图中需要访问的信息点数量——信息点越多任务越长越复杂。他们把训练时见过的复杂度和测试时面对更高复杂度的表现做了对比结果发现当前最先进的视觉AI模型在训练范围内表现优异但一旦测试复杂度超过训练范围性能会急剧下滑几乎失效。这说明这些模型并没有真正学会规则本身而是记住了某种只在特定复杂度下有效的捷径。二、研究者设计了哪些测试——四道题考验AI的举一反三为了让研究结果更有说服力研究团队设计了四种不同类型的视觉任务每种任务从不同角度考验模型的泛化能力。第一种任务叫视觉奇偶性灵感来自一道经典的数学题给你一串由0和1组成的数字判断其中1的个数是奇数还是偶数——这叫做奇偶性判断。在视觉版本里图中随机分布着若干个圆形节点每个节点中心写着0或1模型需要找到所有节点统计其中1的数量最后判断奇偶性。关键在于这些节点是随机散落在图像中的不是整齐排成一排——模型必须自己找到它们而不只是从左到右依次读取。第二种任务叫状态机难度更高一些。这次图中的节点不仅有值还通过箭头连接成一个有序的链条模型必须按照箭头指示的顺序从绿色的起始节点出发经过一系列紫色的中间节点到达红色的终止节点。每访问一个节点就根据它的值更新一个当前状态——有点像走迷宫时每经过一个房间就要按照房间里的规则改变自己的状态。顺序非常重要换一种顺序走就会得到不同的结果。第三种任务叫视觉回忆这是一个作为对照组设计的任务。图中有一堆红色T形字母、绿色L形字母以及红色L形字母模型需要回答红色L在图中存在吗这个任务不需要状态追踪只需要在图中找到符合特定颜色和形状组合的目标类似于在人群中找一个穿红衣服戴蓝帽子的人。第四种任务叫寻找函数零点是一个更贴近现实应用的任务。图中显示的是一个数学函数图像图里可能有多个子图、多条曲线。模型需要找到特定子图中特定函数与x轴即y0那条横线的交叉点也就是函数的零点。这模拟了科研人员分析实验图表、学生做数学题等真实场景需要先在复杂图像中定位目标区域再仔细分析曲线细节。通过这四种任务研究者希望揭示哪些类型的视觉推理依赖于逐步积累状态的能力哪些则不需要三、一口吞式AI为什么会学坏——捷径的诱惑当研究者把当前最先进的视觉语言模型包括Qwen2.5-VL、GPT-5.4、Claude Sonnet 4.6等放在这些任务上测试时结果印证了他们的担忧。在训练范围内也就是图中信息点数量较少时这些模型都表现出色准确率很高。然而随着信息点数量增加超过训练时见过的最大数量它们的表现开始快速下滑从接近满分逐渐跌落到接近随机猜测的水平。为什么会这样研究者的解释类似于这样一个故事假设老师出了很多道在一排树中数苹果的题最多的一道题有10棵树。一个聪明的学生可能没有真正去数每棵树上的苹果而是发现了一个规律如果树排成这样的形状苹果总数大概是这么多——他记住的是图形的整体外观与答案之间的统计关系而不是数苹果的步骤本身。这种走捷径的策略在10棵树以内非常有效但当老师突然出了一道20棵树的题这个规律就完全失效了。对于一口吞下整张图的AI模型来说它很容易从整张图的全局视觉特征中归纳出这种捷径——因为它同时看到了图中所有的信息完全可以用一种全局性的、并行的计算方式得出答案而不需要一步一步地追踪信息。这种全局捷径在训练范围内有效但在训练范围之外就失去了泛化能力。研究者还发现这些顶尖模型的失败不只是因为没有算出正确答案往往还伴随着更基础的失误——它们有时根本就没能从图中找全所有的信息节点或者误读了箭头的方向。这说明信息收集本身就是一大难关而一口吞的方式在信息点增多后对细节的感知力会明显下降。四、扫视机器人是怎么工作的——像人眼一样一步一步看针对上述问题高通团队提出了他们的解决方案一个叫做FoveAgent-LSTM的模型。这个名字来自两个概念——Fovea中央凹眼球中感知最清晰的区域和LSTM一种具有记忆能力的循环神经网络。这个模型的核心思路就是模拟人类视觉扫视的方式来处理图像。每一步FoveAgent-LSTM只观察图像中的一个局部区域但它同时从两个尺度获取信息。一个是中央凹视野也就是当前注视点的高清局部图像分辨率很高能看清细节比如节点里写的是0还是1或者曲线是否经过了x轴另一个是外周视野也就是以当前注视点为中心的更大范围的低分辨率图像分辨率较低看不清细节但能感知大致的空间布局知道周围还有哪些区域值得访问。这个设计模仿了人眼的工作方式人眼的中央凹视野正中心的小区域能看到极高清的细节而视野边缘则模糊一些但足够让你感知到哪个方向有动静引导下一次扫视的方向。在每一步观察之后模型会做三件事第一更新自己的记忆状态——这是LSTM网络的核心功能它能把到目前为止我看到了什么、当前状态是什么存储下来并在下一步继续使用第二输出一个探针信号也就是对当前这一步观察到的内容的判断比如这个节点的值是1这类似于做题时的草稿步骤第三输出一个行动指令也就是下一步要把视线移到哪里——用角度和距离来表示移动方向且下一步的中心点必须在当前外周视野的范围内这保证了模型不会一步跳到图像的任意位置而是像真正的视觉扫视一样每次只移动有限的距离。当模型认为已经收集到了足够的信息它会输出一个停止信号并给出最终答案。这个模型之所以有效关键在于两点的结合。其一是局部感知因为每次只看图像的一个局部区域模型无法一次性获得整张图的全局信息也就无法走全局捷径必须老老实实地一步一步积累信息。其二是循环记忆LSTM网络能够在整个扫视过程中维护一个不断更新的当前状态把每一步的观察结果叠加进去而不是每次都从零开始——这正是人类推理的方式也是规则本身得以被学习的基础。五、实验结果说明了什么——捷径vs规则的对决研究者在上述四种任务上对FoveAgent-LSTM和各种全局模型进行了系统比较结果清晰地展示了两种方法之间的本质差异。在视觉奇偶性和状态机这两个需要状态追踪的任务上FoveAgent-LSTM在超出训练范围的复杂度下依然保持了接近满分的准确率而Qwen2.5-VL等全局模型在同样的情况下准确率急剧下滑有时甚至接近随机猜测。这个对比几乎就是学会了规则与记住了捷径的直接对决。研究者还做了一个精心设计的对照实验把模型的视觉输入方式和计算结构分开来检验以搞清楚到底是哪个因素在起关键作用。他们用同一个LSTM循环骨干网络分别配上三种不同的视觉输入方式来做比较。第一种是全局输入也就是每次都把整张高清图传给模型第二种是局部全局输入既传局部高清图也同时传整张高清图第三种是FoveAgent-LSTM的方式只传局部高清图和低分辨率外周图从不让模型看到整张高清图。结果发现前两种方式在训练范围内表现良好但在超出训练范围后同样出现了性能下滑而只有第三种方式完全局部的感知方式实现了稳健的泛化。这说明即使有了LSTM的循环计算能力只要模型能接触到整张高清图它就还是会学会利用全局捷径从而丧失泛化能力。局部感知不是可选的辅助手段而是防止捷径学习的必要条件。接下来研究者又固定了局部感知的视觉输入方式换用不同的计算骨干网络来比较。他们测试了LSTM、GRU、普通RNN这三种都是严格的循环网络以及xLSTM、Mamba这两种是线性循环网络还有基于Transformer的Qwen2.5-VL模型。结果是只有严格循环的网络LSTM、GRU、RNN实现了稳健的长度泛化其他结构都在超出训练范围后出现了明显的下滑。这说明真正的非线性循环计算是第二个不可或缺的条件。换句话说要实现视觉推理的长度泛化必须同时具备两个条件一是局部感知不能一口吞整张图二是严格的循环计算而非Transformer或线性循环结构。二者缺一不可缺了任何一个模型都会走捷径、不泛化。六、外周视野的精妙设计——大与小的矛盾如何化解研究者在实验中还发现了一个有趣的矛盾并找到了优雅的解决方案值得详细介绍。一方面为了泛化局部视野应该尽量小——视野越小模型每次能看到的信息越少就越不可能一次性看到多个信息节点从而被迫真正做到一步一步积累。但另一方面视野太小会带来另一个问题模型需要更多步骤才能把整张图都看一遍而且很难从一个小小的局部窗口里知道下一步该往哪走导航变得困难。这个矛盾用一个比喻来理解就很清楚假设你在一个巨大的迷宫里寻找散落的金币。如果你戴着一个完全封闭的头盔只有一个很小的观察窗你每次只能看到脚边的一小块地面你确实无法走捷径但你也很容易迷路不知道该往哪个方向走才能找到下一枚金币。而如果你能摘下头盔一眼看遍整个迷宫你当然能快速找到所有金币但这样你就不再需要真正探索了你的策略依赖于一览无余的全局视角。FoveAgent-LSTM的解决方案正是模仿人眼的中央凹外周视野的双层结构。中央凹是高分辨率的小区域用于细致观察当前位置的任务相关信息比如节点上的数字而外周视野是同心的更大区域但以很低的分辨率呈现足以感知空间布局、判断周围哪个方向有值得访问的目标但无法清晰读取具体内容。这样一来高清局部视野保证了细节感知的准确性而低分辨率的外周视野提供了导航所需的空间上下文同时又因为分辨率太低而无法被用于走捷径——你看得到周围有几个模糊的圆形但根本看不清它们上面写的是0还是1所以你还是必须导航过去一个个仔细读取。研究者通过系统的实验验证了外周视野的分辨率和大小存在一个最优组合。具体来说外周视野的大小设为中央凹局部视野的4倍分辨率统一缩小到80像素时模型在准确性和探索效率之间达到了最佳平衡。分辨率再高或者范围再大模型就会利用外周视野走捷径分辨率太低或者范围太小模型就无法有效导航。七、没有路标也能找到路——主动搜索的挑战在前面的任务中图里的信息节点是通过箭头连接起来的也就是说模型有明确的路线图可以跟随只需要沿着箭头一步步走就行。但研究者随后提出了一个更难的问题如果没有箭头模型能不能自己决定搜索顺序这个版本的任务里信息节点随机散布在画布上没有任何路径指示模型必须自己主动搜寻未访问的节点读取它们的值更新当前状态然后继续寻找下一个未访问的节点直到找完所有节点为止。这带来了两个新挑战第一模型需要知道自己访问了哪些地方、哪些地方还没去过第二当当前的外周视野里没有未访问节点时模型需要知道扩大搜索范围。为此研究者给模型增加了两个辅助功能一是空间记忆功能每当模型访问一个节点后该节点位置上会被标记一个黑点之后所有的视野中都会看到这个黑点相当于在地图上做标记二是缩放功能当外周视野里找不到未访问节点时模型可以执行缩小动作把外周视野的范围扩大一倍但分辨率相应降低从而搜索更大的区域找到目标后再执行放大回到原始分辨率。实验结果显示配备了这些功能后FoveAgent-LSTM在没有箭头路标的主动搜索模式下依然实现了稳健的长度泛化。这说明局部循环的方式不是依赖于有路可循才有效的而是一种真正通用的信息收集策略。八、视觉回忆任务——一个不需要循环的反例在前面几个任务中FoveAgent-LSTM全面碾压了全局模型。但研究者刻意设计了视觉回忆任务作为对照结果出人意料在这个任务上全局模型Qwen2.5-VL反而大幅超越了FoveAgent-LSTM即使测试时图中的干扰元素数量远超训练时全局模型依然保持了很高的准确率。为什么会这样核心区别在于这个任务根本不需要状态追踪。找红色L这件事不需要你记住之前看过什么也不需要把多个位置的信息综合起来你只需要在图中的任意位置判断眼前这个物体的颜色和形状的组合是否符合要求。这是一种并行检测类似于人脸识别——你不需要从左到右一个个检查你的视觉系统可以同时处理整张图的所有区域直接输出有或没有的判断。全局模型恰好擅长这种并行处理方式它可以一次性扫描整张图找到所有符合红色L形组合特征的目标不需要一步步积累状态。而FoveAgent-LSTM的局部扫视方式在这里反而成了劣势——因为它每次只看一个小区域在找目标这件事上效率较低而且也没有用上局部扫视最大的优势也就是防止走捷径。这个对比非常重要它说明局部扫视循环计算的方式并非万能而是有其最适合的场景——那就是需要按顺序积累状态的推理任务也就是研究者所说的状态追踪。对于不需要状态追踪的信息检索类任务全局并行处理反而是更合适的方式。这与语言模型领域的研究结论高度吻合Transformer在序列奇偶性这类状态追踪任务上失败但在键值对检索这类回忆任务上表现出色。九、真实世界的测试——分析函数图表的挑战最后研究者把他们的方法应用于一个更贴近现实的任务在包含多个子图和多条曲线的数学图表中找到特定函数与x轴的所有交叉点。这个任务之所以有趣是因为它需要多个步骤的状态追踪首先找到目标子图然后在子图中识别目标函数曲线然后沿着曲线寻找与x轴的交点找到一个交点后记录下来再继续找下一个直到找完所有交点。这是一个典型的状态积累过程。在这个任务上研究者使用了一个更强大的模型FoveAgent-Qwen也就是把局部扫视机制嫁接到Qwen2.5-VL大型视觉语言模型上——这样可以利用大模型对数学图表的理解能力同时加入局部高清视野来提升细节识别。之所以没有完全换成LSTM骨干网络是因为目前还没有基于循环网络的大型视觉语言模型具备理解数学图表所需的知识。对比实验的结果显示加入了局部高清视野后的FoveAgent-Qwen在训练范围内的准确率从全局模型的57.24%提升到了82.26%在超出训练范围的测试场景中也有显著提升——尤其是函数零点数量超出训练范围这一场景准确率从32.63%大幅提升到了67.12%。研究者还特别排除了局部视野带来更多计算量这一可能的干扰因素。他们发现当全局模型被分配与FoveAgent-Qwen相同数量的计算资源通过提高全局图像分辨率来实现时准确率的提升极为有限——把全局分辨率提高10倍准确率只提升了不到4%而同等计算量下FoveAgent-Qwen的优势约为29%。这说明FoveAgent-Qwen的优势来自于信息获取方式的根本性改变而非单纯的算力堆叠。不过研究者也坦诚地指出由于这个任务用的是Qwen骨干而非严格的循环网络从技术上讲还不能算是完全意义上的循环局部感知因此在这个任务上的泛化提升更多地体现了局部高清视野帮助发现更多视觉细节的作用而非循环计算带来的深层泛化能力。真正强大的循环计算益处需要等到未来出现循环骨干的大型视觉语言模型才能完全验证。十、这项研究的意义——重新思考AI视觉的设计方向归根结底这项研究告诉我们当前的AI视觉模型之所以在面对比训练时更复杂的图像时容易失败根源在于它们的感知方式——一口吞下整张图——给了它们走捷径的机会而走捷径的代价就是无法举一反三。要解决这个问题需要同时满足两个条件一是把感知方式改成局部扫视每次只看图像的一个区域强制模型真正追踪每一步二是使用严格的循环计算结构让模型能在多步扫视中维护和更新一个连贯的当前状态。这两个条件都是必要的任何一个都不够。值得一提的是这项研究也暗示了为什么人类视觉系统演化出了中央凹外周视野眼球扫视的精妙机制——这或许不只是生物学上的偶然而是在演化压力下形成的一种解决信息量远超计算能力问题的最优策略。如果连人类都需要通过扫视来逐步积累信息、追踪状态AI模型或许也应该走这条路。这项发现对未来AI系统的设计有实际影响。当AI被用于分析复杂图表、在拥挤的视觉场景中追踪多个目标、或者处理需要多步骤视觉推理的任务时简单地一口吞整张图的架构可能从根本上就不适合这些需求。不过研究者也承认目前他们训练模型时用的是预先设计好的最优路径专业术语叫模仿学习如何让模型自己学会更通用的探索策略还是一个开放的研究问题未来可能需要强化学习等技术来解决。有兴趣深入了解这项工作细节的读者可以通过论文编号arXiv:2607.09061查阅完整论文论文包含详细的实验设置、模型架构说明和完整的实验数据。---QAQ1视觉语言模型如GPT、Claude在视觉推理中会遇到什么具体失败A根据论文的实验当图像中需要处理的信息点数量超过训练时见过的最大数量时这些顶尖模型的准确率会急剧下滑。失败不只是最终答案错了往往还伴随更基础的问题——模型有时会漏掉图中的部分节点或者误读箭头方向说明信息收集本身就已经出了问题而不只是后续推理出错。Q2FoveAgent-LSTM模型和普通视觉模型的最本质区别是什么A最核心的区别有两点。普通模型把整张图一次性吞进去处理容易学到只在特定复杂度下有效的全局捷径而FoveAgent-LSTM每次只观察图像的一个局部区域同时用LSTM循环网络在多步观察中维护一个不断更新的状态。局部感知防止了捷径学习循环计算保证了多步推理的连贯性两者缺一不可。Q3局部扫视的AI方法是否在所有视觉任务上都更好A不是。论文专门设计了视觉回忆任务作为对照在那个任务中全局模型反而大幅超过了FoveAgent-LSTM。原因是视觉回忆不需要按顺序积累状态只需要在整张图中找到符合特定颜色和形状组合的目标这种并行检测正是全局模型所擅长的。局部扫视循环计算的优势特别体现在需要状态追踪的推理任务上。