从Visual CoT到Internalized Visual Thinking:视频推理的内化之路

📅 2026/8/27 7:28:53
从Visual CoT到Internalized Visual Thinking:视频推理的内化之路
Visual CoT 这个概念过去两年在视觉语言模型评测里被反复讨论核心做法是让模型先输出一段对画面的逐步观察和推理再给出最终答案。和它相对的 Internalized Visual Thinking 是另一种思路不要求每条输入都走一次显式的逐步推理链而是把视觉推理能力训练进模型内部让模型在处理视频时直接形成主动判断。这篇文章就围绕这个转变展开重点讲它解决什么问题、和显式思维链的真实差异、在视频场景里为什么更值得关注以及实际落地时怎么评估、怎么排查、怎么避免把概念用偏。这类工作最值得先看的不是“又提出了一个新名词”而是它把视觉推理的粒度从“逐帧逐步”转向了“整体判断”尤其在视频这种带时间维度的输入上显式推理的成本和稳定性问题会被明显放大。下面按实际理解顺序拆开讲。1. 先搞清楚 Visual CoT 的局限再谈 Internalized Visual Thinking1.1 显式思维链在视觉任务里的好处与代价Visual CoT 的思路和文本领域的 Chain of Thought 一脉相承模型在回答一个视觉问题之前先描述画面里有什么、物体之间是什么关系、从哪几个区域能推断出答案然后基于这些中间结论给出最终回答。这样做的好处很直接。第一中间步骤提供了可读性人能顺着模型的推理路径检查它“看”得对不对。第二在复杂场景里显式推理确实能帮助模型把注意力分配到关键区域尤其是空间关系、计数、属性比较这类任务。第三训练阶段可以借助中间标注来引导模型让监督信号不只在最终答案上生效。但代价也很明显。推理链越长生成 token 越多延迟和算力消耗就越高。对单张图片来说这可能还能接受放到视频里问题会更突出因为一段视频可能包含几十帧甚至几百帧逐帧逐步描述会让输出长度爆炸。更隐蔽的问题是推理链的可控性。模型生成的中间描述未必忠实它可能先编了一个看起来很合理的观察然后顺着这个错误观察推导出错误答案。也就是说显式推理链虽然提高了可解释性但也引入了“错误中间步骤放大”的风险。另一个问题是一致性。同样是画面里出现两个人模型在逐步推理时可能先数出三个然后又修正为两个。这个修正过程本身消耗了大量 token最终效果却不一定比直接判断更稳。1.2 从“逐步推理”到“内化思维”的转变本质Internalized Visual Thinking 的核心主张是推理能力不一定必须每次都以文本形式显式展开它可以被压缩成模型内部的一种计算习惯。类比一下。人类专家做判断时并不是每次都把“我看到什么、猜测什么、因此结论是什么”完整说一遍。熟练的医生看影像能快速定位异常区域但他内部确实经历了视觉搜索、模式匹配、经验对照的过程只是这些过程不需要全部外显成文字。模型层面的“内化”也是类似逻辑。训练阶段用大量包含逐步推理的数据教会模型如何观察、如何定位关键帧、如何关联事件推理阶段则允许模型用更少的中间输出直接给出判断。模型不是“不推理了”而是把推理路径固化成了参数中的偏好。这个转变的本质是把“推理过程的表达能力”和“推理过程的执行效率”解耦。显式思维链用文本暴露了推理过程内化思维则把推理过程作为训练信号但不在每次推理时强制展开。从工程视角看这个思路对视频任务尤其有价值因为视频本身就有大量冗余帧和重复信息如果每次处理都要完整描述每一帧的推理过程效率和稳定性都很难控制。2. 为什么视频推理比单图更需要内化思维2.1 视频推理的真正难点时间维度与事件结构视频和单图最本质的区别是时间维度。单图推理只需要解决“画面里有什么、在哪里、关系如何”视频推理还要解决“什么时间出现、持续多久、前后如何变化、哪个事件驱动了结果”。举例说判断“这个人是不是在搬东西”单帧只能看到姿态和物体位置真正可靠的判断往往需要看连续几帧的动作轨迹。判断“这个场景发生了冲突”更需要跨帧分析事件的前因后果。这些任务对显式思维链提出了更高要求模型不能只描述单帧内容还要描述帧间变化、事件顺序、因果联系。这种描述一旦展开长度会比单图推理链高一个数量级。更麻烦的是视频里大量信息是冗余的。背景可能几十帧不变人物动作可能只有关键几帧有变化。如果模型被迫对每一帧都做完整推理描述大部分 token 都在重复无关信息。2.2 显式推理在长视频场景下的成本问题这里说的成本不只是算力成本还包括时间成本和稳定性成本。先说算力和时间。Video 输入经过采样后通常仍然有大量视觉 token。显式推理要求模型在回答之前生成完整的观察文本这一步本身需要多次自回归解码再加上视频帧的视觉编码整体延迟会显著上升。再看稳定性。显式推理链越长出错概率越高。模型可能在某一帧的描述里引入错误前提后面的推理全部建立在错误前提之上。相比单图视频的错误传播路径更复杂排查起来也更困难。还有工程上的问题。显式推理链意味着输出结构不稳定下游任务如果依赖结构化结果需要额外解析中间文本。解析过程本身就是新的失败点。2.3 主动视频推理意味着什么“主动”这个词是理解 Internalized Visual Thinking 的关键。主动视频推理指的是模型在看到视频输入之后不是被动等待问题再逐帧搜索而是能够根据视频内容的显著性主动决定关注哪些片段、忽略哪些片段、把哪些事件关联起来。这种主动性在长视频里特别重要。一段十分钟的视频关键信息可能只出现在前三十秒和最后十秒。显式推理如果不加限制容易在无关帧上浪费大量计算内化后的模型则可能通过训练学会优先关注事件变化剧烈的帧段。可以这样理解主动不是模型自己编造问题而是在给定任务目标的前提下模型内部形成了一种注意力分配策略。它知道什么时候该看细节什么时候该跳过冗余帧。这种能力很难用显式规则写死因为每种视频的冗余模式不同。训练数据里如果包含了大量“先定位关键帧再回答”的完整推理样本模型就有机会把这种定位能力内化到参数中推理时不再逐字输出定位过程。3. 内化思维在模型层面如何理解和落地3.1 训练阶段推理过程如何被内化从训练角度看Internalized Visual Thinking 通常依赖“先显式、后内化”的路径。第一阶段让模型学习显式推理。使用包含视觉观察、中间推断、最终答案的标注数据让模型先学会“如何一步步看”。这一步的作用是建立能力模型需要知道视频里的事件结构是什么、关键帧怎么找、动作和结果之间怎么关联。第二阶段是内化压缩。目标是让模型在部分任务上减少甚至去掉中间推理输出同时保持最终答案质量。常见做法包括对推理链做精简、用蒸馏方式把长推理链模型的输出能力转移到短输出模型、或者在训练数据中混合显式推理样本和直接回答样本让模型自己学会在不同场景下选择不同的内部计算路径。这个阶段最需要谨慎的是内化不能变成“答案背诵”。如果训练数据只是把题目和答案配对模型可能会学到表面关联而不是真正的视觉推理能力。这也是为什么第一阶段不能跳过显式推理数据仍然承担着能力底座的作用。3.2 推理阶段从逐帧链式思考到整体判断推理阶段的变化更直观。传统 Visual CoT 是“每一帧看什么、看到什么、推断什么”逐层展开内化后的模型更接近“整体感知视频内容结合任务目标输出判断”。这个“整体判断”听起来像黑箱其实内部仍然有机制可循。模型通常会对视频帧做全局编码通过注意力机制筛选关键帧再结合问题信息生成回答。区别在于这些筛选和关联过程不再是文本化的中间步骤而是视觉 token 之间的注意力交互。实际操作时可以观察模型在不同帧上的注意力分布来判断它是否真正“看到了”关键信息。如果注意力集中在前几帧或者最后几帧说明模型学到了事件定位能力如果注意力均匀分散在所有帧上说明它还是朴素的全局平均并没有形成主动推理。3.3 需要关注的模型能力和评估维度评估 Internalized Visual Thinking 不能只看最终答案正确率还要关注以下几个维度第一推理能力的完整度。模型是不是还保留了对复杂时空关系的理解能力。可以准备一些需要多帧关联才能回答的任务比如“事件 A 发生后多久事件 B 发生”“哪个动作导致了最终结果”。这类任务能检验内化后模型是否还保留因果推理能力。第二效率提升幅度。对比显式推理版本和内化版本的单次推理耗时、输出 token 数、显存占用。如果效率没有明显提升内化的意义就减弱了。第三稳定性。连续跑多个视频样本观察输出是否稳定会不会出现同样的输入在不同位置采样时答案差异很大的情况。视频输入通常需要抽帧或采样采样策略会显著影响结果一致性。第四可解释性。虽然内化模型不输出逐步推理但我们仍然可以通过注意力图、关键帧定位等方式验证模型是否把资源花在了正确的位置上。4. 实际应用时怎么判断效果与边界4.1 适合 Internalized Visual Thinking 的任务场景从任务类型看以下场景更适合内化思维长视频内容理解。比如新闻视频、教学视频、监控录像这类冗长但关键信息稀疏的输入。显式推理会在无关帧上浪费计算内化模型更适合跳过冗余内容。时间敏感性任务。比如事件检测、动作时序判断、因果事件推理。这类任务需要在多个时间位置之间建立关联训练阶段把这种关联能力内化后推理时能更快给出结果。实时或近实时应用。视频推理如果延迟过高很多应用场景无法落地。内化思维通过减少中间解码 token可以明显降低端到端延迟。批处理场景。当需要同时处理大量视频时单个视频的 token 开销乘上样本数量总成本差异会非常可观。内化模型在这个场景下的性价比优势更突出。4.2 不适合或效果受限的场景内化思维并不是万能的。以下几种情况要谨慎。需要强解释性的场景。如果业务要求每个判断都必须附带完整的推理依据比如医疗辅助诊断、法律证据分析那么省略显式推理链会让审计和复核变得困难。这时候宁可接受更高的 token 成本也要保留可读的推理过程。细粒度空间推理任务。比如“图片里第七个物体的颜色是什么”这类需要精确计数的任务显式推理链仍然有优势因为模型可以通过逐步盘点来降低遗漏概率。内化后的模型如果内部计算不够精确计数错误率可能上升。罕见场景。训练数据覆盖不足的特殊视频内化模型可能直接给一个自信但错误的判断。显式推理至少可以通过中间描述暴露模型的误解让使用者有机会发现错误。4.3 评估指标和验证思路落地评估不要只盯着准确率建议设计一套更完整的验证矩阵。第一层是任务正确率保留原有评测集确认内化后没有明显掉点。第二层是推理效率对比统计平均输出 token 数、单视频处理耗时、峰值显存占用。对比对象应该是同一个模型的显式推理版本这样控制变量更干净。第三层是长视频压力测试分别用 30 秒、3 分钟、10 分钟的视频样本测试看模型在长视频上的性能衰减情况。很多模型短文表现好一拉长就崩这一步很关键。第四层是失败样本分析把答错的样本单独归类看是时间定位错误、事件关联错误还是物体识别错误。不同的错误类型指向完全不同的优化方向。5. 常见误区和排查思路5.1 误区一内化就是把模型蒸馏成“直接给答案”这是最容易踩的坑。Internalized Visual Thinking 不等于去掉推理只保留问答。如果训练时只保留问答对模型学到的只是题目和答案的统计关联对没见过的新视频类型几乎不会有推理能力。内化的前提是先有可内化的推理能力。训练流程里必须保留显式推理阶段或者至少使用包含结构化推理信号的训练数据。不能跳过前者直接做后者。5.2 误区二显式推理已经过时显式推理和隐式推理不是替代关系更像一个频谱上的两端。很多实际系统可以选择两者结合简单问题直接回答复杂问题先做显式观察再给结论。模型可以具备混合策略能在训练数据引导下自动决定是否需要展开推理。这比强制所有输入都走同一条路径更合理。5.3 效果不稳定时的排查顺序如果内化模型在测试中出现效果不稳定建议按下面的顺序排查先看输入采样。视频抽帧方式和采样密度是否一致。同一个视频用不同抽帧策略结果可能差很多这是视频任务最常见的坑。再看训练数据构成。显式推理样本和直接回答样本的比例是否合适。如果直接回答样本占比过高模型可能没有足够机会学习如何定位关键帧。接着看输出解码参数。视频推理任务对解码温度比较敏感温度过高容易让模型在时间关联上产生幻觉。可以先降低温度观察稳定性是否改善。最后看评估集本身。视频评测集如果本身存在标注模糊或需要常识补全的问题模型的波动可能来自评估标准不一致而不是模型能力退化。注意当视频任务出现结果波动我一般先固定统一抽帧策略再依次排查解码参数和训练数据比例。不要一上来就调模型结构那样很难定位问题。6. 给实践者的操作建议6.1 从现有模型开始的小规模验证方法如果你想验证 Internalized Visual Thinking 思路不一定要从零训练模型可以从现有视觉语言模型出发做小规模实验。第一步准备一个包含显式推理标注的视频问答数据集规模不用大几百条足够看趋势。第二步用数据对基座模型做监督微调让它先学会在视频问答时输出观察、推理和答案。这一步的目的是复现一个可用的显式推理基线。第三步构造精简版数据把中间推理文本压缩或删除只保留必要的时间定位信息和最终答案。用这个精简数据集继续微调。第四步对比两个版本在测试集上的准确率、耗时、输出 token 数和失败类型分布。如果精简版准确率持平或小幅下降但效率显著提升说明内化方向可行如果准确率崩了就需要回到训练数据比例上调整。6.2 数据、评测、监控三个层面怎么准备数据层面要保证训练数据覆盖不同类型的事件结构。不能全是“人的动作”类视频还要有物体状态变化、场景切换、多事件并发等复杂结构。每一条样本都要有明确的事件时间标注否则模型学不到时间定位能力。评测层面要区分“理解能力评测”和“效率评测”。理解能力看准确率效率评测看 token 和延迟。两者分开记录避免最后只看一个综合指标无法判断内化到底带来了什么。监控层面线上使用时要记录输入视频的时长、抽帧数、模型反应时间、输出长度、最终答案。长期监控这些数据才可以判断模型在不同视频类型上的表现是否稳定。6.3 值得跟进的方向目前这个方向有几个可以持续关注的点。一是混合策略的自动选择。模型能不能根据输入视频的复杂度自动决定走显式推理还是内化推理。这个能力很有价值但需要更精细的训练信号设计。二是训练数据的高效构建。高质量的视频推理数据标注成本很高如何用规则合成或者半自动方式生成带有时间结构标签的数据是工程落地的关键瓶颈。三是跨模态的内化。视频里往往同时有画面、语音、字幕等多模态信息内化思维是否也可以覆盖跨模态的主动推理比如根据对话内容决定关注哪段画面这是更有挑战的方向。从当前的技术节奏看Internalized Visual Thinking 短期内不会完全取代 Visual CoT。更可能出现的情况是两者在同一个系统里共存显式推理负责复杂问题和需要解释的场景内化推理负责高频简单问题和长视频快速定位。真正落地时最该盯住的不是概念叫什么而是输入采样是否统一、训练数据是否覆盖事件结构、线上日志能否支撑长期监控。把这三个问题解决掉这个思路就能从论文概念变成可用的工程能力。