AVA-Encoder:面向智能体原生视频表征学习框架

📅 2026/8/13 21:30:38
AVA-Encoder:面向智能体原生视频表征学习框架
AVA-Encoder面向智能体原生视频表征学习框架arXiv2608.12313v1摘要当前创意智能体难以从成熟人类影视作品中学习创作逻辑核心瓶颈是缺少一套智能体原生结构化视频表征该表征需要同时完整留存影片细节、适配大模型推理、支持灵活编辑。本文提出AVA-Encoder智能体原生视频自编码框架将原始视频转换为知识图谱K(\mathcal{G})表征并实现完整视频重建。该图谱以分层文本节点为核心配套多媒体素材存储层通过分类边记录剧情、人物、镜头、音视频之间的关联关系天然支持智能体查询、修改、复用。基于重建误差设计双循环文本梯度优化机制外层循环完成与数据无关的编码策略伪训练内层循环针对单条视频做数据驱动的知识图谱精细化修正。在标准化重建基准测试中AVA-Encoder相较最优基线整体指标提升20.7个百分点仅使用优化后的编码策略关闭图谱内层修正时对比人工精心调校的提示词方案指标提升1.4个百分点同时提示词token用量降低74.3%。本文开源完整AVA-Encoder框架、标准化智能体视频重建评测基准、全球首套电影知识图谱数据集配套图编辑工具可实现跨镜头一致性视频修改。目录引言2 相关工作2.1 智能体视频生成系统2.2 智能体原生视频表征3 任务定义3.1 问题形式化3.2 优化目标4 方法AVA-Encoder整体架构4.1 智能体视频编码器4.2 知识图谱表征结构4.3 双循环文本梯度演化机制4.3.1 重建误差与两类优化指标4.3.2 外层循环数据无关编码策略伪训练4.3.3 内层循环数据驱动图谱精细化修正5 实验5.1 实验配置5.1.1 数据集5.1.2 模型配置5.1.3 评测体系5.1.4 对比基线5.1.5 自动化图编辑实验5.1.6 研究问题RQ设计5.2 RQ1视频重建保真度整体结果5.3 RQ2双循环模块独立贡献与消融5.3.1 分层理解与策略迭代效果5.3.2 内外循环独立增益5.3.3 接纳门控消融实验5.4 RQ3知识图谱可编辑性实验5.5 RQ4下游视频生成复用实验6 结论参考文献附录A 文本梯度与AVA-Encoder自优化原理A.1 Text(\mathcal{G})rad基础理论A.2 AVA-Encoder结构化文本梯度实现B 重建评测全套指标B.1 四大评测维度与八大评估方向B.2 直接视频/关键帧打分规则B.3 盲反向字幕打分规则B.4 重建评测专用系统提示词B.5 基准分数聚合计算方式B.6 人工评测对齐验证C 循环优化所用重建奖励函数C.1 奖励函数配套提示词C.2 奖励函数在双循环中的调用逻辑D 双循环接纳门控细则D.1 关键帧图谱修正门控D.2 视频镜头图谱修正门控D.3 编码策略伪训练接纳门控D.4 编码策略伪训练完整流程E 智能体编码器全套系统提示词F 基线模型适配与公平性控制方案F.1 VideoAnalyzer基线适配F.2 Storyboard Studio基线适配F.3 soap2soap基线适配F.4 原始像素禁用规则F.5 表征token预算约束F.6 生成器共享与时序对齐方案(\mathcal{G}) 数据集与可复现性完整说明(\mathcal{G}).1 开源电影知识图谱数据集(\mathcal{G}).2 伪训练/评测视频库(\mathcal{G}).2.1 伪训练视频集(\mathcal{G}).2.2 评测视频集H 细粒度重建定量结果附表I 消融实验定义与指标差值J 知识图谱构建与编辑完整规范J.1 图谱存储范式J.2 图谱构建与修改传播机制K 额外定性可视化结果K.1 多方法重建对比图K.2 图谱拓扑编辑案例K.2.1 素材闭合规则K.2.2 语义一致性校验K.2.3 分层更新逻辑K.2.4 按编辑类型传播规则L 下游故事视频评测细则M 全套系统原始提示词文本1 引言近两年大模型驱动的视频智能体已实现剧本撰写、分镜设计、短视频生成但现有系统难以产出院线级完整影视作品。核心短板是缺少完整影视创作规划能力无法统筹剧本、人物、镜头、视听多维度复杂决策。高质量专业影片蕴含海量编剧、人物塑造、运镜、节奏、视听协调知识但现有智能体无法直接学习影片经验原始视频是密集多模态混合载体而智能体依靠文本、图谱、规划等结构化信息完成推理二者存在天然表征鸿沟。理想的智能原生视频表征需同时满足三大条件智能体可读文本化结构大模型可直接解析智能体可操作支持检索、局部修改、批量更新高保真完整留存重建所需全部视听、叙事信息。现有表征方案存在明显短板底层像素/视频嵌入视觉信息完整但智能体无法直接解读、修改线性字幕文本易丢失人物关系、时序事件、跨模态关联等结构化信息传统场景图/视频知识图谱仅适配检索、问答等理解任务丢失大量生成所需细粒度视听细节。针对上述痛点本文设计电影知识图谱表征将故事、事件、镜头分层存储结构化文本人物、场景、物体、运镜、音频等状态节点配套关联素材层通过分类边记录跨层级、跨模态依赖。修改局部节点后可自动同步所有关联镜头素材。基于该图谱本文提出AVA-Encoder自编码框架输入视频编码为知识图谱再固定解码器完成视频重建以重建误差作为优化信号分别迭代全局共享编码策略、单视频专属图谱。本文三大核心贡献提出智能体视频自编码范式AVA-Encoder设计双循环文本梯度优化机制在标准基准上整体重建指标达49.0%领先最优基线20.7个百分点仅使用外层伪训练策略时提示词token相比人工方案减少74.3%指标提升1.4%搭建全球首套面向重建保真度的视频表征评测基准包含4大评测维度、8类影视评估方向自动评测结果与人工标注匹配度97.3%开源首套大规模电影知识图谱数据集与配套图编辑工具支持可控视频改写、影片混剪、下游生成模型复用。图1 AVA-Encoder完整流程(a) 自编码闭环原始视频经智能编码器生成知识图谱固定解码器重建视频重建残差分别触发外层策略伪训练、内层图谱精细化修正(b) 分层智能编码器依次完成影片、镜头、关键帧三级理解全局上下文注入人物/场景/物体注册库© 知识图谱分层结构故事-事件-镜头层级配套多模态素材层支持子图拓扑联动编辑。2 相关工作2.1 智能体视频生成系统现有LLM驱动视频智能体依靠规划、工具调度完成生成/改写分为多智能协作生成框架、单模型编辑工具两大类。但现有系统缺少标准化高质量影片学习素材无法复用专业影视的成熟创作逻辑。AVA-Encoder将原始影片转化为可推理知识图谱提供完整创作记录支持智能体学习与联动编辑。2.2 智能体原生视频表征现有表征分为三类底层像素/隐向量信息完整但无法直接编辑线性字幕文本丢失结构化关联视频场景图仅面向检索、问答缺失生成所需视听细节。本文AVA-Encoder图谱以重建保真度为优化目标专为视频生成设计完整留存叙事、镜头、色彩等创作信息。3 任务定义本文将影视创作建模为智能体自编码任务输入原始视频输出可编辑知识图谱表征再通过固定解码器还原视频。3.1 问题形式化智能体视频编码器E由三层策略P ( P f i l m , P s h o t , P k f ) P(P_{film},P_{shot},P_{kf})P(Pfilm​,Pshot​,Pkf​)影片/镜头/关键帧提示词控制输入视频V VV输出知识图谱KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲\mathcal{G}\)KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲\(\mathcal{G}\)…知识图谱隐空间KaTeX parse error: Cant use function \( in math mode at position 10: \mathcal{\̲(̲\mathcal{G}\)}文本为核心分层结构故事/事件/镜头三层叙事节点人物/场景/物体/运镜/音频状态节点图像、音频、成片仅作为关联素材存储原始像素不参与表征存储。固定解码器Dec两阶段固定生成管线文本生成关键帧、关键帧生成完整镜头全程不读取原始视频像素仅依托图谱文本素材重建KaTeX parse error: Cant use function \( in math mode at position 23: …htarrow{E(;P)} \̲(̲\mathcal{G}\) \…3.2 优化目标外层循环数据无关策略伪训练使用批量训练视频{ V n } \{V_n\}{Vn​}优化镜头级编码策略P s h o t P_{shot}Pshot​影片、关键帧策略与生成模型全部冻结。最大化单视频平均重建奖励KaTeX parse error: Cant use function \( in math mode at position 90: …}\sum_{n1}^{L}\̲(̲R_{\mathrm{rewa…内层循环数据驱动图谱修正编码策略冻结后仅优化当前输入视频专属图谱在可达图谱空间内最大化重建奖励KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲\mathcal{G}\)_{…内外循环不同时更新外层优化全局通用提示策略内层仅修正单条视频图谱。4 方法AVA-Encoder整体架构AVA-Encoder四大核心模块分层智能视频编码器、文本知识图谱表征、双循环文本梯度演化、重建误差优化指标。4.1 智能体视频编码器输入视频V VV经镜头分割算子划分为有序镜头序列执行粗到细三级分层理解上层全局上下文向下传递同时维护全局人物/场景/物体注册库保证跨镜头实体一致性C f i l m E f i l m ( V ; P f i l m ) C s h o t , i E s h o t ( s i , C f i l m ; P s h o t ) C k f , i E k f ( f i ∗ , C s h o t , i ; P k f ) \begin{align} \mathcal{C}_{\mathrm{film}} E_{\mathrm{film}}(V;P_{\mathrm{film}}) \\ \mathcal{C}_{\mathrm{shot},i} E_{\mathrm{shot}}(s_i,\mathcal{C}_{\mathrm{film}};P_{\mathrm{shot}}) \\ \mathcal{C}_{\mathrm{kf},i} E_{\mathrm{kf}}(f_i^{*},\mathcal{C}_{\mathrm{shot},i};P_{\mathrm{kf}}) \end{align}Cfilm​Cshot,i​Ckf,i​​Efilm​(V;Pfilm​)Eshot​(si​,Cfilm​;Pshot​)Ekf​(fi∗​,Cshot,i​;Pkf​)​​分层上下文整合后自动构建完整知识图谱KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲\mathcal{G}\)\…4.2 知识图谱表征结构图谱KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲\mathcal{G}\)(…分为文本节点、分类边、素材层三部分文本节点仅存储文本描述分层叙事Story、Event、Shot镜头状态Character、Scene、Object、Style、Camera、Audio关键帧资产节点关联生成图片素材不存储原图像素11类有向边层级包含、时序序列、人物关联、素材引用、音频归属、风格传递等优势修改任意节点后沿边自动更新全部关联镜头与素材实现全局一致性编辑。4.3 双循环文本梯度演化机制文本梯度以自然语言形式输出重建错误修正方向无需数值梯度适配LLM推理优化。图2 (a)内层循环单视频图谱迭代修正抗退化接纳门控(b)外层循环编码策略伪训练抗遗忘回放门控。4.3.1 重建误差与两类优化指标循环优化奖励KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲R_{\mathrm{rewa…用于内外循环迭代更新基于原子QA问答正确率计算定位具体错误、生成文本梯度最终评测指标R e v a l R_{\mathrm{eval}}Reval​统一四大维度、八大影视维度聚合分数仅用于横向对比基线不参与训练优化。KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲R_{\mathrm{rewa…单镜头计算公式KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲R_{\mathrm{rewa…R e v a l R_{\mathrm{eval}}Reval​加权聚合公式R e v a l ( V , V ^ ) ∑ d 1 D ω d e v a l ( 1 − r d e v a l ) , ∑ d 1 D ω d e v a l 1 R_{\mathrm{eval}}(V,\hat{V})\sum_{d1}^{D}\omega_{d}^{\mathrm{eval}}(1-r_{d}^{\mathrm{eval}}),\quad\sum_{d1}^{D}\omega_{d}^{\mathrm{eval}}1Reval​(V,V^)d1∑D​ωdeval​(1−rdeval​),d1∑D​ωdeval​14.3.2 外层循环数据无关编码策略伪训练批量输入视频序列迭代更新镜头级提示词P s h o t P_{shot}Pshot​每轮生成候选策略后通过回放记忆验证历史视频性能防止过拟合遗忘。接纳门控三大约束当前视频奖励提升、视觉指标小幅下降可控、历史回放指标不衰退。完整伪训练流程见算法1。4.3.3 内层循环数据驱动图谱精细化修正编码策略冻结后对当前视频图谱迭代优化分关键帧修正、完整镜头修正两种模式通过抗退化门控过滤会降低重建质量的候选图谱多次修正无改善则移交人工调整。完整流程见算法2。5 实验5.1 实验配置5.1.1 数据集伪训练集6段无重叠公开影视片段评测集18段动画、院线电影、AI短片共129个镜头、246个关键帧全程与训练集无交集。5.1.2 模型基座理解/评测模型(\mathcal{G})emini-3.1-Pro-Preview文本梯度改写模型Qwen-3.7-Max图像生成器Nano Banana Pro视频生成器HappyHorse 1.0全部大模型权重冻结仅迭代文本提示策略、图谱文本内容。5.1.3 四大评测维度Video(V)原始视频直接对比Keyframe(KF)关键帧视觉细节对比V-BC视频盲反向字幕匹配KF-BC关键帧盲反向字幕匹配八大评估维度人物、场景、空间位置、运动、音频、美术风格、运镜、叙事关键帧评测不含音频。自动评测与人工标注匹配度97.3%。5.1.4 对比基线VideoAnalyzer、Storyboard Studio、soap2soap全部基线共享图像/视频生成器禁止读取原始像素用于生成保证公平对比。5.1.5 自动化图编辑修改图谱人物/风格节点自动传播至全部关联镜头可视化展示跨镜头一致性改写效果。5.1.6 四大研究问题RQ1AVA-Encoder整体重建保真度是否超越现有基线RQ2外层策略伪训练、内层图谱修正各自独立贡献RQ3知识图谱拓扑联动编辑可行性RQ4该表征能否提升各类下游视频生成模型效果。5.2 RQ1重建保真度整体结果表1 各方法重建整体指标越高越好方法Video(%)KF(%)V-BC(%)KF-BC(%)Overall(%)VideoAnalyzer26.128.59.721.721.5Storyboard Studio16.428.69.623.019.4soap2soap36.739.515.821.328.3AVA-Encoder(完整)57.873.729.734.649.0结论AVA-Encoder全部维度最优整体指标领先最强基线soap2soap 20.7个百分点。5.3 RQ2双循环模块消融实验表2 模块消融整体指标实验配置VKFV-BCKFOverall单层编码器无任何循环35.138.415.421.127.5分层编码器仅内层图谱修正52.771.823.933.145.4分层编码器仅外层策略训练55.668.326.632.745.8分层编码器无内外循环50.767.621.229.942.4人工调校编码策略无循环53.568.125.830.244.4移除所有接纳门控53.167.224.329.443.5完整AVA-Encoder57.873.729.734.649.0核心结论分层三级理解相比单层提升18.3个百分点仅外层策略训练对比人工调校提示词提升1.4%token从31336降至8052减少74.3%内外循环同时启用相比无循环基线整体提升6.6个百分点相对15.6%接纳门控有效防止优化退化增加5.5个百分点收益。5.4 RQ3知识图谱可编辑性图谱支持四类标准化编辑人物替换、美术风格统一、剧情修改、运镜参数调整修改单一节点自动遍历所有关联子图无关镜头保持不变。图4 (a)现代短片多镜头人物替换(b)古装剧跨镜头人物统一替换人物形象全局同步场景、剧情不受干扰。5.5 RQ4下游生成复用实验表3 有无AVA图谱参考下游生成评分1-4分生成框架无图谱参考引入图谱参考提升维度MovieAgent2.473.30人物、叙事、美术FilmAgent1.852.83人物、镜头、风格Anim-Director1.852.50人物、运镜VideoStudio1.901.95运镜、美术结论全部主流智能视频生成框架引入AVA图谱后综合质量提升图谱提供完整标准化叙事、视听先验降低生成逻辑断裂、人物崩坏概率。6 结论本文提出AVA-Encoder智能体原生视频自编码框架以电影知识图谱作为中间表征搭配分层编码器、双循环文本梯度优化机制实现高保真影片编码与重建。完整系统整体重建指标49.0%相较最优基线提升20.7个百分点仅外层策略方案提示词开销降低74.3%性能优于人工调校提示。图谱支持拓扑联动编辑可无缝对接各类下游视频智能体。未来方向拓展长时序多集剧集图谱、融合音频时序表征、支持交互式图谱可视化编辑工具。参考文献原文参考文献完整保留见arxiv原文https://arxiv.org/html/2608.12313v1附录附录A 文本梯度与AVA-Encoder自优化原理A.1 Text(\mathcal{G})rad基础Text(\mathcal{G})rad将LLM流程建模为文本计算图以自然语言反馈作为反向梯度无需数值微分适配提示词、图谱文本类变量迭代更新。A.2 AVA-Encoder结构化文本梯度定义原子修正记录KaTeX parse error: Cant use function \( in math mode at position 38: …u_{i}^{\mathrm{\̲(̲\mathcal{G}\)T}…存储错误维度、真值事实、重建事实、视听证据、修正指令批量错误记录聚合生成策略/图谱两类文本梯度分别用于内外循环更新。附录B 重建评测全套指标完整打分流程、四类评测方向、八大维度细则、人工对齐实验数据、VLM评测专用提示词完整原文。附录C 循环优化所用重建奖励函数QA问答库构建规则、视频/关键帧问答提示词、奖励函数在内外循环的调用计算流程、阈值参数完整数值。附录D 双循环接纳门控细则关键帧/镜头内层修正门控、外层伪训练抗遗忘回放门控、全部阈值、采样规则、伪训练分步伪代码。附录E 智能体编码器全套系统提示词初始策略、伪训练后策略、人工调校策略三套中英文完整提示文本。附录F 基线模型适配与公平性控制VideoAnalyzer/Storyboard Studio/soap2三套基线适配改造方案原始像素禁用规则、单镜头提示词token上限1200、每镜头最多5张生成参考图约束、统一图像/视频生成器细节。附录(\mathcal{G}) 数据集与可复现性(\mathcal{G}).1 开源电影知识图谱数据集数万条影视结构化知识图谱仅开放文本节点不含原始音视频素材支持自行对接生成模型渲染成片。(\mathcal{G}).2 视频库伪训练6段影视、评测18段影视完整片单、公开数据源链接、训练/测试无重叠划分规则。附录H 细粒度重建定量附表V、KF维度分维度完整数值表对应八大影视维度单项指标。附录I 消融实验定义与指标差值全部消融配置单项提升/下降绝对值、相对增益百分比。附录J 知识图谱构建与编辑完整规范J.1 图谱存储节点、边完整SchemaJ.2 编辑传播四大规则素材闭合、语义校验、分层更新、分编辑类型子图遍历算法。附录K 额外定性可视化多基线重建对比图、风格统一编辑可视化、图谱交互界面截图附录L 下游故事视频评测细则无参考人工式打分标准、五大下游评估维度分级规则。附录M 全套系统原始提示词编码器、奖励函数、评测、关键帧对比全部中英文提示原文存放于附件PDFappendix_prompts/AV-AE-system-prompts.pdf资源下载链接论文原文网页https://arxiv.org/html/2608.12313v1开源协议CC BY-NC-ND 4.0数据集、代码、全套提示词、实验脚本存放于arxiv论文附件基线复现完整训练/推理流程见附录F、(\mathcal{G})内外循环算法伪代码见原文算法1、算法2全部消融、定量实验完整表格、可视化图原文附录H-K。