文档理解新高度NVIDIA-Nemotron-Parse-v1.1-TC视觉token压缩技术原理解析【免费下载链接】NVIDIA-Nemotron-Parse-v1.1-TC项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TCNVIDIA-Nemotron-Parse-v1.1-TC是一款基于Transformer的视觉编码器-解码器模型专为文档语义理解和文本表格元素提取而设计。该模型通过视觉token压缩技术实现了20%的速度提升同时保持了对复杂文档布局的精准解析能力是文档理解领域的突破性解决方案。视觉token压缩技术的核心优势视觉token压缩TC技术是NVIDIA-Nemotron-Parse-v1.1-TC的核心创新点通过4倍视觉token长度压缩实现了显著的性能提升速度提升20%相比上一代模型处理相同文档的时间减少五分之一保留页面元素顺序能正确维持表格、标题、图片、脚注等无序元素的页面顺序保持解析精度在压缩过程中不损失文本提取和语义理解的准确性优化资源占用降低显存使用需求使模型能在更多硬件环境中高效运行技术原理从像素到语义的智能压缩整体架构概览NVIDIA-Nemotron-Parse-v1.1-TC采用编码器-解码器架构主要由三部分组成视觉编码器基于ViT-H模型C-RADIO构建负责将图像转换为视觉特征适配器层通过1D卷积和归一化实现维度和序列长度压缩从13184 tokens到833 tokens文本解码器采用mBart架构10个blocks将视觉特征转换为结构化文本输出图NVIDIA-Nemotron-Parse-v1.1-TC对复杂文档布局的解析效果展示了不同语义元素的边界框识别压缩机制详解视觉token压缩通过以下关键步骤实现特征提取视觉编码器生成高维视觉特征1280维卷积降维使用1x1卷积将特征维度从1280降至1024空间重排通过像素洗牌pixel shuffle技术重组特征空间维度序列压缩应用 stride4 的卷积操作实现4倍序列长度压缩特征融合将压缩后的视觉特征与全局摘要特征融合核心压缩代码实现如下# 特征压缩与重组 output self.conv1(feature.permute(0,2,1)).permute(0,2,1) output self.layer_norm1(output) # 空间维度重排 output rearrange(output, b (h w) d - b d h w, hpixel_values.shape[-2] // patch_size, wpixel_values.shape[-1] // patch_size) # 4倍序列长度压缩 output self.conv2(output) output rearrange(output, b d h w - b (h w) d) output pixel_shuffle(output)实际应用效果展示表格提取能力NVIDIA-Nemotron-Parse-v1.1-TC能精准提取复杂表格结构包括多层表头、合并单元格等复杂格式并输出LaTeX格式的表格数据图模型对复杂表格的提取效果支持多行列合并的复杂表格结构公式与格式提取模型能识别并转换数学公式为LaTeX格式同时保留文本的原始格式信息图模型对数学公式和特殊格式文本的提取效果快速上手指南环境准备首先克隆仓库并安装依赖git clone https://gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TC cd NVIDIA-Nemotron-Parse-v1.1-TC pip install -r requirements.txt基础使用示例import torch from PIL import Image from transformers import AutoModel, AutoProcessor # 加载模型和处理器 model_path nvidia/NVIDIA-Nemotron-Parse-v1.1-TC device cuda:0 model AutoModel.from_pretrained( model_path, trust_remote_codeTrue, torch_dtypetorch.bfloat16 ).to(device).eval() processor AutoProcessor.from_pretrained(model_path, trust_remote_codeTrue) # 加载图像并处理 image Image.open(path/to/your/image.jpg) task_prompt /sspredict_bboxpredict_classesoutput_markdown inputs processor(images[image], texttask_prompt, return_tensorspt).to(device) # 生成结果 outputs model.generate(**inputs) generated_text processor.batch_decode(outputs, skip_special_tokensTrue)[0]后处理与结果解析from postprocessing import extract_classes_bboxes, transform_bbox_to_original, postprocess_text # 提取语义类别和边界框 classes, bboxes, texts extract_classes_bboxes(generated_text) bboxes [transform_bbox_to_original(bbox, image.width, image.height) for bbox in bboxes] # 格式化输出 table_format latex # 支持latex|HTML|markdown text_format markdown # 支持markdown|plain texts [postprocess_text(text, clscls, table_formattable_format, text_formattext_format) for text, cls in zip(texts, classes)]性能优化使用VLLM加速推理对于大规模部署可以使用VLLM进行推理加速# 安装VLLM及依赖 uv venv --python 3.12 --seed source .venv/bin/activate uv pip install githttps://github.com/amalad/vllm.gitnemotron_parse uv pip install timm albumentationsVLLM推理代码示例from vllm import LLM, SamplingParams sampling_params SamplingParams( temperature0, top_k1, repetition_penalty1.1, max_tokens9000, ) llm LLM( modelnvidia/NVIDIA-Nemotron-Parse-v1.1-TC, max_num_seqs64, limit_mm_per_prompt{image: 1}, dtypebfloat16, trust_remote_codeTrue, ) image Image.open(YOUR-IMAGE-PATH) prompts [{ prompt: /sspredict_bboxpredict_classesoutput_markdown, multi_modal_data: {image: image} }] outputs llm.generate(prompts, sampling_params)总结文档理解的新范式NVIDIA-Nemotron-Parse-v1.1-TC通过创新的视觉token压缩技术在保持高精度文档解析能力的同时实现了显著的性能提升。其核心优势包括高效压缩4倍视觉token压缩实现20%速度提升精准解析复杂布局、表格、公式的高精度提取灵活输出支持Markdown、LaTeX等多种格式输出易于部署兼容VLLM等推理加速框架无论是构建企业级文档处理系统还是为LLM/VLM提供高质量训练数据NVIDIA-Nemotron-Parse-v1.1-TC都展现出卓越的性能和广泛的应用前景为文档理解领域带来了新的技术范式。该模型已准备好商业使用遵循nvidia-open-model-license许可协议。如需更多支持可以通过NVIDIA企业支持渠道获取帮助。【免费下载链接】NVIDIA-Nemotron-Parse-v1.1-TC项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考