InfinityStar数据集构建指南:高效组织视频数据与特征提取流程

📅 2026/8/7 18:40:54
InfinityStar数据集构建指南:高效组织视频数据与特征提取流程
InfinityStar数据集构建指南高效组织视频数据与特征提取流程【免费下载链接】InfinityStar[NeurIPS 2025 Oral]Infinity⭐️: Unified Spacetime AutoRegressive Modeling for Visual Generation项目地址: https://gitcode.com/gh_mirrors/in/InfinityStarInfinityStar作为NeurIPS 2025 Oral收录的视觉生成模型其核心优势在于时空自回归建模技术。本文将详细介绍如何构建符合模型要求的视频数据集包括数据组织结构设计、特征提取流程及实战案例帮助开发者快速上手视频生成任务。数据集核心架构解析InfinityStar采用金字塔式时空建模架构要求数据集同时包含图像与视频的多尺度表示。从assets/framework.png可以清晰看到模型通过Image Pyramid和Clip Pyramid处理不同分辨率的视觉数据最终通过Spacetime Autoregressive Transformer实现生成任务。图1InfinityStar的时空自回归建模框架展示了图像金字塔与视频片段金字塔的协同工作方式数据集的核心组织原则包括支持多模态输入文本-图像-视频包含不同时间尺度的视频片段提供结构化的元数据标注标准数据集目录结构推荐采用项目内置的data/目录结构作为基准典型布局如下data/ ├── infinitystar_toy_data/ # 标准训练数据集 │ ├── split_jsonls/ # 分块标注文件 │ │ └── 000001/ # 按序列编号的标注块 │ ├── videos/ # 原始视频文件 │ └── split_jsonls_for_training.py # 数据划分脚本 └── interactive_toy_videos/ # 交互生成示例数据 └── [UUID]/ # 每个样本的独立目录 ├── 0000_refine_720p.mp4 # 生成结果视频 └── prompt.txt # 对应的文本提示这种结构既满足了模型训练对大批量数据的需求又保留了交互式生成的样本案例可通过data/infinitystar_toy_data/目录获取完整示例。视频数据预处理全流程1. 数据采集与格式要求视频数据需满足以下基本要求分辨率建议最低720p1280×720帧率24-30fps时长5-10秒的片段最佳格式H.264编码的MP4文件项目提供的示例视频如data/interactive_toy_videos/002a061bdbc110ca8fb48e7e0a663c94/0000_refine_720p.mp4展示了标准输入格式。2. 标注文件生成使用split_jsonls_for_training.py脚本将原始标注转换为模型所需的JSONL格式python data/infinitystar_toy_data/split_jsonls_for_training.py生成的JSONL文件包含以下关键字段video_path视频文件相对路径text_prompt描述视频内容的文本timestamp时间戳信息resolution视频分辨率标注3. 特征提取自动化工具项目提供专用特征提取脚本scripts/extract_video_features.sh可一键提取视频的时空特征bash scripts/extract_video_features.sh --input_dir data/videos --output_dir data/features该脚本会自动调用模型的视频编码器生成适用于训练的特征向量存储为二进制文件。实战案例从图片到视频数据集InfinityStar支持图像到视频I2V的生成任务以下是构建此类数据集的步骤准备参考图像选择清晰、构图良好的图片作为视频生成的起点创建文本描述为每张图像编写详细的动作描述如一只白猫头鹰在沙漠上空滑翔翅膀缓慢而有力地扇动生成示例视频使用工具脚本生成初始视频样本图2InfinityStar的图像到视频生成效果展示左列为参考图像右列为生成的视频帧序列从assets/i2v_examples.png可以看到即使是静态的玻璃苹果图像也能通过模型生成具有连续旋转效果的视频序列。视频到视频扩展数据集构建对于视频到视频V2V的生成任务数据集构建需要特别注意时序一致性。推荐采用以下策略选择具有明确动作的视频片段如行驶的汽车、歌唱的人物或运动的动物保留关键时间节点在标注中标记动作变化的关键时刻控制视角变化避免过于剧烈的镜头切换图3视频到视频生成的时间序列展示左侧为参考视频帧右侧为模型生成的扩展帧项目提供的assets/v2v_examples.png展示了从5秒参考视频扩展到10秒生成视频的效果特别是熊猫攀爬和厨师烹饪的案例体现了模型对复杂动作的捕捉能力。数据集质量评估指标为确保数据集质量建议从以下维度进行评估视觉一致性视频帧之间的物体形态、光照条件是否一致动作连贯性动作序列是否符合物理规律文本-视频对齐度生成内容是否准确匹配文本描述分辨率稳定性不同片段的分辨率是否保持一致可参考evaluation/VBench_rewrited_prompt.json中的评估提示词构建自动化评估流程。快速开始使用玩具数据集对于新手用户推荐直接使用项目提供的玩具数据集进行实验克隆仓库git clone https://gitcode.com/gh_mirrors/in/InfinityStar安装依赖pip install -r requirements.txt运行特征提取bash scripts/extract_video_features.sh启动训练python train.py --data_path data/infinitystar_toy_data通过以上步骤即可基于预构建的玩具数据集启动模型训练快速体验InfinityStar的视频生成能力。常见问题与解决方案Q: 视频文件过大导致处理缓慢怎么办A: 可使用工具脚本先进行降采样处理推荐使用tools/save_dataset_features.py控制特征分辨率。Q: 如何处理标注数据不平衡问题A: 可调整split_jsonls_for_training.py中的参数增加稀有类别的采样权重。Q: 特征提取过程中内存不足如何解决A: 减少批量处理大小或使用scripts/train_480p.sh脚本采用低分辨率模式。通过本文介绍的数据集构建方法开发者可以高效组织视频数据充分发挥InfinityStar模型的视觉生成能力。无论是图像到视频还是视频到视频的生成任务合理的数据集构建都是获得高质量结果的关键前提。【免费下载链接】InfinityStar[NeurIPS 2025 Oral]Infinity⭐️: Unified Spacetime AutoRegressive Modeling for Visual Generation项目地址: https://gitcode.com/gh_mirrors/in/InfinityStar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考