Created by Codex and Xiaodong Cun (Corresponding Author), from GVC Lab, Great Bay University
本手册介绍视频生成的基本原理、模型结构、训练与推理流程、任务接口、数据处理和评测方法,面向学习、研究和系统开发。技术章节说明方法的输入输出、工作机制、适用条件、配置要求与常见故障;资源章节提供论文、模型和数据的查阅入口。
手册结构修订日期:2026-09-20。各章资料覆盖时间及动态资源状态见条目说明。本次编辑不代表所有模型均已复现或所有资源均已重新下载测试。
- 初次阅读从视频生成入门和方法分类开始。
- 实现具体任务时,先在任务分类确定输入、输出与约束,再进入相应专题。
- 选择模型与数据后,按评测方法固定配置、对照和验收条件。
- 按学习目标安排阅读顺序,可使用读者指南与论文阅读清单。
| 板块 | 核心入口 | 延伸专题 |
|---|---|---|
| 生成原理 | 生成模型路线 | 视频 Tokenizer · Video DiT · 推理加速(蒸馏 · 量化 · 剪枝 · 稀疏 · 缓存 · 系统) · Test-Time Scaling · 长视频生成 · 后训练与对齐 · 因果与流式生成 |
| 基础模型能力 | 能力地图 · 基础模型系统 | 个性化 · 细粒度控制 · 多视角/4D · 原生音视频 |
| 智能体与制作系统 | Agentic Video Generation | 规划与工具调用 · 视觉反馈 · 记忆与局部返工 · 预算与评测 |
| 编辑与时序任务 | 视频编辑 | 视频补全 · 视频修复 · 视频虚拟试衣 · 故事与多镜头 |
| 推理与世界模型 | Video Reasoning · World Model · World Action Model | 物理一致性 · 动作条件预测 · 交互式世界生成 |
| 应用与研究资源 | 应用系统 · 评测指南 | 精选阅读 · 开放模型 · 数据集 |
正文区分作者报告、本仓库复现、方法解释和建议实验。未经运行的实验设计均作为示例使用,不能当作已发布基准或实测结果。比较结果时,需同时记录模型版本、数据、硬件、采样预算和指标实现。符号、术语及记录模板见手册使用说明。
| 路径 | 内容 |
|---|---|
docs/ |
原理、任务、系统与评测章节 |
resources/ |
模型和数据资源 |
bibliography/ |
结构化文献元数据 |
assets/ |
图表与网页资源 |
sources/ |
来源记录、核验笔记与历史修订资料 |
scripts/ |
构建与检查工具 |
贡献前请阅读贡献指南。
如果本仓库对您的研究、教学或项目有帮助,欢迎引用:
@software{video_generation_101_2026,
title = {Video Generation 101: From Pixel Animation to World Model},
author = {Cun, Xiaodong and Video Generation 101 contributors},
year = {2026},
version = {0.1.0},
url = {https://github.com/GVCLab/Video-Generation-101}
}完整引用元数据请参见 CITATION.cff。
本仓库以 MIT License 发布。论文、数据集、模型及第三方材料仍遵循各自的许可证和使用条款。