开源项目 · Python · MIT · 视频

在视频工作流中的位置
ViMax 是由香港大学数据智能实验室(HKUDS)开源的 Agentic 多 agent 视频生成框架,定位是把导演、编剧、制片与视频生成器集成在同一个工作流中。用户只需输入创意概念(concept),ViMax 自动完成脚本撰写、分镜规划、角色一致性管理、参考图选择、镜头调度与最终视频生成,端到端流水线全部开源。
核心能力覆盖四大工作流。第一是 Idea2Video:输入一句话创意,自动展开为多角色多场景的完整视频故事;第二是 Novel2Video:接收小说/长文本输入,自动拆解为剧本并生成对应分镜;第三是 Script2Video:用户给剧本,自动规划镜头表与运镜节奏;第四是多机位模拟(Multi-Camera Simulation),模拟真实影视拍摄中的多机位调度,保持角色定位与场景一致性。
技术架构由 ScriptAgent(剧本拆解)、StoryboardAgent(分镜设计)、ImageSelectionAgent(参考图智能选择)、ImageGenerationAgent(图片生成)、VideoGenerationAgent(视频生成)等多 agent 协作。VideoGenerator 支持 Google Veo 等第三方模型,可插拔替换。ImageReference 机制确保长视频中角色与场景一致。
适用场景包括:影视前期分镜预演、小说/网文 IP 改编、营销短视频脚本可视化、教育培训内容生产、自媒体创作者快速试错。
上手门槛:Python 3.12 + uv 包管理 + OpenRouter API key + 至少一个视频生成 API key(Google Veo 推荐)。License 为 MIT,GitHub Star 11.1k / Fork 1.6k / 364 commits,最近 pushed 2026-07-13,长期活跃。
演示视频
在视频工作流中的位置
快速开始
部署教程与文档以外链形式呈现,未做内嵌以保证时效性。