多模态画面理解 → LLM剧本编排 → 多格式输出 (MoviePy / XML / JianYing)
本项目是一个面向自媒体与跨境电商场景的AI视频生产中转引擎,填补AI内容生成工具(如即梦)与专业剪辑软件(如剪映、PR)之间的工作流缝隙。
核心价值:
- 即梦等AI工具能生成海量素材,但缺乏精细编排能力
- 剪映/PR能精细编辑,但没有AI批量生成能力
- 本引擎作为中转站,将AI素材转化为可直接编辑的工程文件
用户只需在玻璃拟态可视化节点面板中导入源视频素材、输入灵感提示词,系统通过多模态LLM画面理解、LangGraph状态机编排、Edge-TTS配音生成,最终输出三种格式供用户选择。
- 🎨 玻璃拟态可视化工作流 (Vue Flow)
- 高颜值的前端交互,支持节点拖拽、一键批量上传源视频、实时动态流光连线
- 👁️ 多模态画面语义理解
- 使用多模态LLM(Agnes 2.0 Flash)进行语义级画面理解,输出"赛博朋克风格中景特写"这类高级描述
- 基于ThreadPoolExecutor的并行帧采样,配合OpenCV Laplacian方差检测自动过滤模糊废片
- 🧠 剧本反控画面架构 (Script-Driven Timeline)
- 通过独立Prompt模板,赋予LLM资深导演思维,强制输出结构化JSON分镜表
- 🎬 多格式输出
- MoviePy渲染MP4:通用格式,所有版本剪映/PR均可导入
- XML时间轴:专业交换格式,可导入剪映/PR/AE等主流剪辑软件
- 剪映草稿:可选,支持5.9及以下版本剪映直接打开
- 🎧 全自动多轨混音
- 基于Edge-TTS的主声轨生成,结合BGM自动压限与循环混缩
- 框架: Vue 3 + TypeScript + Vite
- UI/样式: Tailwind CSS
- 交互编排: Vue Flow
- 状态管理: Pinia
- 网关层: FastAPI
- 任务队列: Celery + Redis
- Agent编排: LangGraph
- 视觉理解: 多模态LLM (Agnes 2.0 Flash)
- 视频渲染: MoviePy
- 草稿导出: pyJianYingDraft
- 音频生成: Edge-TTS
video-workflow/
├── frontend/ # Vue 3 节点流可视化前端
│ └── src/
│ ├── components/ # Vue Flow 自定义节点
│ └── App.vue # 画布主入口
├── backend/ # FastAPI + Celery 核心引擎
│ └── app/
│ ├── graph.py # 【核心】多模态理解与多格式输出
│ ├── main.py # 接口网关与 SSE 服务端推送
│ ├── celery_app.py # 分布式任务消费者
│ └── skills/ # Prompt 模板
└── README.md
cd frontend && npm install && npm run devcd backend && uv sync && uv run uvicorn app.main:app --host 127.0.0.1 --port 8000cd backend && uv run celery -A app.celery_app worker --loglevel=info --pool=threads用户上传素材 + 输入提示词
↓
多模态LLM画面语义理解
↓
LLM生成结构化分镜剧本
↓
Edge-TTS配音生成
↓
多格式输出(三选一或全部)
├─ MoviePy渲染 → MP4视频
├─ XML时间轴 → 可导入剪映/PR/AE
└─ 剪映草稿 → 5.9及以下版本直接打开
