Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

6 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

🎬 Agnes Video Fission — AI 视频生产中转引擎 🎬

多模态画面理解 → LLM剧本编排 → 多格式输出 (MoviePy / XML / JianYing)

Demo

📌 项目定位

本项目是一个面向自媒体与跨境电商场景的AI视频生产中转引擎,填补AI内容生成工具(如即梦)与专业剪辑软件(如剪映、PR)之间的工作流缝隙。

核心价值

  • 即梦等AI工具能生成海量素材,但缺乏精细编排能力
  • 剪映/PR能精细编辑,但没有AI批量生成能力
  • 本引擎作为中转站,将AI素材转化为可直接编辑的工程文件

用户只需在玻璃拟态可视化节点面板中导入源视频素材、输入灵感提示词,系统通过多模态LLM画面理解LangGraph状态机编排Edge-TTS配音生成,最终输出三种格式供用户选择。


🌟 核心特性 (Key Features)

  • 🎨 玻璃拟态可视化工作流 (Vue Flow)
    • 高颜值的前端交互,支持节点拖拽、一键批量上传源视频、实时动态流光连线
  • 👁️ 多模态画面语义理解
    • 使用多模态LLM(Agnes 2.0 Flash)进行语义级画面理解,输出"赛博朋克风格中景特写"这类高级描述
    • 基于ThreadPoolExecutor的并行帧采样,配合OpenCV Laplacian方差检测自动过滤模糊废片
  • 🧠 剧本反控画面架构 (Script-Driven Timeline)
    • 通过独立Prompt模板,赋予LLM资深导演思维,强制输出结构化JSON分镜表
  • 🎬 多格式输出
    • MoviePy渲染MP4:通用格式,所有版本剪映/PR均可导入
    • XML时间轴:专业交换格式,可导入剪映/PR/AE等主流剪辑软件
    • 剪映草稿:可选,支持5.9及以下版本剪映直接打开
  • 🎧 全自动多轨混音
    • 基于Edge-TTS的主声轨生成,结合BGM自动压限与循环混缩

🛠️ 技术栈 (Tech Stack)

前端 (Frontend)

  • 框架: Vue 3 + TypeScript + Vite
  • UI/样式: Tailwind CSS
  • 交互编排: Vue Flow
  • 状态管理: Pinia

后端 (Backend)

  • 网关层: FastAPI
  • 任务队列: Celery + Redis
  • Agent编排: LangGraph
  • 视觉理解: 多模态LLM (Agnes 2.0 Flash)
  • 视频渲染: MoviePy
  • 草稿导出: pyJianYingDraft
  • 音频生成: Edge-TTS

📂 项目结构 (Project Structure)

video-workflow/
├── frontend/               # Vue 3 节点流可视化前端
│   └── src/
│       ├── components/     # Vue Flow 自定义节点
│       └── App.vue         # 画布主入口
├── backend/                # FastAPI + Celery 核心引擎
│   └── app/
│       ├── graph.py        # 【核心】多模态理解与多格式输出
│       ├── main.py         # 接口网关与 SSE 服务端推送
│       ├── celery_app.py   # 分布式任务消费者
│       └── skills/         # Prompt 模板
└── README.md

🚀 极速启动指南

1. 前端启动

cd frontend && npm install && npm run dev

2. 后端 API 网关启动

cd backend && uv sync && uv run uvicorn app.main:app --host 127.0.0.1 --port 8000

3. Celery 任务集群启动

cd backend && uv run celery -A app.celery_app worker --loglevel=info --pool=threads

🔮 工作流

用户上传素材 + 输入提示词
       ↓
多模态LLM画面语义理解
       ↓
LLM生成结构化分镜剧本
       ↓
Edge-TTS配音生成
       ↓
多格式输出(三选一或全部)
       ├─ MoviePy渲染 → MP4视频
       ├─ XML时间轴 → 可导入剪映/PR/AE
       └─ 剪映草稿 → 5.9及以下版本直接打开

About

🚀 端到端 AI 视频混剪裂变引擎:基于 YOLO 视觉解析与大模型剧本构思,全自动完成“智能抽帧 -> 文案生成 -> 情感配音 -> 踩点混音”,配合节点化可视化UI,一键生成爆款大片。

Topics

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages