仓库按顶层版本隔离。根目录不提供默认训练入口,必须先选择版本。
| 目录 | 定位 | 状态 |
|---|---|---|
v1/ |
成熟 LLM 主干;仅接收文字与可选图片,统一一步生成完整图片 | V1 工程基线已实现并通过 smoke/DDP 测试 |
v2/ |
自研多模态 Agent Core、连续状态桥和未来视频 Agent | 现有研究原型 |
research/ |
图像/视频模型与技术路线调研,只读参考 | 跨版本共享 |
版本规则:
- V1、V2 各自拥有
src/、configs/、scripts/、tests/、docs/。 - 不跨版本 import 源码,不共用训练配置,不覆盖对方 checkpoint。
- 数据原文件可以共享,但 manifest、mixture、缓存和训练输出必须带版本边界。
- V1 代码、配置、数据 schema、三阶段训练和推理入口已独立实现;一步 objective 的质量路线仍需在真实数据上比较 Direct、MeanFlow/Shortcut 等候选。
V1 当前已收敛的推理 contract 是:所有语义条件先进入同一个 LLM;LLM 的目标视觉 hidden states 再经过共享 One-step Visual Generator 和 VAE Decoder。文生图、编辑和补全没有不同模型路径,也不接收 mask、target geometry 或其他目标侧输入。
当前 V2 命令均从其目录运行:
cd v2
pip install -e ".[dev,perc,monitor]"
PYTHONPATH=src python -m pytest