背景
PR #90 为 EP memory dispatch/combine 调整了全局 IPC/通信缓冲区常量:
IPC_BUFF_MAX_SIZE: 100 MiB -> 512 MiB
TILEXR_BUFF_BYTES: 204 MiB -> 1028 MiB
TILEXR_COMM_BUFFER_SIZE: 200 MiB -> 1024 MiB
这些常量不仅被新增的 memory-mode 算子使用,也直接参与原有 src/comm 的设备内存分配,以及 collectives 和既有 EP 算子的缓冲区划分、偏移和数据量上限计算。因此合入后会显著增加原有算子的默认内存占用,并可能改变其既有内存布局和运行边界。
关联 PR:#90
后续工作
- 审计
src/comm、src/collectives 和既有 src/ep 算子对上述全局常量的依赖及实际内存占用。
- 将新增 EP memory mode 的容量需求与原有算子的默认通信缓冲区配置解耦,避免通过扩大全局常量改变所有算子的行为。
- 保持原有 API 和算子的默认内存占用、缓冲区布局及可运行数据范围兼容。
- 为旧路径补充回归验证,覆盖 communicator 初始化、代表性 collectives/EP 算子以及内存不足场景。
验收标准
背景
PR #90 为 EP memory dispatch/combine 调整了全局 IPC/通信缓冲区常量:
IPC_BUFF_MAX_SIZE: 100 MiB -> 512 MiBTILEXR_BUFF_BYTES: 204 MiB -> 1028 MiBTILEXR_COMM_BUFFER_SIZE: 200 MiB -> 1024 MiB这些常量不仅被新增的 memory-mode 算子使用,也直接参与原有
src/comm的设备内存分配,以及 collectives 和既有 EP 算子的缓冲区划分、偏移和数据量上限计算。因此合入后会显著增加原有算子的默认内存占用,并可能改变其既有内存布局和运行边界。关联 PR:#90
后续工作
src/comm、src/collectives和既有src/ep算子对上述全局常量的依赖及实际内存占用。验收标准