Skip to content

修复 PR #90 扩大 IPC 缓冲区对原有算子的影响 #92

Description

@Kur0x

背景

PR #90 为 EP memory dispatch/combine 调整了全局 IPC/通信缓冲区常量:

  • IPC_BUFF_MAX_SIZE: 100 MiB -> 512 MiB
  • TILEXR_BUFF_BYTES: 204 MiB -> 1028 MiB
  • TILEXR_COMM_BUFFER_SIZE: 200 MiB -> 1024 MiB

这些常量不仅被新增的 memory-mode 算子使用,也直接参与原有 src/comm 的设备内存分配,以及 collectives 和既有 EP 算子的缓冲区划分、偏移和数据量上限计算。因此合入后会显著增加原有算子的默认内存占用,并可能改变其既有内存布局和运行边界。

关联 PR:#90

后续工作

  • 审计 src/commsrc/collectives 和既有 src/ep 算子对上述全局常量的依赖及实际内存占用。
  • 将新增 EP memory mode 的容量需求与原有算子的默认通信缓冲区配置解耦,避免通过扩大全局常量改变所有算子的行为。
  • 保持原有 API 和算子的默认内存占用、缓冲区布局及可运行数据范围兼容。
  • 为旧路径补充回归验证,覆盖 communicator 初始化、代表性 collectives/EP 算子以及内存不足场景。

验收标准

  • 未启用新增 EP memory mode 时,原有算子不会因为 feat: add EP memory dispatch and combine #90 的改动额外申请大容量设备内存。
  • 新增 memory mode 使用独立、明确且有边界检查的缓冲区容量配置。
  • 原有算子在支持的 910B/910A5 路径上完成针对性回归验证;验证结论按实际硬件范围表述。

Metadata

Metadata

Assignees

No one assigned

    Labels

    bugSomething isn't working

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions