背景
当前跨节点 Combine 被拆成两个阶段:
COMBINE_PUBLISH_ONLY
- Host Barrier
COMBINE_CONSUME_ONLY
该方案需要两个通信域、两次 Kernel Launch 和多次 Host/Device 同步。
目标
跨节点 Combine 使用同一个 TileXR 通信域,在一次 Kernel Launch 内完成:
- 发布本 Rank 数据。
- 通知其他 Rank 数据就绪。
- 等待 Peer Ready Signal。
- 获取远端数据并完成 Reduce。
- 发布完成状态。
Native Combine 不再依赖 Host phase_barrier。
实现要求
- 使用 magic-tagged Signal 支持通信窗口多轮复用。
- 保证 Payload 写入完成后才能发布 Ready Signal。
- 支持超时和远端失败处理,不能无限等待。
- 支持 Memory 和 UDMA 路径,UDMA 不可用时不能影响已有路径。
- 保留现有 ABI Flag 的兼容性,但默认路径不再使用 Publish/Consume 拆分模式。
验收标准
相关代码
integrations/moonep_torch/tilexr_moonep/torch_api.py
src/moonep/combine/kernels/tilexr_moonep_combine_kernel.cpp
src/moonep/combine/host/combine_layout.cpp
背景
当前跨节点 Combine 被拆成两个阶段:
COMBINE_PUBLISH_ONLYCOMBINE_CONSUME_ONLY该方案需要两个通信域、两次 Kernel Launch 和多次 Host/Device 同步。
目标
跨节点 Combine 使用同一个 TileXR 通信域,在一次 Kernel Launch 内完成:
Native Combine 不再依赖 Host
phase_barrier。实现要求
验收标准
rank_per_dev=1六阶段 correctness 通过。相关代码
integrations/moonep_torch/tilexr_moonep/torch_api.pysrc/moonep/combine/kernels/tilexr_moonep_combine_kernel.cppsrc/moonep/combine/host/combine_layout.cpp