升级 MoRI 依赖,修复 ionic RoCE 上 KV 传输 EOF 错误
作为一行依赖版本升级,无需精读实现细节;但 AMD、hi-cache、disaggregation 相关团队应关注验证结论与 CI 失败项,建议合入前确认 Extra/AMD ROCm 7.2 流水线失败是否与本次 bump 相关。值得关注的设计决策是:将 MoRI 的 pin 放在 Dockerfile ARG 中并附带 NIXL/UCX 构建注释,便于快速定位和追踪上游依赖版本。
标签列表
聚合结果
升级 MoRI 依赖,修复 ionic RoCE 上 KV 传输 EOF 错误
作为一行依赖版本升级,无需精读实现细节;但 AMD、hi-cache、disaggregation 相关团队应关注验证结论与 CI 失败项,建议合入前确认 Extra/AMD ROCm 7.2 流水线失败是否与本次 bump 相关。值得关注的设计决策是:将 MoRI 的 pin 放在 Dockerfile ARG 中并附带 NIXL/UCX 构建注释,便于快速定位和追踪上游依赖版本。
修复空暂存环水位不前进导致的 PD 暂存转发卡死
值得精读。两个设计点值得学习:一是环形缓冲区水位的经典解法——用 round 的单调性抵消 tail 归零带来的回退,保证异步 readiness 检查始终可推进;二是作者用"allocator-reset-only 仍失败"的对照实验把问题拆成两个正交缺陷,这种验证方法可复用到其他分布式状态同步类 bug。对维护 staging 传输层的同学,建议后续关注 `_send_watermark` 静默异常路径与订阅快照丢失时的补偿重试。
原始 PR · 作者 jambow0320 · 合并时间 2026-08-31 10:57
对齐三 PD 后端防御性协议行为,修复竞态与 KV 布局缺陷
值得精读。这是 RFC #33861 驱动的 staged refactor 的标杆 PR:1)范围控制——主动回退与 #35049/#35360 冲突的畸形消息隔离,避免扩大 scope;2)review 深度——rishabhsinha17 逐分支对照 Common planner 核验,并抓出 NIXL guard 差一行和 `_staging_ctx` 未关闭竞态两个真实问题;3)合并策略——遇到上游已落地等价实现时保留上游代码、丢弃本地重复分支,而不是强行 rebase 冲突。建议后续跟进两个遗留项:将测试合入主仓库、关闭 `_staging_ctx` 的 WATERMARK 竞态。
原始 PR · 作者 noron12234 · 合并时间 2026-08-30 14:26
修复 disaggregation 中任务引用丢失,防止后台任务被 GC 回收
值得精读,但收益主要在“模式”而不是“逻辑”:这是一个将 asyncio 官方建议落地为统一代码惯用法的教科书式小补丁。推荐关注三点:set + `add_done_callback(set.discard)` 的组合如何同时解决强引用与自动释放;rebase 过程中如何识别出上游已用 `asyncio.wait` 兜住引用的变化并主动丢弃 hunk;以及审阅者关于 hardening 与 bugfix 的定性争论——它提醒我们在评估此类修复时要区分“理论隐患”与“实际触发路径”。
原始 PR · 作者 CyberSecurityErial · 合并时间 2026-08-30 09:15
decode offload 状态改按 Req 实例隔离,修复 rid 重用竞态
值得精读。这是一次教科书式的异步生命周期键选择修复:通过将簿记键从“外部可重用的身份标识”切换为“内部持有确切引用的对象实例”,从根本上消除了跨请求状态串扰,且改动面极小。建议关注三点:一是 `Req` 对象作为字典键的哈希语义约定;二是 `_check_offload_progress` 中 ack 处理顺序与 `finish_event.synchronize()` 的配合;三是回归测试“先构造同 rid 双请求、再让迟到 ack 到达”的写法,可作为类似竞态复现的模板。
原始 PR · 作者 tianxiaojiang4 · 合并时间 2026-08-29 13:34
修复 ROCm 上 PD DSA fused TopK 失效,提速 2.92×
值得精读。本 PR 展示了平台差异性问题如何以最小改动解决,并提供了完整的验证方法论(包括 paired McNemar 检验、硬件实测与逐 worker 证据)。对于关注 AMD/ROCm 支持与 PD 解聚性能的开发者有参考价值。
DSA topk 广播在无 PyNCCL 时回退到进程组广播
该 PR 值得精读,因为它揭示了一个重要的设计决策:在核心路径上允许回退而不强制前置依赖。对于关注 DSA、TP/DP 并行和 CUDA 图的开发者有参考价值。
DCP1→N 传输打包成连续 RDMA 块,TTFT 最高降 39%
值得精读。核心看点:把 descriptor-bound 的传输瓶颈重新建模为带宽问题;`try_pack_dcp_src` 的 stream 同步与 fallback 设计;NIXL 异步读取与 chunk barrier 的配合方式;以及按 DCP rank 固定分区来支持并发异步提交的思路。建议重点阅读 `dcp_pack.py` 与 `nixl/conn.py::transfer_worker` 两处,理解 buffer 生命周期与同步语义后再评估是否移植到 DSPARK。