Yonghua Li

Results 2 issues of Yonghua Li

## Motivation 该 PR 旨在实现两个目标: 1. **简化 PD 分离的部署流程和参数**,包括端口号配置、RDMA 网卡检测、相关环境变量设置等等工序,实现【启动 Router】→【启动 P&D 实例】→【部署完成】的简易部署流程。其中启动参数的简化也期望适用于集中式部署和多 TP/DP 部署,并兼容通过 APIServer 和 MultiAPIServer 多 DP 服务的启动方式。 2. **重构当前代码中与端口号相关的配置处理和使用逻辑**。在参数初始化时,若用户未指定端口号,自动寻找可用端口,需要支持在线服务和离线接口;在多 DP 部署场景,在配置初始化时切分好各 DP 所需的端口号,而不是在使用时才临时切分。尽量实现配置的静态化、只读化,减少运行时的配置更改。 ## Modifications -...

## Motivation 对于 EP 模型,清除权重后的下一次权重更新,会直接执行一次 event_loop_normal 后半段的 execute_model,而此时 weight/cache 都还没有重建,导致执行出错。 > :bulb: If this PR is a Cherry Pick, the PR title needs to follow the format by adding the...