华为昇腾实现RL训推一致,性能提升60%
华为昇腾于8月5日宣布支持强化学习(RL)训推一致性方案,旨在解决大模型后训练阶段推理引擎与训练引擎之间的数值不一致问题。该问题源于底层累加不保序,模型越大、并行策略越复杂,误差越易放大,直接影响True-on-policy训练效果。 昇腾基于Ascend C编程语言对训推链路关键算子进行系统性约束与对齐,核心改动包…
华为昇腾于8月5日宣布支持强化学习(RL)训推一致性方案,旨在解决大模型后训练阶段推理引擎与训练引擎之间的数值不一致问题。该问题源于底层累加不保序,模型越大、并行策略越复杂,误差越易放大,直接影响True-on-policy训练效果。 昇腾基于Ascend C编程语言对训推链路关键算子进行系统性约束与对齐,核心改动包…