Skip to content

fix(sc): apply reward scaling before advantage estimation - #3787

Open
tianyi-zhang-02 wants to merge 14 commits into
NVIDIA-NeMo:mainfrom
tianyi-zhang-02:fix/sc-grpo-knob-parity
Open

fix(sc): apply reward scaling before advantage estimation#3787
tianyi-zhang-02 wants to merge 14 commits into
NVIDIA-NeMo:mainfrom
tianyi-zhang-02:fix/sc-grpo-knob-parity