sao-single-rollout-async-rl
Single-rollout Asynchronous Optimization (SAO) methodology for agentic RL. Replaces GRPO's group-wise sampling with single-rollout sampling to reduce off-policy effects and improve stability in asynchronous training. Successfully deployed for GLM-5.2 (750B-A40B).
Informações da origem
- Repositório
- hiyenwong/ai_collection
- Última atividade na origem
- 9 de julho de 2026 às 23:05
- Idioma detectado do SKILL.md
- inglês
- Estrelas
- 2
- Forks
- 0
Opções de instalação
Por padrão, está selecionado o prompt que primeiro revisa a origem. Você pode mudar para um comando direto ou baixar uma cópia local.
Revise os arquivos de origem
Leia o SKILL.md e os arquivos complementares exibidos pelo SkillsMP antes de decidir se vai instalar.