Decompose agent work across four specialized modules (planner, executor, verifier, generator) coordinated via evolving memory. Use Flow-GRPO to convert multi-turn sparse-reward optimization into sequential single-turn updates with outcome broadcasting, achieving 4-15% accuracy gains on benchmarks while scaling better than monolithic agent policies.
Installer avec Codex ou Claude Copiez ce prompt, collez-le dans Codex, Claude ou un autre assistant, puis laissez-le vérifier la page du skill et l'installer pour vous.
Une commande directe contourne le prompt de vérification. Examinez la source avant de l'exécuter.
Decompose agent work across four specialized modules (planner, executor, verifier, generator) coordinated via evolving memory. Use Flow-GRPO to convert multi-turn sparse-reward optimization into sequential single-turn updates with outcome broadcasting, achieving 4-15% accuracy gains on benchmarks while scaling better than monolithic agent policies.
In-the-Flow Agentic System Optimization (AgentFlow)
Core Concept
Monolithic agent policies struggle with long-horizon tool-use tasks and generalization to new scenarios. AgentFlow decomposes agent responsibilities across four specialized modules—planner, executor, verifier, generator—coordinated through an evolving memory. Flow-GRPO handles sparse multi-turn rewards by broadcasting outcomes to align local decisions with global success, enabling efficient credit assignment without reward decomposition.
Evaluation on 10 benchmarks demonstrates consistent improvements:
results = {
'workbench_tasks': {
'agentflow': '4.1-14.9% accuracy gains vs baseline',
'gpt4o_comparison': 'Outperforms on several categories',
'scaling': 'Gains increase with model scale (7B → 70B)'
},
'tool_use_benchmarks': {
'avg_improvement': '8.5%',
'generalization': 'Better zero-shot to unseen tool combinations'
}
}
Practical Guidance
Module Specialization: Separate planner (strategic), executor (tactical), and verifier (checking) roles. Specialization improves interpretability and allows targeted improvement.
Memory Design: Evolving memory should summarize old decisions to avoid unbounded growth. Compact summaries preserve decision rationale without token explosion.
Flow-GRPO Configuration: Group size 8-16 balances variance reduction with representation diversity. Clipping range [0.9, 1.1] controls optimization drift.
Scaling: Modular design shows consistent improvements across 7B, 13B, and larger backbones. Specialized modules fine-tune faster than monolithic policies.
When to Use / When NOT to Use
Use When:
Training agents on extended multi-turn tasks with tool use
Generalization to unseen task combinations is important
You need interpretable intermediate decisions (planning, verification)
Model scaling is planned (modular design improves with size)
This skill encodes techniques from "In-the-Flow Agentic System Optimization" (arXiv:2510.05592). Flow-GRPO and modular decomposition enable efficient credit assignment in sparse-reward agent training.