Skip to main content
تشغيل أي مهارة في Manus
بنقرة واحدة

safe-flow-q-learning

النجوم٦
التفرعات٠
آخر تحديث٢٦ مارس ٢٠٢٦ في ١٥:٠٠

Train offline safe RL agents using Hamilton-Jacobi reachability principles to learn feasibility-gated policies. Combine reward and safety critics with flow-matching teacher policies, distill to one-step actors, and calibrate safety thresholds via conformal prediction—achieving near-zero constraint violations with 2.5× inference speedup.

التثبيت

التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.

SKILL.md
readonly