Skip to main content
تشغيل أي مهارة في Manus
بنقرة واحدة

multi-modal-multi-environment-machine-teaching-robust-reward

النجوم٢
التفرعات٠
آخر تحديث١٢ يوليو ٢٠٢٦ في ١٤:٢٢

Hierarchical machine teaching algorithm for robust reward learning across multiple MDPs. Demonstrates comparisons impose stronger constraints than demonstrations in unlimited-data regime. Greedily selects informative environments then queries low-cost feedback. Activation: machine teaching, reward learning, inverse reinforcement learning, multi-environment, robust reward, feedback modalities.

التثبيت

التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.

SKILL.md
readonly