Skip to main content
تشغيل أي مهارة في Manus
بنقرة واحدة

auditing-llm-as-judge-reliability-measurement-validity

النجوم٢
التفرعات٠
آخر تحديث١٢ يوليو ٢٠٢٦ في ١٤:٢٢

Treats LLM-as-judge evaluator-replacement ambiguity as a measurement-validity problem. Judge upgrades are not interchangeable. Stronger judges reduce but don't remove position/verbosity bias. Proposes audit trails including dataset slices, bias probes, and error-dependence estimates. Activation: LLM-as-judge, evaluation reliability, measurement validity, evaluator bias, AI evaluation.

التثبيت

التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.

SKILL.md
readonly