openjudge
Build custom LLM evaluation pipelines using the OpenJudge framework. Covers selecting and configuring graders (LLM-based, function-based, agentic), running batch evaluations with GradingRunner, combining scores with aggregators, applying evaluation strategies (voting, average), auto-generating graders from data, and analyzing results (pairwise win rates, statistics, validation metrics). Use when the user wants to evaluate LLM outputs, compare multiple models, design scoring criteria, or build an automated evaluation system.
Quellinformationen
- Repository
- agentscope-ai/OpenJudge
- Letzte QuellaktivitÀt
- 10. MĂ€rz 2026 um 09:06
- Erkannte Sprache von SKILL.md
- Englisch
- Sterne
- 792
- Forks
- 63
Installationsoptionen
StandardmĂ€Ăig ist der Prompt ausgewĂ€hlt, der zuerst die Quelle prĂŒft. Sie können zu einem direkten Befehl wechseln oder eine lokale Kopie herunterladen.
Quelldateien prĂŒfen
Lesen Sie SKILL.md und alle von SkillsMP angezeigten Begleitdateien, bevor Sie sich fĂŒr eine Installation entscheiden.