Skip to main content

evaluating-llms

Evaluate LLM systems using automated metrics, LLM-as-judge, and benchmarks. Use when testing prompt quality, validating RAG pipelines, measuring safety (hallucinations, bias), or comparing models for production deployment.

インストールへ移動

ソース情報

リポジトリ
ancoleman/ai-design-components
ソースの最終更新活動
2025年12月9日 21:02
検出された SKILL.md の言語
英語
スター
516
フォーク
73

インストール方法

デフォルトでは、最初にソースを確認する Prompt が選択されています。直接コマンドに切り替えるか、ローカルコピーをダウンロードすることもできます。

ソースファイルを確認

インストールを決める前に、SKILL.md と SkillsMP に表示されている付属ファイルをお読みください。