Skip to main content

hebrew-llm-eval-suite

Sterne11
Forks4
Aktualisiert18. Juni 2026 um 21:12

Benchmark and compare LLMs on Hebrew reasoning, comprehension, sentiment, translation, and Israeli cultural knowledge. Wraps the HuggingFace Open Hebrew LLM Leaderboard tasks (HeQ reading comprehension, HebrewSentiment, Hebrew Winograd, NeuLabs-TedTalks translation) plus DictaLM 3.0 benchmark tasks (Summarization, Nikud diacritization, Israeli Trivia) into a reproducible evaluation harness. Runs evals against Claude, GPT, Gemini, AI21 Jamba, DictaLM, Llama, and local HuggingFace models. Produces comparison scorecards in JSON and markdown with per-task breakdowns. Use when choosing an LLM for a Hebrew product, answering procurement questions about Hebrew performance, validating a fine-tuned Hebrew model, or tracking Hebrew regressions after a model upgrade. Do NOT use for Arabic NLP evaluation, speech recognition benchmarking (use ivrit.ai leaderboard for ASR), or general English LLM benchmarks. Activate for: ื‘ื ืฆ'ืžืจืง ืขื‘ืจื™ืช, ื”ืฉื•ื•ืืช ืžื•ื“ืœื™ื, ื”ืขืจื›ืช ืžื•ื“ืœ ืฉืคื”, ื‘ื™ืฆื•ืขื™ ืขื‘ืจื™ืช, ืžื‘ื—ืŸ ื”ื‘ื ืช ื”ื ืงืจื, ื ื™ืชื•ื— ืจื’ืฉื•ืช, ื‘ื—ื™ืจืช ืžื•ื“ืœ ืœ

Installation

Mit Codex oder Claude installieren Kopieren Sie diesen Prompt, fรผgen Sie ihn in Codex, Claude oder einen anderen Assistant ein und lassen Sie die Skill-Seite prรผfen und installieren.

Datei-Explorer
11 Dateien
SKILL.md
readonly