用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/salmandev/arabic-skills-library --skill arabic-ml-model命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
基于 SOC 职业分类
正在显示 SKILL.md
| name | arabic-ml-model |
| name_ar | توثيق نموذج التعلم الآلي |
| description | Generate comprehensive ML model documentation in Arabic with explainability |
| description_ar | إعداد توثيق شامل لنماذج التعلم الآلي باللغة العربية مع إمكانية التفسير |
| category | developer |
| language | ar |
| dialect | msa |
| rtl | true |
| platform_claude | true |
| platform_gpt | true |
| platform_qwen | true |
| platform_jais | true |
| platform_falcon | true |
| platform_allam | true |
| compliance | [] |
| version | 1.0.0 |
| author | salman-shaikh |
| contributor_volunteer | true |
يساعد هذه المهارة في إعداد توثيق شامل لنماذج التعلم الآلي باللغة العربية الفصحى، يتضمن وصف النموذج، البيانات المستخدمة، المقاييس، إمكانية التفسير (Explainability)، واعتبارات الأخلاقيات، لتسهيل فهم النموذج وصيانته ومراجعته.
استخدم هذه المهارة عندما تحتاج إلى:
أنت مهندس تعلم آلي محترف. عند توثيق النموذج:
١. الشفافية: وصف واضح للقدرات والقيود ٢. القابلية للتكرار: معلومات كافية لإعادة الإنتاج ٣. إمكانية التفسير: شرح كيفية اتخاذ القرارات ٤. الأخلاقيات: مناقشة التحيز والآثار الاجتماعية
١. ملخص النموذج ٢. البيانات والتدريب ٣. الأداء والمقاييس ٤. إمكانية التفسير ٥. الاستخدام والقيود ٦. الصيانة والمراقبة
الطلب:
وثق نموذج تصنيف النصوص العربية بالمشاعر.
النتيجة المتوقعة:
# بطاقة توثيق النموذج
## نموذج تصنيف المشاعر في النصوص العربية
## Arabic Sentiment Analysis Model Card
---
## ١. معلومات عامة
| البند | التفاصيل |
|-------|----------|
| **اسم النموذج** | ArabSentiment-v1.0 |
| **الإصدار** | ١.٠.٠ |
| **تاريخ الإصدار** | ١٥/٠٧/١٤٤٧هـ (٢٠/٠١/٢٠٢٦م) |
| **المطور** | فريق الذكاء الاصطناعي |
| **نوع النموذج** | تصنيف نصوص (Sentiment Classification) |
| **اللغة** | العربية (MSA + لهجات) |
| **الترخيص** | MIT |
---
## ٢. ملخص تنفيذي
### ٢.١ وصف النموذج
نموذج تعلم آلي عميق (Deep Learning) مبني على معمارية AraBERT، مدرب لتصنيف النصوص العربية إلى ثلاث فئات مشاعر:
- **إيجابي** 😊
- **سلبي** 😞
- **محايد** 😐
### ٢.٢ حالات الاستخدام المقصودة
| الحالة | ملاءمة |
|--------|--------|
| تحليل آراء العملاء | ✅ مقصود |
| مراقبة وسائل التواصل | ✅ مقصود |
| تحليل استطلاعات الرأي | ✅ مقصود |
| التشخيص الطبي | ❌ غير مناسب |
| القرارات المالية الحرجة | ❌ غير مناسب بدون مراجعة |
### ٢.٣ الملخص الفني
| المعيار | القيمة |
|---------|--------|
| **المعمارية** | AraBERTv2-base |
| **عدد المعاملات** | ١١٠ مليون |
| **حجم النموذج** | ٤٤٠ ميجابايت |
| **وقت الاستدلال** | ٥٠ مللي ثانية/نص |
| **الدقة الكلية** | ٨٩.٥٪ |
---
## ٣. البيانات
### ٣.١ بيانات التدريب
| المجموعة | الحجم | المصدر |
|----------|-------|--------|
| **تدريب** | ٥٠,٠٠٠ نص | Twitter, Reviews, News |
| **تحقق** | ١٠,٠٠٠ نص | Twitter, Reviews |
| **اختبار** | ١٠,٠٠٠ نص | مصادر مستقلة |
### ٣.٢ توزيع الفئات
| الفئة | النسبة | الأمثلة |
|-------|--------|---------|
| **إيجابي** | ٣٥٪ | "منتج رائع، أنصح به" |
| **سلبي** | ٣٥٪ | "خدمة سيئة جداً" |
| **محايد** | ٣٠٪ | "وصل الطلب في الوقت المحدد" |
### ٣.٣ خصائص البيانات
| الخاصية | الوصف |
|---------|-------|
| **اللهجات** | فصحى (٦٠٪)، خليجي (١٥٪)، مصري (١٥٪)، شامي (١٠٪) |
| **المجالات** | منتجات (٤٠٪)، خدمات (٣٠٪)، أخبار (٢٠٪)، أخرى (١٠٪) |
| **طول النص** | ١٠-٢٠٠ كلمة (متوسط ٤٥ كلمة) |
| **الفترة الزمنية** | ٢٠٢٠-٢٠٢٤ |
### ٣.٤ معالجة البيانات المسبقة
```python
خطوات المعالجة:
١. تطبيع النص (توحيد الألف، الياء)
٢. إزالة التشكيل
٣. إزالة الروابط والإشارات
٤. تصحيح الأخطاء الإملائية الشائعة
٥. Tokenization باستخدام AraBERT tokenizer
| المكون | المواصفات |
|---|---|
| الأجهزة | 4x NVIDIA V100 GPU |
| الإطار | PyTorch 2.0, Transformers 4.30 |
| الوقت | ١٢ ساعة |
| البصمة الكربونية | ١٥ كغ CO2 |
| المعلمة | القيمة |
|---|---|
| حجم الدفعة | ٣٢ |
| معدل التعلم | 2e-5 |
| عدد العصور | ١٠ |
| المحسن | AdamW |
| جدولة LR | Linear decay with warmup |
| التقنية | الإعداد |
|---|---|
| Dropout | ٠.١ |
| Weight Decay | ٠.٠١ |
| Early Stopping | ٣ عصور بدون تحسن |
| Data Augmentation | استبدال مرادفات عشوائي |
| المقياس | القيمة |
|---|---|
| الدقة (Accuracy) | ٨٩.٥٪ |
| الدقة الموزونة (Precision) | ٨٩.٢٪ |
| الاستدعاء (Recall) | ٨٩.٠٪ |
| F1-Score | ٨٩.١٪ |
| AUC-ROC | ٩٤.٣٪ |
| الفئة | Precision | Recall | F1-Score | الدعم |
|---|---|---|---|---|
| إيجابي | ٩١.٢٪ | ٨٨.٥٪ | ٨٩.٨٪ | ٣,٥٠٠ |
| سلبي | ٨٨.٥٪ | ٩٠.٢٪ | ٨٩.٣٪ | ٣,٥٠٠ |
| محايد | ٨٧.٩٪ | ٨٨.٣٪ | ٨٨.١٪ | ٣,٠٠٠ |
المتوقع
إيجابي سلبي محايد
الحقيقي إيجابي ٣٠٩٧ ١٥٠ ٢٥٣
سلبي ١٧٥ ٣١٥٧ ١٦٨
محايد ٢١٠ ١٨٠ ٢٦١٠
| نوع الخطأ | النسبة | المثال |
|---|---|---|
| سخرية/تهكم | ٣٥٪ من الأخطاء | "يا له من منتج رائع... NOT" |
| نفي مزدوج | ٢٠٪ من الأخطاء | "ما أقولش مش عاجبني" |
| تعبيرات مجازية | ٢٥٪ من الأخطاء | "كسر الخاطر" |
| لهجات غير مألوفة | ٢٠٪ من الأخطاء | نصوص مغاربية |
| المقياس | النموذج | بشري | الفرق |
|---|---|---|---|
| الدقة | ٨٩.٥٪ | ٩٢.٠٪ | -٢.٥٪ |
| الوقت/نص | ٥٠ مللي ثانية | ٢ ثانية | أسرع ٤٠x |
| الاتساق | ١٠٠٪ | ٨٥٪ | +١٥٪ |
| الطريقة | الوصف | التطبيق |
|---|---|---|
| Attention Visualization | عرض كلمات التركيز | فهم قرارات النموذج |
| LIME | تفسير محلي | شرح تنبؤات فردية |
| SHAP | قيم Shapley | أهمية الميزات العالمية |
| Saliency Maps | خرائط الأهمية | تمييز الكلمات المؤثرة |
النص: "المنتج جيد لكن الشحن كان بطيئاً جداً"
التنبؤ: سلبي (٦٥٪ ثقة)
التفسير:
الكلمات الأكثر تأثيراً:
- "بطيئاً" (+٠.٤٥ نحو سلبي)
- "جيد" (+٠.٣٠ نحو إيجابي)
- "لكن" (+٠.١٥ نحو سلبي - عكس الاتجاه)
الشرح: كلمة "لكن" عكست التركيز من "جيد" إلى "بطيئاً"
| نطاق الثقة | النسبة | الدقة الفعلية |
|---|---|---|
| ٩٠-١٠٠٪ | ٤٥٪ | ٩٦.٥٪ |
| ٧٠-٨٩٪ | ٣٥٪ | ٨٥.٢٪ |
| ٥٠-٦٩٪ | ١٥٪ | ٦٨.٩٪ |
| <٥٠٪ | ٥٪ | ٤٢.١٪ |
توصية: رفض التنبؤات بثقة <٦٠٪ للمراجعة البشرية
| المجموعة | الدقة | الفرق عن المتوسط |
|---|---|---|
| فصحى | ٩١.٢٪ | +١.٧٪ |
| خليجي | ٨٨.٥٪ | -١.٠٪ |
| مصري | ٨٩.٠٪ | -٠.٥٪ |
| شامي | ٨٧.٨٪ | -١.٧٪ |
| مغاربي | ٨٢.٥٪ | -٧.٠٪ ⚠️ |
| المصدر | التأثير | التخفيف |
|---|---|---|
| قلة بيانات اللهجات | متوسط | جمع المزيد من البيانات |
| نصوص مغاربية قليلة | عالي | شراكة مع مصادر مغاربية |
| تعبيرات ثقافية | منخفض | توسيع التغطية الثقافية |
| الإجراء | الجدول | المسؤول |
|---|---|---|
| جمع ١٠,٠٠٠ نص مغاربي | Q3 2026 | فريق البيانات |
| إعادة تدريب النموذج | Q4 2026 | فريق ML |
| تقييم شامل | Q1 2027 | فريق الجودة |
from arabic_sentiment import SentimentAnalyzer
# تهيئة النموذج
analyzer = SentimentAnalyzer(model_path="arab-sentiment-v1")
# تصنيف نص
result = analyzer.predict("المنتج رائع جداً!")
print(result)
# {
# 'label': 'إيجابي',
# 'confidence': 0.94,
# 'all_scores': {
# 'إيجابي': 0.94,
# 'سلبي': 0.03,
# 'محايد': 0.03
# }
# }
| المعلمة | الوصف | القيم المقبولة | الافتراضي |
|---|---|---|---|
threshold | حد الثقة الأدنى | ٠.٠-١.٠ | ٠.٦ |
return_explanation | إرجاع التفسير | True/False | False |
dialect | لهجة متوقعة | all/egyptian/gulf/levantine | all |
reviews = [
"منتج ممتاز، أنصح به بشدة",
"خدمة عملاء سيئة جداً",
"المنتج وصل في الوقت المحدد"
]
for review in reviews:
result = analyzer.predict(review)
print(f"{review} => {result['label']} ({result['confidence']:.2%})")
# تحليل دفعة من النصوص
batch_results = analyzer.predict_batch(tweets, batch_size=32)
# تجميع الإحصائيات
summary = {
'إيجابي': sum(1 for r in batch_results if r['label'] == 'إيجابي'),
'سلبي': sum(1 for r in batch_results if r['label'] == 'سلبي'),
'محايد': sum(1 for r in batch_results if r['label'] == 'محايد')
}
| القيود | التأثير | workaround |
|---|---|---|
| السخرية والتهكم | دقة منخفضة (٥٥٪) | استخدام نموذج متخصص |
| اللهجة المغاربية | دقة أقل (٨٢٪) | انتظار الإصدار القادم |
| النصوص القصيرة جداً (<٥ كلمات) | دقة منخفضة | تجميع النصوص |
| المجالات المتخصصة (طبي، قانوني) | غير مدرب | Fine-tuning إضافي |
⚠️ لا تستخدم النموذج لـ:
✅ استخدامات مقبولة:
| الاعتبار | السياسة |
|---|---|
| الخصوصية | عدم معالجة بيانات شخصية |
| الموافقة | تحليل بيانات عامة فقط |
| الشفافية | الإفصاح عن استخدام AI |
| المساءلة | مراجعة بشرية للقرارات الحرجة |
| النشاط | التكرار | المسؤول |
|---|---|---|
| مراقبة الأداء | يومياً | نظام آلي |
| مراجعة الأخطاء | أسبوعياً | فريق ML |
| تحديث البيانات | شهرياً | فريق البيانات |
| إعادة التدريب | ربع سنوي | فريق ML |
| تقييم شامل | سنوياً | فريق الجودة |
| المقياس | الحد الأدنى | الإجراء |
|---|---|---|
| الدقة | ٨٥٪ | تنبيه إذا انخفض |
| زمن الاستجابة | ١٠٠ مللي ثانية | تحسين إذا زاد |
| معدل الأخطاء | ٥٪ | تحقيق إذا زاد |
| التحيز | ١٠٪ فرق | معالجة إذا زاد |
| الإصدار | التاريخ المخطط | التحسينات |
|---|---|---|
| v1.1 | Q2 2026 | تحسين اللهجة المغاربية |
| v1.2 | Q3 2026 | دعم اللهجة العراقية |
| v2.0 | Q4 2026 | معمارية محسنة، ٥ فئات |
| القناة | التفاصيل |
|---|---|
| GitHub Issues | github.com/arab-ai-models/sentiment/issues |
| البريد الإلكتروني | ai-team@company.com |
| التوثيق | docs.company.com/arab-sentiment |
| Discord | discord.gg/arab-ai |
| الإصدار | التاريخ | التغييرات |
|---|---|---|
| ١.٠.٠ | ١٥/٠٧/١٤٤٧هـ | الإصدار الأولي |
آخر تحديث: ١٥/٠٧/١٤٤٧هـ (٢٠/٠١/٢٠٢٦م)
© ٢٠٢٦ [اسم المؤسسة]. جميع الحقوق محفوظة.
---
## الكلمات المفتاحية (Trigger Keywords)
### العربية:
- "توثيق نموذج ML"
- "بطاقة نموذج"
- "تفسير نموذج ذكاء اصطناعي"
- "تقييم نموذج تعلم آلي"
- "توثيق خوارزمية"
### English/Romanized:
- "ML model documentation arabic"
- "model card arabic"
- "AI explainability arabic"
- "machine learning documentation"
- "arabic NLP model card"
---
## ملاحظات التوافق (Compatibility Notes)
### Claude
- هيكلة ممتازة للتوثيق التقني
- شامل ومنظم
### GPT-4
- جودة عالية في التفاصيل التقنية
- متوازن في الشرح
### Qwen
- دعم جيد للمصطلحات التقنية
- مناسب للتوثيق
### JAIS
- فهم أفضل للسياق العربي
- نموذج عربي أصلي
---
## المراجع (References)
- Model Cards for Model Reporting (Mitchell et al., 2019)
- Datasheets for Datasets (Gebru et al., 2018)
- Hugging Face Model Card Guidelines
- Google PAIR Model Card Toolkit
---
## سجل التغييرات (Changelog)
### v1.0.0
- الإصدار الأولي