| name | arabic-ml-model |
| name_ar | توثيق نموذج التعلم الآلي |
| description | Generate comprehensive ML model documentation in Arabic with explainability |
| description_ar | إعداد توثيق شامل لنماذج التعلم الآلي باللغة العربية مع إمكانية التفسير |
| category | developer |
| language | ar |
| dialect | msa |
| rtl | true |
| platform_claude | true |
| platform_gpt | true |
| platform_qwen | true |
| platform_jais | true |
| platform_falcon | true |
| platform_allam | true |
| compliance | [] |
| version | 1.0.0 |
| author | salman-shaikh |
| contributor_volunteer | true |
الهدف (Purpose)
يساعد هذه المهارة في إعداد توثيق شامل لنماذج التعلم الآلي باللغة العربية الفصحى، يتضمن وصف النموذج، البيانات المستخدمة، المقاييس، إمكانية التفسير (Explainability)، واعتبارات الأخلاقيات، لتسهيل فهم النموذج وصيانته ومراجعته.
متى تستخدم هذه المهارة (When to Use)
استخدم هذه المهارة عندما تحتاج إلى:
- توثيق نموذج تعلم آلي جديد
- إعداد ورقة مواصفات للنموذج
- شرح قرارات النموذج لأصحاب المصلحة
- إعداد مواد مراجعة النموذج
- إنشاء دليل استخدام للنموذج
تعليمات النموذج (Model Instructions)
أنت مهندس تعلم آلي محترف. عند توثيق النموذج:
مبادئ التوثيق الجيد
١. الشفافية: وصف واضح للقدرات والقيود
٢. القابلية للتكرار: معلومات كافية لإعادة الإنتاج
٣. إمكانية التفسير: شرح كيفية اتخاذ القرارات
٤. الأخلاقيات: مناقشة التحيز والآثار الاجتماعية
هيكل التوثيق
١. ملخص النموذج
٢. البيانات والتدريب
٣. الأداء والمقاييس
٤. إمكانية التفسير
٥. الاستخدام والقيود
٦. الصيانة والمراقبة
مثال (Example)
الطلب:
وثق نموذج تصنيف النصوص العربية بالمشاعر.
النتيجة المتوقعة:
# بطاقة توثيق النموذج
## نموذج تصنيف المشاعر في النصوص العربية
## Arabic Sentiment Analysis Model Card
---
## ١. معلومات عامة
| البند | التفاصيل |
|-------|----------|
| **اسم النموذج** | ArabSentiment-v1.0 |
| **الإصدار** | ١.٠.٠ |
| **تاريخ الإصدار** | ١٥/٠٧/١٤٤٧هـ (٢٠/٠١/٢٠٢٦م) |
| **المطور** | فريق الذكاء الاصطناعي |
| **نوع النموذج** | تصنيف نصوص (Sentiment Classification) |
| **اللغة** | العربية (MSA + لهجات) |
| **الترخيص** | MIT |
---
## ٢. ملخص تنفيذي
### ٢.١ وصف النموذج
نموذج تعلم آلي عميق (Deep Learning) مبني على معمارية AraBERT، مدرب لتصنيف النصوص العربية إلى ثلاث فئات مشاعر:
- **إيجابي** 😊
- **سلبي** 😞
- **محايد** 😐
### ٢.٢ حالات الاستخدام المقصودة
| الحالة | ملاءمة |
|--------|--------|
| تحليل آراء العملاء | ✅ مقصود |
| مراقبة وسائل التواصل | ✅ مقصود |
| تحليل استطلاعات الرأي | ✅ مقصود |
| التشخيص الطبي | ❌ غير مناسب |
| القرارات المالية الحرجة | ❌ غير مناسب بدون مراجعة |
### ٢.٣ الملخص الفني
| المعيار | القيمة |
|---------|--------|
| **المعمارية** | AraBERTv2-base |
| **عدد المعاملات** | ١١٠ مليون |
| **حجم النموذج** | ٤٤٠ ميجابايت |
| **وقت الاستدلال** | ٥٠ مللي ثانية/نص |
| **الدقة الكلية** | ٨٩.٥٪ |
---
## ٣. البيانات
### ٣.١ بيانات التدريب
| المجموعة | الحجم | المصدر |
|----------|-------|--------|
| **تدريب** | ٥٠,٠٠٠ نص | Twitter, Reviews, News |
| **تحقق** | ١٠,٠٠٠ نص | Twitter, Reviews |
| **اختبار** | ١٠,٠٠٠ نص | مصادر مستقلة |
### ٣.٢ توزيع الفئات
| الفئة | النسبة | الأمثلة |
|-------|--------|---------|
| **إيجابي** | ٣٥٪ | "منتج رائع، أنصح به" |
| **سلبي** | ٣٥٪ | "خدمة سيئة جداً" |
| **محايد** | ٣٠٪ | "وصل الطلب في الوقت المحدد" |
### ٣.٣ خصائص البيانات
| الخاصية | الوصف |
|---------|-------|
| **اللهجات** | فصحى (٦٠٪)، خليجي (١٥٪)، مصري (١٥٪)، شامي (١٠٪) |
| **المجالات** | منتجات (٤٠٪)، خدمات (٣٠٪)، أخبار (٢٠٪)، أخرى (١٠٪) |
| **طول النص** | ١٠-٢٠٠ كلمة (متوسط ٤٥ كلمة) |
| **الفترة الزمنية** | ٢٠٢٠-٢٠٢٤ |
### ٣.٤ معالجة البيانات المسبقة
```python
خطوات المعالجة:
١. تطبيع النص (توحيد الألف، الياء)
٢. إزالة التشكيل
٣. إزالة الروابط والإشارات
٤. تصحيح الأخطاء الإملائية الشائعة
٥. Tokenization باستخدام AraBERT tokenizer