moshe-ship/mkhlab

arabic-ocr

التعرف على النص العربي في الصور — استخرج نص عربي من صور ومستندات ومخطوطات.

View source
Original skill document

Rendered from the source repository. Headings, examples, code, tables, links, and referenced images are preserved.

التعرف على النص العربي (OCR)

QARI-OCR (الأفضل للعربي)

عبر HuggingFace API

bash
curl -s -X POST "https://api-inference.huggingface.co/models/qari-ai/QARI-OCR-v0.3" \
  -H "Authorization: Bearer $HF_TOKEN" \
  -H "Content-Type: image/png" \
  --data-binary @IMAGE_FILE

Tesseract (محلي — بديل مجاني)

تثبيت

bash
# macOS
brew install tesseract tesseract-lang

# التأكد من دعم العربي
tesseract --list-langs | grep ara

استخراج النص

bash
tesseract IMAGE_FILE output -l ara
cat output.txt

عربي + إنجليزي معاً

bash
tesseract IMAGE_FILE output -l ara+eng

تحسين الدقة

bash
# تحسين الصورة أولاً
magick IMAGE_FILE -resize 300% -sharpen 0x1 -threshold 50% improved.png
tesseract improved.png output -l ara --psm 6

متى تستخدم

  • المستخدم يرسل صورة فيها نص عربي
  • يريد استخراج نص من مستند PDF ممسوح
  • يريد قراءة مخطوطة أو وثيقة قديمة
  • يريد تحويل صورة واتساب فيها نص لنص قابل للنسخ

أوضاع PSM (Page Segmentation Modes)

الوضعالاستخدام
--psm 3تلقائي (افتراضي)
--psm 6كتلة نص واحدة (الأفضل للمستندات)
--psm 7سطر واحد
--psm 8كلمة واحدة
--psm 13نص خام بدون OSD

القواعد

  • الصور الواضحة عالية الدقة تعطي نتائج أفضل
  • المخطوطات والخطوط المزخرفة تكون أقل دقة — نبّه المستخدم
  • إذا النتيجة ضعيفة، اقترح تحسين الصورة أولاً