🏆 Persian OCR Leaderboard

اولین لیدربوردِ عمومیِ OCR فارسی. بنچمارک: persian-ocr-bench — ۱۰۰ سندِ واقعیِ فارسی. متریک: CER (کمتر = بهتر). ستون‌ها قابلِ مرتب‌سازی‌اند.

⚠️ حالت فعلی: self-reported — این ست عمومی است (متنِ درست هم در دسترس است)، پس اعداد «خوداظهاری» و برای مقایسهٔ مرجع است، نه رقابتِ ضدِتقلب. نسخهٔ رسمیِ ضدِتقلب (ست تستِ held-out با GTِ مخفی + سنجشِ خودکار) به‌زودی به‌صورت یک مسابقهٔ Kaggle می‌آید.

# Model Type CER folded % CER strict % WER % Date
در حال بارگذاری…
📤 چطور مدلم را submit کنم؟

مدلت را روی ۱۰۰ تصویرِ بنچمارک اجرا کن و یک فایل predictions.json به‌شکلِ {"image_001":"متنِ کاملِ صفحه", ...} بساز. بعد امتیازت را با اسکریپتِ سنجش بگیر:

pip install datasets
python score_submission.py predictions.json "نامِ مدل" open "نویسنده"
# CER/WER چاپ می‌شود + یک خط JSON برای افزودن به لیدربورد

آن خطِ JSON را با یک Pull Request به دیتاستِ نتایج اضافه کن: persian-ocr-leaderboard-results (فایلِ results.jsonl). بعد از merge، اینجا زنده ظاهر می‌شود.

اسکریپتِ score_submission.py و سنجهٔ CER در ریپوی پروژه است. نسخهٔ خودکار (آپلود+امتیازِ آنی) با HF PRO فعال می‌شود.

CER strict = دقیق (نیم‌فاصله مهم است) · CER folded = بدونِ نیم‌فاصله/عادی‌سازی‌شده · ساخته‌شده برای پروژهٔ جزوه‌نویس.