اولین لیدربوردِ عمومیِ OCR فارسی. بنچمارک: persian-ocr-bench — ۱۰۰ سندِ واقعیِ فارسی. متریک: CER (کمتر = بهتر). ستونها قابلِ مرتبسازیاند.
⚠️ حالت فعلی: self-reported — این ست عمومی است (متنِ درست هم در دسترس است)، پس اعداد «خوداظهاری» و برای مقایسهٔ مرجع است، نه رقابتِ ضدِتقلب. نسخهٔ رسمیِ ضدِتقلب (ست تستِ held-out با GTِ مخفی + سنجشِ خودکار) بهزودی بهصورت یک مسابقهٔ Kaggle میآید.
| # | Model | Type | CER folded % | CER strict % | WER % | Date |
|---|---|---|---|---|---|---|
| در حال بارگذاری… | ||||||
مدلت را روی ۱۰۰ تصویرِ بنچمارک اجرا کن و یک فایل predictions.json بهشکلِ {"image_001":"متنِ کاملِ صفحه", ...} بساز. بعد امتیازت را با اسکریپتِ سنجش بگیر:
pip install datasets python score_submission.py predictions.json "نامِ مدل" open "نویسنده" # CER/WER چاپ میشود + یک خط JSON برای افزودن به لیدربورد
آن خطِ JSON را با یک Pull Request به دیتاستِ نتایج اضافه کن:
persian-ocr-leaderboard-results
(فایلِ results.jsonl). بعد از merge، اینجا زنده ظاهر میشود.
اسکریپتِ score_submission.py و سنجهٔ CER در ریپوی پروژه است. نسخهٔ خودکار (آپلود+امتیازِ آنی) با HF PRO فعال میشود.
CER strict = دقیق (نیمفاصله مهم است) · CER folded = بدونِ نیمفاصله/عادیسازیشده · ساختهشده برای پروژهٔ جزوهنویس.