Post #3045904
2026-04-07 11:21 UTC
@privacyfoss
זה עובד עם המנוע Tesseract מאחורי הקלעים, שלפחות בעבר לא היה טריוויאלי לגרום לו לעבוד טוב למטרה הזאת. OCRmyPDF עושה את כל ההתעסקות עם Tesseract בשבילנו וכוללת ממשק שורת פקודה ממש פשוט, עד כדי `ocrmypdf input.pdf output.pdf`.
תכונה חשובה בשבילי: תמיכה במלא שפות (כולל וולשית, https://archlinux.org/packages/extra/any/tesseract-data-cym/) ובמסמכים מרובי־שפות (קריטי לחומרים סרוקים בבלשנות). עיבדתי ככה ספר על וולשית שסרקתי לפני עידנים, וכמטה קסם הוא חפיש עכשיו 🪄🔍
לקח קצת זמן עם 100% ניצולת CPU של כל הליבות, אבל שווה את זה.
Replies (0)
No replies.