Post #992831
2026-04-07 11:15 UTC
RE: https://hed.im/@ruxotves/113317208367882753
יאללה, בהחלטה של רגע אני מחדשת את #שעון_מעורער (הסבר בציטוטיוט) ⏰
אמנם לא התעוררתי עכשיו, אבל אין סיבה לא להמליץ כבר עכשיו על משהו שבדיוק עשיתי בו שימוש ויצא מד—הים! 🔍📖
נכון PDF־ים? נכון ספרים סרוקים¹? נכון חלקם עם OCR וחלקם בלי? נכון להוסיף שכבת טקסט OCR זה סיוט ולא ממש עובד (לפחות מהנסיון שלי מפעם)? קבלו את OCRmyPDF, תוכנה חופשית בקוד פתוח שפשוטעובדת™:
⏰ https://github.com/ocrmypdf/OCRmyPDF
»
¹ בין אם מהעידן שלפני שדברים נעשו זמינים בפורמט דיגיטלי ללא דפוס ובין אם כי זה מה שיש זמין 🏴☠️
@privacyfoss
Replies (1)
-
@ruxotves@hed.im 2026-04-07 11:21
@privacyfoss זה עובד עם המנוע Tesseract מאחורי הקלעים, שלפחות בעבר לא היה טריוויאלי לגרום לו לעבוד טוב למטרה הזאת. OCRmyPDF עושה את כל ההתעסקות עם Tesseract בשבילנו וכוללת ממשק שורת פקודה ממש פשוט, עד כדי `ocrmypdf input.pdf output.pdf`. תכונה חשובה בשבילי: תמיכה במלא שפות (כולל וולשית, https://archlinux.org/packages/extra/any/tesseract-data-cym/) ובמסמכים מרובי־שפות (קריטי לחומרים סרוקים בבלשנות). עיבדתי ככה ספר על וולשית שסרקתי לפני עידנים, וכמטה קסם הוא חפיש עכשיו 🪄🔍 לקח קצת זמן עם 100% ניצולת CPU של כל הליבות, אבל שווה את זה.