פרופ' מל רוזנברג שכר אותי כדי שאארגן את הארכיון האישי שלו. הארכיון כלל אלפי דפים שאותם סרקתי והמרתי לקבצי PDF. כדי שהוא יוכל למצוא את החומרים בתוך הערימה הדיגיטלית הענקית הזו, פיתחתי עבורו (זאת אומרת, ביקשתי מהגבינה המלאכותית שתפתח) מנוע חיפוש פשוט לתכנים שבקבצים.
יש לחלונות אפשרות לחפש בקבצי PDF אבל החיפוש לא נוח, ובייחוד לא מראה בקלות איפה נמצאים הקבצים.
התוכנה מחפשת טקסטים בקבצי PDF. אם הקבצים הם סרוקים והתבצע בהם זיהוי טקסט (OCR), התוכנה תחפש בשכבת הטקסט באותם קבצים.
אני מציע לעולם את התוכנה שפיתחתי (תודה למל שאישר לי להפיץ אותה) ללא תמורה, ללא תמיכה וללא אחריות כלשהי. אפשר גם להוריד את קוד המקור ב Python ולשפר אותה.
הבעיה הגדולה ביותר שאני צופה היא הורדת קובץ התוכנה. זהו קובץ exe שהרבה תוכנות הגנה לא יאפשרו להוריד. אין לי איך לעזור לכם בזה. תצטרכו למצוא דרך.
איך זה עובד?
שמים את הקובץ בתיקייה כלשהי במחשב, עדיף לא בתיקיית ההורדות.
כשמפעילים את התוכנה, ייפתח חלון שחור ובעקבותיו היא תפתח חלון בדפדפן.
החלון ייפתח בכתובת http://127.0.0.1:5000/. יכול להיות שמותקנת אצלכם תוכנת הגנה שלא תאפשר לכתובת הזו להפתח. גם במקרה הזה, אין באפשרותי לעזור לכם. תצטרכו למצוא פתרון.
לחצו על הקישור Settings כדי להגדיר לתוכנה איפה במחשב שלכם לחפש את הקבצים.
הגדירו את שם המאגר שלכם ואת המסלול שממנו תתחיל התוכנה לאנדקס את הקבצים.
לחצו על Update Settings ואז על Scan PDFs.
עכשיו בחלון השחור תתחילו לראות איך התוכנה עוברת על הקבצים ומוסיפה אותם לאינדקס.
התוכנה תיצור קובץ בשם pdf-database.db באותה תיקייה ששמרתם בה את קובץ התוכנה.
שימו לב! התוכנה לא יודעת בעצמה לאנדקס קבצים חדשים שהוספתם או שיניתם. אתם צריכים להיכנס בעצמכם להגדרות ולבצע את האינדוקס.
כאשר בחלון השחור תפסיק התנועה, תראו את השורות הבאות, והתוכנה תחזור לדף הראשי, סימן שאפשר להתחיל לחפש.
כך נראות תוצאות החיפוש
כאשר תלחצו על הקישור, קובץ ה PDF ייפתח על פי הגדרות הדפדפן שלכם.
עד כאן.
מקווה שתהנו ותעשו שימוש טוב בתוכנה.
אני מצטער שאני צריך להזכיר שוב שאין לי פנאי לתמוך ולסייע בהורדה והפעלת התוכנה. אם אתם לא מסתדרים לבד, אנא פנו למי שנמצאים סביבכם כדי לקבל עזרה.

