חילוץ נתונים מחוזה
נקרא גם: Contract Data Extraction · חילוץ שדות מחוזה · קריאת חוזה אוטומטית
חילוץ נתונים מחוזה הוא זיהוי אוטומטי של השדות המרכזיים בגוף המסמך — צדדים, תמורה, מועדים, ערבויות, הצמדות וסעיפים מיוחדים — והפיכתם לשדות שניתן לחפש, לסנן ולהתריע עליהם.
שלוש שכבות, לא אחת
מה שנקרא בשפה יומיומית "המערכת קוראת את החוזה" הוא בפועל שרשרת של שלושה שלבים נפרדים, וכל אחד יכול להיכשל בנפרד. הראשון הוא הפיכת הקובץ לטקסט — כאן OCR נדרש למסמכים סרוקים, וכאן גם נמצאת הנקודה הרגישה בעברית, בגלל כיווניות ובגלל איכות סריקה. השני הוא זיהוי השדות בתוך הטקסט. השלישי הוא נורמליזציה: הפיכת "בתום 24 חודשים ממועד המסירה" לתאריך קונקרטי בלוח שנה.
השלב השלישי הוא זה שקובע אם המערכת שימושית. שדה שחולץ כטקסט חופשי אינו מאפשר התראה; רק תאריך מנורמל מאפשר. זה מה שמייצר את ההבדל בין מאגר שניתן לחפש בו ובין מאגר שיודע להתריע.
השדות שנדרשים במינימום
- צדדים, כולל מספרי זיהוי ונציגים חותמים
- תמורה, מטבע, תנאי תשלום ומנגנון הצמדה
- תקופת החוזה, מועד תפוגה וחלון ההודעה לאי-חידוש
- ערבויות — סוג, סכום, תפוגה ותנאי החזרה
- סעיפים בעלי חשיפה: שיפוי, הגבלת אחריות, פיצוי מוסכם
- התחייבויות מתמשכות עם גורם אחראי ומועד
שאלות נפוצות
האם חילוץ אוטומטי מדויק ב-100 אחוז?
לא, ומערכת שמציגה את התוצאה כאילו כן — מסוכנת יותר מכזו שמסמנת ספק. הפרקטיקה הנכונה היא הצגת השדה יחד עם המקור בגוף החוזה, סימון מפורש של שדות שלא נמצאו, ואישור אנושי לשדות בעלי השפעה כספית. הערך אינו בהעלמת הבדיקה האנושית אלא בצמצומה מקריאה מלאה לאימות ממוקד.
האם זה עובד על חוזים סרוקים בעברית?
זה תלוי בעיקר באיכות הסריקה. מסמך סרוק באיכות סבירה ניתן לעיבוד, אבל עברית מציבה קשיים ייחודיים — כיווניות מעורבת של טקסט ומספרים, ראשי תיבות, וטבלאות שמאבדות מבנה. בפועל זה השלב שבו חוזים ישנים דורשים יותר אימות אנושי מחוזים דיגיטליים.