Skip to main content
Back to all articlesRAG

RAG לא נועד רק לחיפוש: איך בונים מנוע ידע שלא מזייף

צ
צוות Goldfish Systems· Knowledge Engineering
June 15, 2026 7 min read

למה רוב מערכות ה-RAG מתרסקות בקנה מידה אמיתי

הדמו עבד מצוין על 200 מסמכים. אז הזנתם את בסיס הידע האמיתי — עשרות אלפי מסמכים, רבים מהם מיושנים, סותרים או לא רלוונטיים — והדיוק צנח. המערכת החלה "להזות" דווקא בשאלות הכי קריטיות.

השלבים שאסור לדלג עליהם

1. ניקוי והיררכיה של הידע

מסמך ישן שסותר מסמך עדכני הוא מתכון להזיות. לפני האינדקסציה חייבים גרסאות, תיוג תוקף והיררכיית מקורות.

2. שליפה מדויקת, לא רק סמנטית

חיפוש סמנטי לבדו לא מספיק. שילוב של מפתוח היברידי (lexical + semantic) עם re-ranking מעלה את הדיוק משמעותית בשאילתות מורכבות.

3. ציטוט מקור לכל תשובה

כל תשובה חייבת לכלול הפניה למסמם המקור. אם המערכת לא מצליחה לציין מקור — התשובה לא מופצת.

הבדלי גרסאות ובקרת תוקף

בתחומים מוסדרים (ביטוח, פיננסים) מסמך שפג תוקפו מסוכן לא פחות ממידע שגוי. מנוע ידע ארגוני חייב לדעת לסנן מסמכים שאינם בתוקף ולהעדיף את הגרסה העדכנית.

המדד שחשוב

דיוק בפני עצמו הוא מדד חלקי. המדד האמיתי הוא כיסוי — אחוז השאלות שהמערכת עונה עליהן ברמת ודאות גבוהה. כיסוי נמוך אומר שהמערכת פשוט לא מספיק בשלה לפרודקשן.

לסיכום

RAG אינו "חיבור LLM למסמכים". זוהי הנדסת ידע אמיתית — וההבדל בין דמו לפרודקשן הוא ההבדל בין פרויקט שמתחיל נהדר למערכת שאפשר לסמוך עליה מול לקוחות.