מערכות RAG (Retrieval-Augmented Generation) הפכו לפתרון הפופולרי ביותר לשילוב בינה מלאכותית עם מידע ארגוני — צ׳אטבוט שעונה על בסיס המסמכים שלכם, מערכת חיפוש חכמה, או עוזר ידע פנימי. הרעיון פשוט: במקום לאמן מודל על המידע שלכם (יקר ואיטי), המערכת שולפת את המסמכים הרלוונטיים בזמן השאלה ומעבירה אותם למודל כהקשר. אבל כאן בדיוק מתחיל הפער: הרבה ארגונים מגלים שהתוצאות שהם מקבלים רחוקות ממה שציפו.
למה מערכות RAG נכשלות
הסיבה העיקרית היא תפיסה שגויה: שמספיק "לחבר" מודל למסמכים. בפועל, מערכת RAG נאיבית (להטמיע, לשלוף את ה-top-k, ולהכניס לפרומפט) נכשלת בשליפה בכ-40% מהמקרים. מה שמדאיג הוא שהמודל עדיין מייצר תשובה משכנעת ומסודרת — אבל מבוססת על המסמכים הלא נכונים. המשתמש מקבל תשובה בטוחה ושגויה.
תובנה מהשטח: לפי דיווחים בתעשייה, כ-80% מכשלי ה-RAG מקורם דווקא בשלב עיבוד המידע והחיתוך (Chunking) — לא במודל השפה עצמו. צוותים רבים מבזבזים שבועות על כיוונון הפרומפט בזמן שהבעיה האמיתית היא בשליפה.
חיתוך נכון (Chunking) — היסוד שקובע הכל
חיתוך הוא הדרך שבה מפרקים מסמכים לקטעים שהמערכת יכולה לשלוף. חיתוך גרוע — קטעים גדולים מדי שמדללים את המידע הרלוונטי, או קטנים מדי שמאבדים הקשר — פוגע ישירות באיכות. בקורפוסים מקצועיים (פיננסי, משפטי, טכני), חיתוך סמנטי שמכבד את מבנה התוכן הפך לסטנדרט. זה לא "פרט טכני קטן" — זו אחת ההחלטות המשפיעות ביותר על התוצאה.
חיפוש היברידי ו-Re-ranking
חיפוש סמנטי (לפי משמעות) לבדו מפספס מונחים מדויקים, מספרים וראשי תיבות. חיפוש היברידי — שמשלב חיפוש סמנטי עם חיפוש מילולי מדויק — הפך לסטנדרט הייצור ב-2026, ומשפר את איכות השליפה בצורה מדידה. אחריו נכנס שלב ה-Re-ranking: מודל ייעודי שמדרג מחדש את הקטעים שנשלפו ובוחר את המעטים והרלוונטיים ביותר. אם השליפה קובעת מה נשלף, ה-Re-ranking קובע מה המודל באמת רואה — וכשמסירים הקשר לא רלוונטי, שיעור ההזיות יורד משמעותית.
| שלב | תפקיד | למה זה חשוב |
|---|---|---|
| חיתוך (Chunking) | פירוק מסמכים לקטעים | מקור עיקרי לכשלים אם נעשה לא נכון |
| חיפוש היברידי | שליפת מועמדים רלוונטיים | תופס גם משמעות וגם מונחים מדויקים |
| Re-ranking | דירוג מחדש ובחירת המיטב | מפחית הקשר מיותר והזיות |
| הערכה (RAGAS וכו׳) | מדידת איכות אחרי כל שינוי | מבדיל בין שיפור אמיתי לניחוש |
התמודדות עם הזיות (Hallucinations)
גם עם שליפה טובה, מודל יכול "להמציא" מידע. ההגנה היא רב-שכבתית: לוודא שהתשובה מבוססת רק על ההקשר שנשלף (Faithfulness), לבדוק שהיא באמת עונה על השאלה (Relevance), ולהוסיף ציטוטים למקור כך שאפשר לאמת. מערכת RAG טובה לא רק עונה — היא מראה מאיפה הגיעה התשובה.
הערכה: איך יודעים שזה באמת עובד
בלי מדידה, "שיפור" הוא ניחוש. הגישה המקצועית היא לבנות סט בדיקה (golden dataset) של שאלות ותשובות, ולמדוד מדדים כמו דיוק השליפה, נאמנות התשובה למקור ורלוונטיות — לאחר כל שינוי בצינור. ככה יודעים אם שינוי שיפר או הרע, במקום להסתמך על תחושה.
שאלות נפוצות
בונים מערכת RAG או שכבר יש לכם אחת שלא נותנת תוצאות? אנחנו מלווים ארגונים בבנייה ובשיפור של מערכות RAG — עם דגש על הפרטים שמשפיעים באמת על איכות התוצאות. דברו איתנו לשיחת היכרות.

