חזרה לכל המאמרים AI ופיתוח

איך בונים מערכת RAG שנותנת תוצאות אמיתיות — ולא רק נראית טוב

נקודות מפתח

  • מערכת RAG נאיבית נכשלת בשליפה בכ-40% מהמקרים — ועדיין נשמעת משכנעת
  • רוב הכשלים מקורם בחיתוך (Chunking) ובשליפה, לא במודל השפה
  • חיפוש היברידי הוא סטנדרט הייצור — סמנטי + מילולי מדויק יחד
  • Re-ranking בוחר את הקטעים הרלוונטיים ומפחית הזיות
  • בלי golden dataset ומדידה — "שיפור" הוא רק ניחוש

מערכות RAG (Retrieval-Augmented Generation) הפכו לפתרון הפופולרי ביותר לשילוב בינה מלאכותית עם מידע ארגוני — צ׳אטבוט שעונה על בסיס המסמכים שלכם, מערכת חיפוש חכמה, או עוזר ידע פנימי. הרעיון פשוט: במקום לאמן מודל על המידע שלכם (יקר ואיטי), המערכת שולפת את המסמכים הרלוונטיים בזמן השאלה ומעבירה אותם למודל כהקשר. אבל כאן בדיוק מתחיל הפער: הרבה ארגונים מגלים שהתוצאות שהם מקבלים רחוקות ממה שציפו.

למה מערכות RAG נכשלות

הסיבה העיקרית היא תפיסה שגויה: שמספיק "לחבר" מודל למסמכים. בפועל, מערכת RAG נאיבית (להטמיע, לשלוף את ה-top-k, ולהכניס לפרומפט) נכשלת בשליפה בכ-40% מהמקרים. מה שמדאיג הוא שהמודל עדיין מייצר תשובה משכנעת ומסודרת — אבל מבוססת על המסמכים הלא נכונים. המשתמש מקבל תשובה בטוחה ושגויה.

תובנה מהשטח: לפי דיווחים בתעשייה, כ-80% מכשלי ה-RAG מקורם דווקא בשלב עיבוד המידע והחיתוך (Chunking) — לא במודל השפה עצמו. צוותים רבים מבזבזים שבועות על כיוונון הפרומפט בזמן שהבעיה האמיתית היא בשליפה.

צינור RAG: משאלה לתשובה מבוססת שאלהקלט המשתמש חיפוש היברידיסמנטי + מילולי Re-rankingדירוג מחדש הרכבת הקשרtop-k קטעים יצירת תשובהLLM + context ⚠ כאן נכשלים ~40% מצינורות RAG נאיביים: שליפה לא מדויקת → תשובה שגויה אבל משכנעת חיפוש היברידי + Re-ranking הם סטנדרט הייצור ב-2026

חיתוך נכון (Chunking) — היסוד שקובע הכל

חיתוך הוא הדרך שבה מפרקים מסמכים לקטעים שהמערכת יכולה לשלוף. חיתוך גרוע — קטעים גדולים מדי שמדללים את המידע הרלוונטי, או קטנים מדי שמאבדים הקשר — פוגע ישירות באיכות. בקורפוסים מקצועיים (פיננסי, משפטי, טכני), חיתוך סמנטי שמכבד את מבנה התוכן הפך לסטנדרט. זה לא "פרט טכני קטן" — זו אחת ההחלטות המשפיעות ביותר על התוצאה.

חיפוש היברידי ו-Re-ranking

חיפוש סמנטי (לפי משמעות) לבדו מפספס מונחים מדויקים, מספרים וראשי תיבות. חיפוש היברידי — שמשלב חיפוש סמנטי עם חיפוש מילולי מדויק — הפך לסטנדרט הייצור ב-2026, ומשפר את איכות השליפה בצורה מדידה. אחריו נכנס שלב ה-Re-ranking: מודל ייעודי שמדרג מחדש את הקטעים שנשלפו ובוחר את המעטים והרלוונטיים ביותר. אם השליפה קובעת מה נשלף, ה-Re-ranking קובע מה המודל באמת רואה — וכשמסירים הקשר לא רלוונטי, שיעור ההזיות יורד משמעותית.

שלבתפקידלמה זה חשוב
חיתוך (Chunking)פירוק מסמכים לקטעיםמקור עיקרי לכשלים אם נעשה לא נכון
חיפוש היברידישליפת מועמדים רלוונטייםתופס גם משמעות וגם מונחים מדויקים
Re-rankingדירוג מחדש ובחירת המיטבמפחית הקשר מיותר והזיות
הערכה (RAGAS וכו׳)מדידת איכות אחרי כל שינוימבדיל בין שיפור אמיתי לניחוש

התמודדות עם הזיות (Hallucinations)

גם עם שליפה טובה, מודל יכול "להמציא" מידע. ההגנה היא רב-שכבתית: לוודא שהתשובה מבוססת רק על ההקשר שנשלף (Faithfulness), לבדוק שהיא באמת עונה על השאלה (Relevance), ולהוסיף ציטוטים למקור כך שאפשר לאמת. מערכת RAG טובה לא רק עונה — היא מראה מאיפה הגיעה התשובה.

הערכה: איך יודעים שזה באמת עובד

בלי מדידה, "שיפור" הוא ניחוש. הגישה המקצועית היא לבנות סט בדיקה (golden dataset) של שאלות ותשובות, ולמדוד מדדים כמו דיוק השליפה, נאמנות התשובה למקור ורלוונטיות — לאחר כל שינוי בצינור. ככה יודעים אם שינוי שיפר או הרע, במקום להסתמך על תחושה.

שאלות נפוצות

מה ההבדל בין RAG לבין אימון מודל (Fine-tuning)?
אימון משנה את המודל עצמו על בסיס המידע שלכם — יקר, איטי וקשה לעדכן. RAG משאיר את המודל כמו שהוא ושולף מידע רלוונטי בזמן השאלה, כך שקל לעדכן את המידע בלי לאמן מחדש. לרוב הצרכים הארגוניים RAG מתאים יותר.
כמה מידע צריך כדי שזה ישתלם?
RAG משתלם כבר מכמות בינונית של מסמכים, במיוחד כשהמידע משתנה לעיתים קרובות. דווקא כשהמידע מתעדכן, RAG עדיף, כי אפשר לעדכן את מאגר הידע בלי לגעת במודל.
האם RAG פותר לגמרי את בעיית ההזיות?
לא לגמרי, אבל הוא מצמצם אותן משמעותית — בעיקר כשהשליפה איכותית והתשובה מבוססת רק על ההקשר שנשלף. הוספת ציטוטים למקור מאפשרת גם לאמת את התשובה.
כמה זמן לוקח לבנות מערכת RAG?
אב-טיפוס בסיסי אפשר להקים מהר יחסית, אבל מערכת ייצור אמינה דורשת עבודה על חיתוך, שליפה, הערכה וניטור. ההשקעה הזו היא בדיוק ההבדל בין "נראה טוב בהדגמה" ל"עובד אמין בפועל".

בונים מערכת RAG או שכבר יש לכם אחת שלא נותנת תוצאות? אנחנו מלווים ארגונים בבנייה ובשיפור של מערכות RAG — עם דגש על הפרטים שמשפיעים באמת על איכות התוצאות. דברו איתנו לשיחת היכרות.

רוצים מערכת AI שבאמת עובדת על המידע שלכם?

שיחת היכרות קצרה תעזור להבין מה מתאים לארגון שלכם ואיך לבנות את זה נכון.

קבעו שיחת היכרות ←

שלחו פנייה ונחזור אליכם

מלאו את הפרטים ואלעד יצור קשר לשיחת היכרות ללא התחייבות

המידע נשמר בהתאם למדיניות הפרטיות.

הפנייה התקבלה!

תודה! אלעד יחזור אליכם בהקדם.

משהו השתבש

אפשר לנסות שוב, או לכתוב ישירות ל-info@maromcyber.com