דלג לתוכן הראשי
חזרה לבלוג

אמון והערכת RAG

כיצד להעריך תשובות RAG מבוססות באמצעות גיליון ראיות

העריכו תשובות RAG טענה אחר טענה, תעדו ציטוטים תומכים, סמנו פערי אחזור גלויים והריצו מחדש את אותה בדיקה ללא ציונים מומצאים.

Founder, Achla AIMichael Shamanoff
פורסם
עודכן

8 דקות קריאה

רשומות ראיות RAG ברמת הטענה מחוברות לקטעי מקור ונבדקות שוב לאחר שינוי.
בין ההרצות נשמרים אותה שאילתה, אותם שדות ראיות ומטא-נתוני גרסה.

מאת Michael Shamanoff, מייסד Achla AI נבדק לאחרונה: 1 באוגוסט 2026

רשימת בדיקה להערכת ביסוס של RAG מועילה רק אם היא משאירה תיעוד שניתן לבדיקה. לכל תשובת בדיקה, פצלו את הטענות המהותיות, קשרו כל טענה לקטע מקור מדויק וכתבו מסקנה תחומה עם נימוק. לאחר מכן שמרו את השאילתה, הקטעים שאוחזרו, התשובה, הציטוטים, גרסאות המקורות וגרסת המערכת, כדי שאפשר יהיה לשחזר את אותו מקרה בעתיד. התוצאה אינה ציון דיוק ואינה הבטחה שהתשובה נכונה. זהו גיליון ראיות ברמת הטענה שמראה במה תומכות הראיות הגלויות, היכן ציטוט רק מחובר לטענה, והיכן על המערכת לתעד בכנות שאין תשובה.

מאמר זה מציג פרוטוקול תיעוד ושחזור. הוא אינו מחליף את ההסבר הרחב על חיפוש AI מבוסס, ציטוטים והימנעות מתשובה. תפקידו המצומצם הוא להפוך תשובת בדיקה אחת לניתנת לביקורת בלי להמציא מדד או להסתיר שיקול דעת בתוך שיעור הצלחה.

מי יצר את הפרוטוקול, כיצד הוכן ולמה

Michael Shamanoff, מייסד Achla AI, הוא המחבר המצוין. הפרוטוקול הוכן מבריף העריכה שאישר הבעלים, מארטיפקט המוצר הנוכחי ומתיעוד רשמי של Microsoft, Ragas ו-AWS. הביקוש לנושא עדיין בגדר השערה ניסיונית, משום שלא היו זמינים נתוני GSC, Keyword Planner, נפח חיפוש מורשה או ראיות יציבות מהשלמה אוטומטית.

השיטה הופכת תשובה להחלטות ראייתיות קטנות שבודק יכול לשחזר. בהערכת תשובה מבוססת, מקור מקושר עשוי להיות רלוונטי לנושא אך לא לתמוך במשפט שלצדו. המטרה מוגבלת: לאבחן בעיות גלויות באחזור ובתמיכה בתוך מקרה בדיקה קבוע. מי שזקוק להגדרה קצרה לפני השימוש בגיליון יכול לעיין במילון המונחים של חיפוש AI.

התחילו ממערך ראיות קבוע

אל תתחילו בהקצאת ציון. תחילה הקפיאו מקרה. מערך בדיקות להערכת RAG צריך לתעד את השאילתה המדויקת, גרסת אוסף המקורות, הקטעים שאוחזרו לפי סדר החזרה, התשובה שנוצרה והציטוטים שהוצגו למשתמש. ציינו גם את מצב הראיות הצפוי: אילו קטעי מקור נחוצים לתשובה זהירה, ועל איזו נקודה האוסף אינו מסוגל לענות.

להלן מערך סינתטי שמשמש לאורך המאמר. הוא מתאר חנות דמיונית; הוא אינו תוצאה של Achla AI או של לקוח.

שאילתה Q-017: „האם אפשר להחזיר פריט במכירה סופית לאחר 30 יום, ומתי מתחיל עיבוד ההחזר הכספי?”

מקור D-01, `/returns`, גרסה `returns-v4`, קטע `p04`: „פריטים שנרכשו ישירות מהחנות לדוגמה ניתנים להחזרה בתוך 30 ימים קלנדריים ממועד המסירה. פריטי מכירה סופית אינם כלולים.”

מקור D-02, `/refunds`, גרסה `refunds-v2`, קטע `p07`: „עיבוד ההחזר הכספי מתחיל לאחר שהפריט המוחזר מגיע למחסן.”

מצב ראיות צפוי: D-01 תומך בחלון של 30 יום לרכישות ישירות זכאיות ומחריג במפורש פריטי מכירה סופית. D-02 תומך באירוע שמתחיל את עיבוד ההחזר. אף קטע אינו מציין כמה זמן נמשך העיבוד.

תשובה מתועדת A-017: „אפשר להחזיר כל פריט בתוך 30 יום, כולל פריטי מכירה סופית.[D-01] ההחזר מתחיל כאשר מגישים את הבקשה.[D-02] בדרך כלל הוא מסתיים בתוך חמישה ימים.”

המערך לקוי במכוון. ערכו בכך שכל מסקנה בהמשך יכולה להפנות לטקסט קבוע. אם הצוות בודק קודם אי-התאמה באוצר מילים, המדריך לאחזור סמנטי בניסוחים שונים מסביר מדוע יש לבחון אחזור ויצירת תשובה כשלבים נפרדים.

פצלו את התשובה לטענות מהותיות

טענה מהותית עשויה לשנות את החלטת הקורא אם היא שגויה או חסרה. פצלו צירופים, כמויות, חריגים, תאריכים, קשרים סיבתיים ושלבי תהליך כאשר הם תלויים בראיות שונות. אל תתנו ציון לפסקה שלמה כיחידה אחת.

עבור A-017, הגיליון מתעד ארבע טענות:

  1. C-017-1: אפשר להחזיר כל פריט.
  2. C-017-2: חלון ההחזרה הוא עד 30 יום.
  3. C-017-3: עיבוד ההחזר מתחיל בהגשת הבקשה.
  4. C-017-4: עיבוד ההחזר מסתיים בדרך כלל בתוך חמישה ימים.

„כולל פריטי מכירה סופית” שייך ל-C-017-1 משום שהוא מרחיב את „כל פריט” וסותר החרגה מפורשת. הטענה על 30 יום נפרדת משום שהקטע אכן תומך בחלון הזה, בכפוף להיקף. טענת משך העיבוד נפרדת משום שאף קטע שאוחזר אינו דן במשך.

הפירוק מונע מקטע נתמך אחד להכשיר מקטע שאינו נתמך. הוא גם חושף מחלוקות: בודק יכול לערער על הגבול של C-017-1 בלי לשנות בשקט את המסקנה עבור C-017-2. באוספים מדעיים או טכניים, אותה משמעת מרכזית גם בתהליך מחקר שמתחיל בציטוטים, אף שמומחי תחום עשויים לקבוע מה מהותי.

בנו גיליון ראיות ברמת הטענה

השתמשו בשורה אחת לכל טענה מהותית. גיליון שימושי כולל:

  • מזהי מקרה, שאילתה, תשובה וטענה;
  • טקסט הטענה כפי שהועתק מהתשובה המתועדת;
  • מזהי הציטוטים המצורפים בדיוק כפי שהוצגו;
  • מזהה מקור שאוחזר, גרסת מקור, מזהה קטע ומיקום בסדר ההחזרה;
  • הטקסט המדויק של הקטע שנבדק;
  • מסקנה ונימוק לגבי חיבור הציטוט;
  • מסקנה ונימוק כתוב לגבי תמיכה סמנטית;
  • אבחון הראיות הגלויות;
  • בודק, זמן בדיקה והערה שטרם הוכרעה.

כך נראה הגיליון עבור המערך:

טענהציטוט מצורףקטע מקור מדויקחיבורתמיכה סמנטיתנימוק כתוב
C-017-1: אפשר להחזיר כל פריט, כולל מכירה סופית.D-01D-01 returns-v4 p04: „פריטים שנרכשו ישירות ניתנים להחזרה בתוך 30 יום. פריטי מכירה סופית מוחרגים.”מצורףלא נתמךהקטע מחריג במפורש פריטי מכירה סופית ולכן אינו תומך ב„כל פריט”.
C-017-2: חלון ההחזרה הוא עד 30 יום.D-01אותו קטע D-01 returns-v4 p04מצורףנתמך חלקיתהחלון מופיע, אך התשובה משמיטה את מגבלות הרכישה הישירה והמכירה הסופית.
C-017-3: העיבוד מתחיל בהגשת הבקשה.D-02D-02 refunds-v2 p07: „העיבוד מתחיל לאחר הגעת הפריט למחסן.”מצורףלא נתמךהתשובה מציינת הגשת בקשה; המקור מציין קבלה במחסן.
C-017-4: העיבוד מסתיים בדרך כלל בתוך חמישה ימים.איןאין קטע שאוחזרחסרלא נתמךבראיות הגלויות אין טענה על משך.

שמרו ברשומת הבדיקה את הקטע המדויק, לא רק את כתובת הדף. אם יש למקור עוגנים יציבים, שמרו כתובת ועוגן וכן מזהה קטע. אחרת שמרו hash של התוכן ודי טקסט סמוך כדי לאתר מחדש את הקטע לאחר עריכה.

מסגרות רשמיות משתמשות בהפרדות דומות. תיעוד מעריכי RAG של Microsoft מבדיל בין הערכת אחזור להערכת תגובה. Ragas מתעדת faithfulness לפי טענות שניתנות לתמיכה מההקשר שאוחזר. AWS מתעדת מצבי retrieve-only ו-retrieve-and-generate. המקורות עוזרים להפריד רלוונטיות אחזור מביסוס; הם אינם נותנים סף אוניברסלי לגיליון זה.

הפרידו בין חיבור ציטוט לתמיכה סמנטית

„מצורף” עונה על שאלה מכנית: האם התשובה קישרה מזהה מקור לטענה או למשפט? „נתמך” עונה על שאלה סמנטית: האם הקטע המדויק מצדיק את הטענה תוך שמירה על ההיקף, החריגים, הכמויות והתזמון?

אל תאחדו את השדות. ל-C-017-1 יש ציטוט מצורף, אך הקטע סותר את הטענה. ל-C-017-4 אין ציטוט ואין תמיכה שאוחזרה. במקרה אחר עשוי להיות קטע תומך בלי ציטוט מוצג; זו בעיית חיבור, לא הוכחה לכשל אחזור.

השתמשו בארבע מסקנות תחומות:

  • נתמך: הקטע הגלוי תומך בטענה המהותית ובהסתייגויות החשובות;
  • נתמך חלקית: הוא תומך בחלק נפרד אך משאיר הסתייגות, היקף או קשר מהותי לא פתורים;
  • לא נתמך: הקטעים הגלויים אינם מצדיקים את הטענה או סותרים אותה;
  • לא ניתן להערכה: הרשומה חסרה או שנדרשים מומחיות או ראיות מחוץ למערך.

כל מסקנה דורשת נימוק. התווית היא אינדקס, לא הניתוח. „לא ניתן להערכה” צריך לציין מה חסר ולא לשמש תחליף נוח לבדיקה.

אבחנו רק את מה שהרשומה הגלויה מאפשרת

גיליון הראיות יכול לחשוף תסמין בלי להוכיח סיבה נסתרת. השתמשו בלשון זהירה והפרידו תצפית מהשערה.

רשומה גלויהתצפית תחומהבדיקה אפשרית בהמשך — לא סיבה מוכחת
הקטע הצפוי חסר מהתוצאותהראיות הדרושות לא היו גלויות לשלב התשובה בהרצה זו.בדקו חברות באוסף, גרסת אינדקס, ניסוח שאילתה, מסננים ועומק תוצאות.
הקטע הוחזר אך ההחרגה הושמטההתשובה אינה שומרת על הסתייגות גלויה.בדקו הוראות יצירה ועקבת תשובה שמורה.
ציטוט מצורף לקטע שסותר טענהחיבור ציטוט אינו מוכיח תמיכה.בדקו בחירת ציטוט ומיפוי טענה לקטע.
קטע תומך הוחזר אך לא הוצג ציטוטיש תמיכה גלויה במערך אך הצגת המקור חסרה.בדקו תהליך הצגת הציטוט והמטען השמור.
מאתר קטע נפתר לטקסט אחר בשחזורשינוי במקור מונע השוואה זהה.שחזרו גרסה או סווגו את ההרצה כלא ניתנת להשוואה.
האוסף אינו מכיל את העובדההמערך אינו יכול לתמוך בתשובה ממקורותיו.צפו ל-miss כן או לתשובה מוגבלת במפורש.

המטריצה אינה מעריך אוטומטי ואינה קובעת איזה רכיב גרם לשגיאה. היא מצמצמת את הבדיקה הבאה. ההבחנה חשובה במיוחד במעבר מאיתור דפים לממשק תשובות; ההבדל מתואר במאמר מדוע חיפוש באתר מוצא דפים בעוד שמבקרים צריכים תשובות.

תעדו miss כן כתוצאה מן המניין

בדיקת miss כן מוסיפה מקרה שבו העובדה המבוקשת חסרה. ב-Q-017 אין תמיכה למשך של חמישה ימים. תשובה תחומה יכולה לומר: „המקורות הזמינים אומרים שהעיבוד מתחיל לאחר שהפריט מגיע למחסן, אך אינם מציינים זמן סיום.” הגיליון צריך לתעד בנפרד את אירוע ההתחלה הנתמך ואת משך הזמן שאינו זמין.

בארטיפקט Achla AI הנוכחי, המסלול המבוסס הראשי דורש טקסט תשובה יחד עם ציטוטים כדי להיחשב מבוסס; ה-widget כולל גם מצב גלוי של אין תשובה ויכול להציג קישורי מקור. זהו תיאור של המימוש המקומי שנבדק, לא טענת ביצועים או אמינות. גם miss דורש מטא-נתוני שחזור, כי גרסה עתידית עשויה להוסיף את העובדה.

שמרו מטא-נתונים של שחזור וגרסה

רשומות ראיות RAG ברמת הטענה מחוברות לקטעי מקור ונבדקות שוב לאחר שינוי.
בין ההרצות נשמרים אותה שאילתה, אותם שדות ראיות ומטא-נתוני גרסה.

שחזור מועיל רק אם ידוע מה נשאר קבוע ומה השתנה. שמרו:

  • טקסט ומזהה השאילתה;
  • טקסט ומזהה התשובה;
  • קטעים שאוחזרו לפי סדר, ציונים אם נחשפו, ומסננים;
  • מזהי ציטוטים שהוצגו וחיבורם לטענה או למשפט;
  • מזהה snapshot, מקורות, גרסאות, קטעים ו-hash-ים;
  • מזהי תצורת אחזור ותצורת יצירה;
  • גרסת prompt או הוראה, מזהה מודל וגרסת אפליקציה;
  • locale, זמן בדיקה, בודק וגרסת סכמת הגיליון.

בשחזור regression של RAG צרו מזהה הרצה חדש. אל תדרסו תשובה ישנה ואל תצרפו אליה בדיעבד קטעים חדשים. השוו שורות רק כאשר המערכים תואמים. אם השאילתה, snapshot המקור או הטקסט במאתר השתנו, סמנו זאת במפורש. שינוי בתוצאה ראוי לבדיקה, אך הגיליון לבדו אינו מוכיח את הסיבה.

אל תהפכו את הפרוטוקול ללוח דירוג. אל תמַצעו תוויות לציון מומצא, אל תקבעו סף שרירותי ואל תפרסמו שיעור הצלחה ממערך שאינו מייצג. אפשר לצבור תוצאות במסגרת תכנון הערכה שאושר בנפרד, אך הרשומה נועדה לשמר ראיות ושיקול דעת לפני הצבירה.

הרכיבו חבילת ביקורת

חבילת הביקורת הקטנה ביותר כוללת את המערך הקפוא, פלט האחזור הגולמי, התשובה המתועדת, הציטוטים המוצגים, שורות הטענות המלאות, הערות בודק, מטא-נתוני גרסה והשוואת שחזור. כללו את סכמת הגיליון ומניפסט עם hash-ים. אם פריט חסר, רשמו אותו כחסר במקום לשחזר מהזיכרון.

באוסף תיעוד תחום, שמרו את החבילה לצד הבעלים התפעולי של תהליך חיפוש בתיעוד, ולא בנפרד מהיסטוריית גרסאות המקור.

שמרו החלטות בודקים כ-append-only או בגרסאות. בודק מאוחר יותר עשוי לחלוק על פיצול טענה או מסקנה; שמרו את המקור ואת התיקון המתועד. היסטוריה זו שימושית יותר מגיליון נקי שאי אפשר לעקוב אחר החלטותיו.

מגבלות

הפרוטוקול מעריך תמיכה מול ראיות גלויות ומתועדות. הוא אינו מוכיח שמקור נכון, עדכני, שלם או מתאים להחלטה בסיכון גבוה. הוא אינו מגלה כל מקור רלוונטי שאולי הוחמץ באחזור. הוא אינו מחליף בדיקת מומחה, אבטחה, פרטיות, נגישות, latency או חוויית משתמש.

גבולות טענות ומסקנות סמנטיות דורשים שיקול דעת. בודקים יכולים לחלוק, במיוחד כאשר קטע מרמז על קשר ולא מציין אותו במפורש. תעדו את המחלוקת והנימוק. אל תהפכו את הפרוטוקול לשופט אוטומטי או למדד RAG אוניברסלי בלי שיטה שאומתה בנפרד.

השתמשו בגיליון על מאגר אתר תחום

בחרו קבוצה קטנה ובעלת גרסאות של שאלות אמיתיות ממבקרים, כללו לפחות פער ראיות ידוע אחד ושמרו חבילת ביקורת לכל שחזור. כך מתקבלת רשימת בדיקה ניתנת לבחינה לביסוס הערכת RAG בלי לטעון מעבר למה שהרשומה מראה.

אם תרצו לבדוק את התהליך על תוכן שבשליטתכם, חברו את האתר שלכם והשאירו החלטות עובדתיות, אבטחה ופרסום לבודק אנושי.