דלג לתוכן הראשי
חזרה לבלוג

תוכן AI

איך לאמן צ׳אטבוט על תוכן האתר שלכם

כך משתמשים בתוכן אתר בצ׳אטבוט באמצעות אחזור: גבולות מקורות, רענון, ציטוטים ותוכנית בדיקות הניתנת לשחזור.

Founder, Achla AIMichael Shamanoff
פורסם
עודכן

6 דקות קריאה

כרטסת נייר שמארגנת דפי אתר מאושרים עבור צ׳אטבוט המבוסס על אחזור מידע.
דפי אתר מאושרים מאורגנים לאחזור ולבדיקה חוזרת, ולא לאימון מחדש של מודל בסיס.

<div dir="rtl">

בדרך כלל, ״לאמן״ צ׳אטבוט על אתר פירושו לאסוף תוכן ציבורי ומורשה, לאנדקס אותו, לאחזר קטעים רלוונטיים לכל שאלה ולנסח תשובה מתוך הראיות. ברוב הפתרונות המנוהלים אין פירוש הדבר שינוי משקלי מודל השפה בכל עדכון דף. ההבחנה חשובה מפני שכל שכבה נכשלת בדרך אחרת.

לכן מתחילים בהחלטות על מקורות: מה מותר לשימוש, כיצד להכין את הדפים לאחזור, איך לתעד גרסאות וכיצד לבדוק שאלות שניתן ושלא ניתן לענות עליהן. ציטוט הוא דבר שצריך לבדוק, לא הוכחה אוטומטית.

Michael Shamanoff מייסד, Achla AI

שיטה: המדריך מסתמך על מסמכי Google Cloud ו־IETF שנבדקו ב־3 באוגוסט 2026 ועל ארטיפקט המוצר המקומי של Achla. לא נמדדו תוצאות או benchmarks.

מה פירוש ״לאמן צ׳אטבוט על אתר״?

המונח מאחד ארבע פעולות. לצורך החלטת RAG לעומת fine-tuning, זהו את הפעולה הדרושה. Google Cloud מתארת fine-tuning כאימון נוסף של מודל מאומן מראש על נתוני משימה, ואת RAG כהוספת ידע חיצוני ל־prompt. (סקירת fine-tuning; מסמכי tuning)

שכבהמה משתנהשאלת בעל האתרתגובה אופיינית לעדכון
Fine-tuningפרמטרים או adaptersהאם צריך להתאים התנהגות, פורמט או סגנון?להכין דוגמאות מסומנות, לאמן, להעריך ולנהל גרסה.
אינדוקסייצוג שניתן לחיפושאילו דפים ומקטעים עדכניים וניתנים לגילוי?לסרוק או לייבא מחדש ולרענן את האינדקס.
אחזורראיות שנבחרו לשאילתההאם נמצא הקטע שעונה לשאלה?לשפר מקור, חלוקה, metadata, embeddings או הגדרת אחזור.
יצירהתשובה מהקשר מאוחזרהאם כל טענה נשארת בתוך הראיות?לצמצם הוראות או grounding ולבדוק שוב.

סריקה אינה מוכיחה אינדוקס; אחזור אינו מוכיח שנבחר הקטע הנכון; וקישור אינו מוכיח תמיכה בטענה.

החליטו באיזה תוכן אתר מותר לצ׳אטבוט להשתמש

מפו דפים ציבוריים, עדכניים, שימושיים ומורשים.

החלטהמתי להשתמשהפעולה הבאה
includeבדף תשובה ברורה ועדכנית ובעלים אחראי.לתעד URL, גרסה או תאריך ושאלות צפויות.
fix firstהנושא שייך לתחום אך הדף עמום, מיושן או חסר.לתקן את המקור הקנוני לפני אינדוקס.
excludeהדף כפול, ניווטי, לא רלוונטי או מטעה.להשאיר מחוץ למקורות ולתעד מדוע.
unsupported/privateנדרשות הרשאות, רשת פרטית או הקשר לקוח.לא לעקוף את הגבול; לבחור מקור נתמך.

הפרידו בין robots לבקרת גישה

RFC 9309 מגדיר את Robots Exclusion Protocol ככללים שמבקשים מסורקים לכבד, לא כהרשאת גישה. לנתיבים מוגנים נדרשת אבטחת יישום כגון HTTP authentication. Disallow עלול לחשוף נתיב ואינו הופך אותו לסודי. (IETF RFC 9309)

אל תכניסו credentials לכתובות crawl ואל תעקפו login. הסורק של Achla בודק robots, דוחה URL עם credentials וחוסם יעדים פרטיים; אין בכך תמיכה בקליטת private knowledge base.

הכינו ואנדקסו תוכן לאחזור שימושי

  1. תנו לכל מקטע כותרת תיאורית התואמת לשאלה.
  2. הציבו תשובה ישירה תחילה, ואז תנאים, חריגים, תאריכים ודוגמאות.
  3. שמרו בעלים קנוני יציב לכל עובדה.
  4. השתמשו בשמות עקביים למוצרים ולמונחים.
  5. תעדו URL, תאריך עדכון, תוצאות גישה/robots ושאלות צפויות.
תצפיתמה היא מוכיחהמה אינה מוכיחה
הסורק הביא דףהדף היה נגיש באותה ריצה.שהמקטע השימושי נכנס לאינדקס.
הדף מופיע באינדקסיש ייצוג ניתן לחיפוש.שהקטע הנכון ייבחר לשאילתה.
קטע אוחזרנבחרה ראיה לשאילתה.שהתשובה שמרה את כל התנאים.

ראו הכנת מקטעי אתר לאחזור. אל תבטיחו מנגנון או זמן רענון בלי תיעוד המוצר.

כיצד שומרים על ידע הצ׳אטבוט עדכני?

השתמשו ברענון ובבדיקה חוזרת, לא ב״אימון מחדש״. Google Cloud מבחינה בין רענון אוטומטי, ידני ומבוסס sitemap. (רענון דפי אינטרנט)

  1. שמרו גרסת מקור ישנה ושאילתת בדיקה קבועה.
  2. פרסמו תיקון מורשה במקור האמת.
  3. הפעילו או המתינו ל־recrawl/refresh נתמך.
  4. ודאו שהגרסה החדשה ניתנת לגילוי באינדקס.
  5. הריצו שוב את אותה שאלה והשוו תשובה, ציטוטים והכרעת בודק אנושי.

אל תסיקו מכך לוח זמנים של Achla. רעננות היא מצב שנצפה ומקושר לגרסת מקור.

דרשו ציטוטים, אך בדקו שהם תומכים בטענה

Google Cloud מספקת citations ו־claim-level grounding כאמצעי בדיקה, לא כהבטחת נכונות. (תשובות והמשך)

  1. האם הדף המצוטט מכיל את הקטע הרלוונטי?
  2. האם הוא תומך בכל הטענה, לרבות תנאים, תחום ותאריך?
  3. כשאין תמיכה מלאה, האם לצמצם תשובה, לשאול או להחזיר החמצה מוגבלת?
מצב הטענהמצב הציטוטהחלטת הבודק
נתמכת במלואההמקור והקטע ניתנים לבדיקהלקבל את שורת הבדיקה.
נתמכת חלקיתהמקור מכסה חלק בלבדלצמצם ולהריץ שוב.
סותרתהמקור שונה מהותיתלדחות ולאתר את שכבת הכשל.
לא ניתנת להערכההמקור אינו זמיןלתעד מגבלה ולא לנחש.

קוד הווידג׳ט של Achla מציג סמני ציטוט, רשימת מקורות ומצב ברור של אין־תשובה. זו עובדת ממשק, לא הוכחה שכל תשובה נכונה. ראו מגבלות grounding וציטוטים.

כיצד לבדוק צ׳אטבוט לפני השקה?

השתמשו ברשומת מוכנות וחזרה קבועה במקום demo סובייקטיבי.

בנו מטריצת שאלות קבועה

  • שאלה שנענית מדף ציבורי ברור אחד;
  • שאלה הדורשת שני דפים מאושרים;
  • שאלה שנענית רק חלקית;
  • מקרה מיושן לאחר שינוי מקור;
  • שאלה ללא ראיות שחייבת להחזיר תשובה מוגבלת;
  • שאלה על מידע פרטי שאסור לחשוף;
  • שאלה עמומה שדורשת הבהרה.

בכל שורה תעדו test_id, שאילתה, סוג, URL צפויים, ראיה או היעדרה, גרסת מקור/אינדקס, תשובה, citations, הכרעה אנושית, שכבת כשל, פעולה, בודק ו־observed_at. זהו פרוטוקול; לא הורץ מבחן Achla ותוצאותיו אינן ידועות.

אתרו את שכבת הכשל

  • מקור: אין תשובה ברורה — תקנו את מקור האמת.
  • גישה/אינדקס: מקור מורשה חסר או מיושן — פתרו גישה או רעננו.
  • אחזור: המקור קיים אך הקטע לא נבחר — בדקו מבנה ו־retrieval.
  • יצירה/תמיכה: התשובה מוסיפה או מחסירה תנאי — צמצמו ובדקו שוב.
  • הצגת ציטוט: לא ניתן לבדוק ראיה — אל תכנו את התשובה מאומתת.
  • לא ניתן להעריך: תעדו את הגבול במקום לנחש.

קבלו החלטה מוגבלת

העבירו לבדיקת השקה אנושית רק כאשר מקרי הליבה נתמכים, שאלות פרטיות וחסרות נשארות מוגבלות ולכל אזהרה יש בעלים. אל תשיקו כשמקור נדרש אינו נתמך או כששרשרת הראיות אינה ניתנת לבדיקה. השתמשו בגיליון ראיות גרסתי.

צ׳אטבוט מנוהל, RAG מותאם או fine-tuning?

גישההתאמהמה עדיין באחריות הצוות
צ׳אטבוט/חיפוש מנוהלמקורות ציבוריים, תשובות, citations ו־embed בלי backend מלאתחום המקורות, איכות, גישה, בדיקות וסקירה.
RAG מותאםשליטה ב־ingestion, retrieval, הרשאות, הערכה ואינטגרציותארכיטקטורה, אבטחה, רענון ותצפיות.
Fine-tuningהתאמת התנהגות בעזרת דוגמאות מסומנותנתונים, אימון, הערכה ופריסה; אינו מחליף אחזור עובדות משתנות.

Achla מתארת חיפוש AI מנוהל בתוכן אתר ציבורי, עם מקורות ומצב אין־תשובה. אלו עובדות יישום, לא הבטחות לתוצאות. ראו גבולות המערך המנוהל.

טעויות נפוצות

  1. לכנות ingestion בשם fine-tuning.
  2. לאנדקס הכול בלי החלטת include/fix/exclude/private.
  3. להתייחס ל־robots.txt כפרטיות.
  4. להניח ש־crawl מוכיח retrieval.
  5. לראות בכל citation תמיכה.
  6. לבדוק רק שאלות קלות.
  7. לעדכן בלי replay.

שאלות נפוצות

האם אפשר לאמן צ׳אטבוט מאתר?

כן, אם ״אימון״ פירושו שימוש בתוכן מורשה כמקור אחזור: לבחור, להכין, לסרוק או לייבא, לאנדקס ולבדוק תשובות. אין הכרח ב־fine-tuning.

האם זה זהה ל־fine-tuning?

לא. Fine-tuning משנה פרמטרים; צ׳אטבוט אתר לרוב מאחזר קטעים עדכניים מהאינדקס בזמן התשובה.

כיצד RAG משתמש בתוכן אתר?

RAG מחפש מידע רלוונטי במקור מורשה ומוסיף אותו להקשר היצירה. המימושים משתנים; בדקו את הקטע הצפוי לכל שאילתה חשובה.

באיזו תדירות לרענן?

אחרי שינוי משמעותי ובהתאם למנגנוני המוצר המתועדים. תעדו גרסאות והריצו שוב שאלות קבועות במקום להניח לוח זמנים אוניברסלי.

האם צ׳אטבוט ציבורי יכול להשתמש במידע פרטי?

רק בזרימה פרטית, מאומתת ומורשית בנפרד. סורק ציבורי אינו צריך לעקוף login או לקלוט משאבים פרטיים. הראיות שנבדקו אינן תומכות ב־private knowledge-base ingestion של Achla.

מגבלות והצעד הבא

ארכיטקטורות, בקרות crawl, רענון, אחזור וציטוטים משתנים. מקור עדכני עלול לא להימצא, קטע עלול לשמש לא נכון וציטוט עלול להיות חלקי. Robots אינם authentication וסריקת אתר ציבורי אינה מחבר למידע פרטי. זהו פרוטוקול סקירה, לא ייעוץ משפטי, הסמכה, benchmark או הבטחת דיוק, דירוג, המרה, הפחתת פניות או זמן השקה.

אם פתרון מנוהל למידע ציבורי מתאים, חברו את האתר, התחילו במקורות מורשים מעטים והריצו מטריצה חיובית ושלילית. התוצאה מיועדת להחלטה אנושית, לא לאישור השקה אוטומטי.

</div>