Vai al contenuto principale
Torna al blog

Ricerca

Come valutare risposte RAG fondate con una scheda delle evidenze

Valuta le risposte RAG affermazione per affermazione, registra le citazioni di supporto, segnala le lacune visibili e ripeti lo stesso test senza inventare punteggi.

Founder, Achla AIMichael Shamanoff
Pubblicato
Aggiornato

10 min di lettura

Schede di evidenza RAG a livello di singola affermazione collegate ai passaggi sorgente e ripetute dopo una modifica.
Tra un'esecuzione e l'altra vengono conservati la stessa query, i campi delle evidenze e i metadati di versione.

Di Michael Shamanoff, fondatore di Achla AI Ultima revisione: 1 agosto 2026

Una checklist di groundedness per la valutazione RAG è utile solo se lascia una traccia ispezionabile. Per ogni risposta di test, separa le affermazioni sostanziali, collega ciascuna a un passaggio sorgente esatto e scrivi un verdetto circoscritto con una motivazione. Salva poi query, passaggi recuperati, risposta, citazioni, versioni delle fonti e versione del sistema affinché lo stesso caso possa essere ripetuto. Il risultato non è un punteggio di accuratezza né una promessa che la risposta sia vera. È una scheda a livello di affermazione che mostra ciò che le evidenze visibili supportano, quando una citazione è solo allegata e quando il sistema dovrebbe registrare onestamente un miss.

L'articolo presenta questo protocollo di registrazione e ripetizione. Non sostituisce la spiegazione più ampia su ricerca AI fondata, citazioni e astensione. Il suo compito più ristretto è rendere verificabile una risposta di test senza inventare un benchmark o nascondere il giudizio in una percentuale di superamento.

Chi ha creato il protocollo, come è stato preparato e perché

Michael Shamanoff, fondatore di Achla AI, è l'autore indicato. Il protocollo deriva dal brief editoriale approvato dal proprietario, dall'attuale artefatto di prodotto e dalla documentazione ufficiale di Microsoft, Ragas e AWS. La domanda per l'argomento resta un'ipotesi sperimentale perché non erano disponibili GSC, Keyword Planner, volumi con licenza o evidenze stabili da autocomplete.

Il metodo trasforma una risposta in piccole decisioni sulle evidenze che un revisore può riprodurre. In questa valutazione, una fonte collegata può essere pertinente al tema senza supportare la frase accanto. Lo scopo è limitato: diagnosticare problemi visibili di recupero e supporto in un caso fisso. Per una definizione compatta prima di usare la scheda, consulta il glossario della ricerca AI.

Iniziare con un fixture di evidenze fisso

Non partire da un punteggio. Congela prima il caso. Un test RAG deve registrare query esatta, versione della raccolta, passaggi recuperati nell'ordine restituito, risposta generata e citazioni mostrate all'utente. Indica inoltre lo stato delle evidenze previsto: quali passaggi servirebbero a una risposta prudente e quale punto richiesto non è coperto dalla raccolta.

Ecco il fixture sintetico usato nell'articolo. Descrive un negozio immaginario; non è un risultato di Achla AI né di un cliente.

Query Q-017: «Posso restituire un articolo in vendita finale dopo 30 giorni e quando inizia l'elaborazione del rimborso?»

Fonte D-01, `/returns`, versione `returns-v4`, passaggio `p04`: «Gli articoli acquistati direttamente dal negozio di esempio possono essere restituiti entro 30 giorni di calendario dalla consegna. Sono esclusi gli articoli in vendita finale.»

Fonte D-02, `/refunds`, versione `refunds-v2`, passaggio `p07`: «L'elaborazione del rimborso inizia dopo che l'articolo restituito raggiunge il magazzino.»

Stato atteso delle evidenze: D-01 supporta una finestra di 30 giorni per acquisti diretti idonei ed esclude esplicitamente gli articoli in vendita finale. D-02 supporta l'evento di inizio dell'elaborazione. Nessun passaggio indica quanto dura l'elaborazione.

Risposta registrata A-017: «Puoi restituire qualsiasi articolo entro 30 giorni, compresi quelli in vendita finale.[D-01] Il rimborso parte quando invii la richiesta.[D-02] Normalmente si completa entro cinque giorni.»

Il fixture è intenzionalmente imperfetto. Il suo valore è consentire a ogni verdetto successivo di rimandare a un testo fisso. Se prima si verifica un disallineamento lessicale, la guida separata sul recupero semantico con parole diverse spiega perché recupero e generazione vanno esaminati come fasi distinte.

Scomporre la risposta in affermazioni sostanziali

Un'affermazione è sostanziale se, essendo errata o assente, può cambiare la decisione del lettore. Separa congiunzioni, quantità, esclusioni, date, relazioni causali e passaggi procedurali quando dipendono da evidenze diverse. Non valutare un intero paragrafo come unità.

Per A-017, la scheda registra quattro affermazioni:

  1. C-017-1: qualsiasi articolo può essere restituito.
  2. C-017-2: il periodo di restituzione è entro 30 giorni.
  3. C-017-3: l'elaborazione del rimborso inizia quando viene inviata la richiesta.
  4. C-017-4: l'elaborazione del rimborso si completa normalmente entro cinque giorni.

«Compresi quelli in vendita finale» appartiene a C-017-1 perché amplia «qualsiasi articolo» e contraddice un'esclusione esplicita. I 30 giorni restano separati perché il passaggio supporta la durata, con limiti di perimetro. L'ultima affermazione è separata perché nessun passaggio parla di durata.

Questa scomposizione impedisce a un frammento supportato di legittimarne uno non supportato e rende visibile il disaccordo. Un revisore può contestare il confine di C-017-1 senza cambiare silenziosamente il verdetto di C-017-2. Per raccolte scientifiche o tecniche, la stessa disciplina è centrale in un flusso di ricerca citation-first, anche se possono servire esperti di dominio per definire ciò che è sostanziale.

Costruire la scheda delle evidenze a livello di affermazione

Usa una riga per ogni affermazione. Una scheda operativa richiede:

  • ID di caso, query, risposta e affermazione;
  • testo dell'affermazione copiato dalla risposta registrata;
  • ID delle citazioni allegate esattamente come mostrate;
  • ID e versione della fonte recuperata, ID passaggio e posizione restituita;
  • testo esatto del passaggio usato per la revisione;
  • verdetto e motivo sull'associazione della citazione;
  • verdetto e motivo scritto sul supporto semantico;
  • diagnosi limitata alle evidenze visibili;
  • revisore, ora e nota irrisolta.
AffermazioneCitazione allegataPassaggio esattoAssociazioneSupporto semanticoMotivo scritto
C-017-1: qualsiasi articolo può essere restituito, compresi quelli in vendita finale.D-01D-01 returns-v4 p04: «Gli articoli acquistati direttamente dal negozio di esempio possono essere restituiti entro 30 giorni di calendario dalla consegna. Sono esclusi gli articoli in vendita finale.»allegatanon supportataIl passaggio esclude esplicitamente gli articoli in vendita finale e non supporta «qualsiasi articolo».
C-017-2: il periodo di restituzione è entro 30 giorni.D-01D-01 returns-v4 p04, stesso passaggio registratoallegataparzialmente supportataIl periodo compare, ma la risposta omette i limiti sugli acquisti diretti e sulla vendita finale.
C-017-3: il rimborso parte quando viene inviata la richiesta.D-02D-02 refunds-v2 p07: «L'elaborazione del rimborso inizia dopo che l'articolo restituito raggiunge il magazzino.»allegatanon supportataLa risposta indica l'invio della richiesta; il passaggio indica la ricezione in magazzino.
C-017-4: l'elaborazione termina normalmente entro cinque giorni.nessunaNessun passaggio recuperatomancantenon supportataLe evidenze visibili non contengono alcuna durata.

Conserva il passaggio esatto, non solo l'URL. Una pagina può avere sezioni simili e un replay non le distingue con un localizzatore vago. Con ancore stabili, salva URL e ancora oltre all'ID del passaggio. Senza ancore, salva l'hash del contenuto e testo adiacente sufficiente per ritrovare il passaggio dopo una modifica.

I framework ufficiali adottano separazioni correlate. La documentazione Microsoft sui valutatori RAG distingue valutazione del recupero e della risposta. Ragas descrive la faithfulness tramite affermazioni supportabili dal contesto. AWS distingue modalità retrieve-only e retrieve-and-generate. Le fonti aiutano a separare rilevanza del recupero e fedeltà RAG, ma non forniscono una soglia universale per questa scheda.

Separare l'associazione della citazione dal supporto semantico

«Allegata» risponde a una domanda meccanica: la risposta registrata ha associato una fonte all'affermazione o frase? «Supportata» risponde a una domanda semantica: il passaggio esatto giustifica l'affermazione preservando perimetro, esclusioni, quantità e tempi importanti?

Non unire mai i campi. C-017-1 ha una citazione allegata, ma il passaggio contraddice l'affermazione. C-017-4 non ha citazione né supporto recuperato. In un altro caso potrebbe esserci un passaggio a supporto senza citazione mostrata: sarebbe un problema di associazione, non prova di un errore di recupero.

Usa quattro verdetti limitati:

  • supportata: il passaggio visibile supporta l'affermazione e i qualificatori importanti;
  • parzialmente supportata: supporta una parte separabile ma lascia irrisolti un qualificatore, perimetro o relazione sostanziali;
  • non supportata: i passaggi visibili non giustificano l'affermazione o la contraddicono;
  • non valutabile: la scheda è incompleta o servono competenze o evidenze esterne al fixture.

Ogni verdetto richiede un motivo scritto. L'etichetta è un indice, non l'analisi. «Non valutabile» deve indicare che cosa manca e non diventare una scorciatoia.

Diagnosticare soltanto ciò che consente la scheda visibile

La scheda può mostrare un sintomo senza provarne la causa nascosta. Usa un linguaggio prudente e separa osservazione e ipotesi.

Scheda visibileOsservazione circoscrittaControllo successivo possibile — non causa provata
Il passaggio atteso manca dai risultatiL'evidenza necessaria non era visibile alla fase di risposta in questa esecuzione.Controllare appartenenza alla raccolta, versione dell'indice, query, filtri e profondità.
Il passaggio è recuperato ma la risposta omette l'esclusioneLa risposta non conserva un qualificatore visibile.Esaminare istruzioni di generazione e traccia salvata.
La citazione allegata confligge con l'affermazioneL'associazione non dimostra supporto.Esaminare selezione delle citazioni e mappatura affermazione-passaggio.
Esiste un passaggio di supporto ma non compare la citazioneIl fixture contiene supporto visibile, mentre la fonte non è presentata.Esaminare rendering e payload delle citazioni.
Il localizzatore risolve testo diverso nel replayLa deriva della fonte impedisce un confronto equivalente.Ripristinare la versione registrata o segnare il replay come non comparabile.
La raccolta non contiene il fatto richiestoIl fixture non può supportare la risposta con le fonti limitate.Attendersi un miss onesto o una risposta chiaramente limitata.

La matrice non è un valutatore automatico e non attribuisce l'errore a un componente. Restringe l'ispezione successiva. La distinzione è utile nel passaggio dalla ricerca di pagine alle risposte; vedi perché la ricerca trova pagine mentre i visitatori cercano risposte.

Registrare un miss onesto come risultato di prima classe

Il test del miss onesto aggiunge un caso in cui il fatto richiesto è assente. Per Q-017, i cinque giorni non hanno supporto. Una risposta circoscritta potrebbe dire: «Le fonti disponibili indicano che l'elaborazione inizia quando l'articolo raggiunge il magazzino, ma non specificano il tempo di completamento». La scheda registra separatamente l'evento supportato e la durata non disponibile.

Nell'attuale artefatto Achla AI, il percorso principale fondato richiede testo della risposta insieme a citazioni; il widget ha anche uno stato visibile di mancata risposta e può mostrare link alle fonti. È una descrizione dell'implementazione locale ispezionata, non un'affermazione di prestazioni o affidabilità. Anche un miss richiede metadati di replay, perché una versione successiva della fonte può aggiungere il fatto.

Salvare i metadati di replay e versione

Schede di evidenza RAG a livello di singola affermazione collegate ai passaggi sorgente e ripetute dopo una modifica.
Tra un'esecuzione e l'altra vengono conservati la stessa query, i campi delle evidenze e i metadati di versione.

Un replay è utile solo sapendo che cosa è rimasto fisso e che cosa è cambiato. Salva per ogni caso:

  • testo e ID della query;
  • testo e ID della risposta;
  • passaggi recuperati ordinati, punteggi se esposti e filtri;
  • ID delle citazioni mostrate e associazione ad affermazione o frase;
  • ID snapshot della raccolta, fonti, versioni, passaggi e hash dei contenuti;
  • identificatori della configurazione di recupero e generazione;
  • versione di prompt/istruzioni, identificatore del modello registrato e revisione dell'applicazione;
  • locale, ora del test, revisore e versione dello schema della scheda.

Nel replay di regressione RAG, crea un nuovo run ID. Non sovrascrivere la vecchia risposta e non aggiungere retroattivamente nuovi passaggi. Confronta le righe solo quando i fixture sono compatibili. Se query, snapshot o testo del localizzatore cambiano, dichiaralo. Un esito diverso può meritare indagine, ma la scheda non ne stabilisce da sola la causa.

Non trasformare il protocollo in una classifica. Non mediare le etichette in un punteggio inventato, non stabilire una soglia arbitraria e non pubblicare un tasso di successo da un set non rappresentativo. Un'aggregazione richiede un disegno di valutazione separatamente approvato; questa scheda conserva evidenze e giudizio prima dell'aggregazione.

Assemblare il pacchetto di audit

Il pacchetto minimo comprende fixture congelato, output grezzo del recupero, risposta registrata, citazioni mostrate, righe completate, note del revisore, metadati di versione e confronto di replay. Includi lo schema e un manifest con gli hash. Elenca come mancante ciò che non è disponibile, senza ricostruirlo a memoria.

Per un corpus documentale limitato, conserva il pacchetto accanto al responsabile operativo del flusso di ricerca nella documentazione, non separato dalla cronologia delle fonti.

Mantieni le decisioni append-only o versionate. Se un revisore successivo contesta la scomposizione o il verdetto, conserva sia la riga originale sia la revisione documentata. Questa storia vale più di una scheda pulita ma non tracciabile.

Limiti

Il protocollo valuta il supporto rispetto a evidenze catturate e visibili. Non prova che una fonte sia vera, aggiornata, completa o adatta a decisioni ad alto rischio. Non rileva tutte le fonti pertinenti che il recupero potrebbe aver mancato. Non sostituisce revisione specialistica, test di sicurezza, privacy e accessibilità né valutazione di latenza ed esperienza utente.

I confini delle affermazioni e i verdetti semantici richiedono giudizio. Revisori diversi possono ragionevolmente dissentire, soprattutto quando un passaggio implica invece di dichiarare una relazione. Registra disaccordo e motivo. Non trasformare il protocollo in un giudice automatico o benchmark universale senza un metodo convalidato separatamente.

Usare la scheda su un corpus limitato del sito

Scegli un piccolo insieme versionato di domande reali dei visitatori, includi almeno una lacuna nota nelle evidenze e conserva il pacchetto per ogni replay. Otterrai una checklist RAG ispezionabile senza affermare più di ciò che mostra la scheda.

Per provare il flusso su contenuti che controlli, collega il tuo sito e lascia a un revisore umano le decisioni fattuali, di sicurezza e pubblicazione.