Contenu IA
Comment entraîner un chatbot sur le contenu de votre site
Entraînez un chatbot sur le contenu d’un site par la recherche documentaire, sans réentraîner le modèle : sources, mises à jour, citations et tests.
14 min de lecture

Entraîner un chatbot sur votre site consiste généralement à collecter du contenu public approuvé, à l’indexer, à rechercher les passages pertinents pour chaque question, puis à produire une réponse à partir de ces éléments. Dans la plupart des configurations de chatbot de site géré, cela ne signifie pas modifier les poids d’un modèle de langage de base pour chaque page. Cette distinction est importante, car chaque couche peut échouer différemment.
Un entraînement utile commence donc par des décisions sur les sources, et non par un bouton d’importation. Déterminez ce que le système peut utiliser, préparez ces pages pour la recherche documentaire, consignez leurs versions et testez les questions auxquelles il est possible ou impossible de répondre. Considérez chaque citation comme un élément à vérifier, et non comme une preuve automatique de l’exactitude de la réponse.
Michael Shamanoff Fondateur d’Achla AI
Méthode : ce guide s’appuie sur la documentation officielle de Google Cloud et de l’IETF consultée le 3 août 2026, ainsi que sur l’artefact produit local d’Achla. Aucun résultat produit ni aucun benchmark n’a été mesuré.
Que signifie « entraîner un chatbot sur un site web » ?
Cette expression regroupe souvent quatre opérations distinctes. Pour prendre une décision utile entre RAG et fine-tuning, identifiez l’opération dont vous avez réellement besoin. Google Cloud décrit le fine-tuning comme la poursuite de l’entraînement d’un modèle préentraîné sur des données propres à une tâche, et l’oppose à la génération augmentée par récupération, qui enrichit un prompt avec des connaissances externes. Sa documentation actuelle décrit également le fine-tuning supervisé comme un apprentissage à partir d’exemples étiquetés qui met à jour les paramètres du modèle. (Présentation du fine-tuning ; documentation sur le tuning)
| Couche | Ce qui change | Question du propriétaire du site | Réponse habituelle à une mise à jour |
|---|---|---|---|
| Fine-tuning | Paramètres du modèle ou adapters appris à partir d’un jeu de données d’entraînement | La tâche nécessite-t-elle d’adapter le comportement, le format ou le style ? | Préparer des exemples étiquetés, ajuster et évaluer le modèle, puis gérer ses versions. |
| Indexation | Représentation interrogeable du contenu approuvé | Quelles pages et sections sont accessibles à la recherche et à jour ? | Explorer ou importer la source modifiée et actualiser l’index de contenu. |
| Recherche | Éléments probants sélectionnés pour une requête | Le système a-t-il trouvé le passage qui répond à cette question ? | Améliorer la source, le découpage, les metadata, les embeddings ou la configuration de recherche. |
| Génération | Réponse composée à partir du contexte récupéré | Chaque affirmation importante reste-t-elle dans les limites des éléments probants ? | Resserrer les instructions ou les contrôles de grounding, puis rejouer le test. |
Ce modèle de diagnostic ne décrit pas le pipeline propriétaire de chaque fournisseur. Les produits peuvent combiner certaines étapes ou techniques de recherche. Une exploration ne prouve pas l’indexation, la récupération d’un contenu ne prouve pas que le bon passage a été sélectionné, et un lien vers une source ne prouve pas qu’elle étaye l’affirmation.
Décidez quel contenu du site le chatbot peut utiliser
Avant de créer un chatbot à partir du contenu d’un site, inventoriez les pages publiques, à jour, utiles et autorisées. Attribuez une décision à chaque source :
| Décision | Quand l’utiliser | Action suivante |
|---|---|---|
include | La page publique contient une réponse claire et actuelle, avec un responsable identifié. | Consigner son URL, sa version ou sa date de mise à jour, ainsi que les questions attendues. |
fix first | Le sujet fait partie du périmètre, mais la page est ambiguë, obsolète, contradictoire ou incomplète. | Corriger la source canonique avant de l’indexer. |
exclude | La page est dupliquée, navigationnelle, non pertinente, dépassée ou susceptible de perturber la recherche. | La maintenir hors de l’ensemble de sources et en consigner la raison. |
unsupported/private | L’accès nécessite des identifiants, un réseau privé, le contexte d’un client ou une autorisation dont le workflow ne dispose pas. | Ne pas contourner cette limite ; choisir une source ou un cas d’usage pris en charge. |
Séparez les règles robots du contrôle d’accès
La RFC 9309 définit le protocole d’exclusion des robots comme un ensemble de règles que les robots sont invités à respecter et précise explicitement que ces règles ne constituent pas une autorisation d’accès. Elle recommande aussi une véritable sécurité applicative, comme l’authentification HTTP, pour les chemins protégés. Une règle Disallow peut révéler un chemin ; elle ne rend pas la ressource confidentielle. (IETF RFC 9309)
Ne placez pas d’identifiants dans les URL d’exploration, ne contournez pas les écrans de connexion et ne traitez pas comme publics les contenus réservés aux employés, propres à un client, réglementés, intranet ou accessibles uniquement sur un réseau privé. Le robot d’exploration d’Achla vérifie les décisions robots, refuse les URL contenant des identifiants et bloque les cibles privées ou internes. Cela ne démontre pas la prise en charge de l’ingestion d’une base de connaissances privée.
Préparez et indexez le contenu du site pour une recherche utile
Pour indexer le contenu d’un site pour l’IA, rendez chaque section compréhensible lorsqu’elle est récupérée hors de sa page. Un texte exploré peut néanmoins rester une mauvaise source de réponse.
- Donnez à chaque section un titre descriptif correspondant à la question traitée.
- Placez la réponse directe à proximité, puis ajoutez les conditions, exceptions, dates et exemples.
- Conservez un responsable canonique et stable pour chaque fait ; résolvez les pages dupliquées ou contradictoires.
- Employez des noms cohérents pour les produits, les offres, les politiques et les concepts techniques.
- Consignez l’URL de la source, sa date de mise à jour significative, le résultat d’accès, le résultat
robotset les questions auxquelles elle doit répondre.
Distinguez la préparation à l’exploration de la préparation aux réponses :
| Observation | Ce qu’elle prouve | Ce qu’elle ne prouve pas |
|---|---|---|
| Le robot a récupéré une page | La page était accessible pendant cette exécution. | La section utile a été indexée ou sera récupérée. |
| La page apparaît dans l’index de contenu | Une représentation interrogeable existe. | Le bon passage sera sélectionné pour une requête donnée. |
| Un passage a été récupéré | Des éléments probants ont été sélectionnés pour cette requête. | La réponse générée reprend fidèlement toutes leurs conditions. |
Pour un workflow plus approfondi d’édition des sources, voyez comment préparer les sections d’un site pour la recherche. Ne préconisez pas de boutons d’actualisation, de calendriers ou de délais d’indexation, sauf si le produit choisi les documente et les propose.
Comment maintenir à jour les connaissances du chatbot ?
Pour maintenir à jour les connaissances du chatbot, utilisez l’actualisation et le rejeu plutôt que le « réentraînement ». Google Cloud distingue les actualisations automatiques, manuelles et fondées sur un sitemap, et définit l’actualisation ou la nouvelle exploration comme la récupération et l’indexation de la version la plus récente d’une page. (Actualiser les pages web)
- Conservez l’ancienne version de la source et une requête de test fixe.
- Publiez la correction autorisée dans la source de vérité.
- Déclenchez ou attendez le mécanisme de nouvelle exploration ou d’actualisation pris en charge par le fournisseur.
- Vérifiez que la page ou la version modifiée peut être trouvée dans l’index de contenu.
- Rejouez la même requête et comparez la réponse, les citations et le verdict humain sur leur justification.
Ne déduisez pas de cette documentation propre à Google un calendrier d’actualisation, un niveau de service ou une mise à jour instantanée pour Achla. La fraîcheur est un état observé : l’évaluateur doit identifier la version de la source disponible au moment où la réponse a été testée.
Exigez des citations du chatbot, mais vérifiez leur pertinence
Une réponse fondée sur des sources est plus facile à auditer lorsque l’interface présente ces sources. La documentation de Google Cloud définit une réponse comme un texte généré par l’IA à partir de résultats de recherche et propose des options pour les citations et le grounding au niveau des affirmations. Il s’agit de mécanismes de vérification, pas d’une garantie universelle d’exactitude. (Obtenir des réponses et des suivis)
Examinez chaque affirmation importante à l’aide de trois questions :
- La page citée contient-elle le passage pertinent ?
- Ce passage étaye-t-il l’intégralité de l’affirmation, y compris ses conditions, son périmètre et sa date ?
- Si les éléments probants sont absents ou partiels, la réponse doit-elle se restreindre, poser une question ou signaler de façon encadrée qu’elle n’a rien trouvé ?
| État de l’affirmation | État de la citation | Décision de l’évaluateur |
|---|---|---|
| Entièrement étayée | La source et le passage pertinents peuvent être examinés | Accepter cette affirmation pour la ligne de test. |
| Partiellement étayée | La source ne couvre qu’une partie de l’affirmation | Restreindre la réponse et rejouer le test. |
| Contredite | La source indique quelque chose de sensiblement différent | Rejeter la réponse et localiser la couche défaillante. |
| Non évaluable | La source ou le passage n’est pas accessible à l’évaluateur | Consigner la limite, sans supposer. |
Le code inspecté du widget Achla peut afficher des marqueurs de citation intégrés, une liste de sources et un état visible lorsqu’aucune réponse n’est disponible. Cela prouve uniquement le comportement actuel de l’interface. Cela ne prouve pas que chaque réponse est correcte ni que chaque citation étaye chaque affirmation. Consultez les limites qu’imposent le `grounding` et les citations à une réponse.
Comment tester avant le lancement un chatbot entraîné sur le contenu du site ?
Utilisez un registre fixe de préparation et de rejeu pour l’entraînement sur site web. Il transforme une démonstration subjective en décision vérifiable sans inventer de taux de réussite.
Construisez une matrice de questions fixe
Incluez au minimum les catégories de cas suivantes :
- une question à laquelle une seule page publique claire permet de répondre ;
- une question nécessitant deux pages approuvées ;
- une question à laquelle il n’est possible de répondre que partiellement, car une condition manque ;
- un cas obsolète après une modification connue de la source ;
- une question sans élément probant qui doit produire une absence de résultat encadrée ;
- une question portant sur des données privées ou interdites qui ne doit pas révéler de contenu indisponible ;
- une question ambiguë qui doit conduire à une demande de précision ou à une réponse restreinte.
Pour chaque ligne, consignez :
test_id ; requête exacte ; catégorie du cas ; URL attendue de chaque source ; éléments probants attendus ou leur absence ; version/date de la source ; version de l’actualisation ou de l’index si elle est disponible ; réponse observée ou absence de résultat ; URL de chaque citation renvoyée ; verdict humain sur la justification ; couche probablement défaillante ; action suivante ; évaluateur ; observed_at.
Il s’agit d’un protocole, et non d’un résultat d’Achla. Aucune démonstration fondée sur des questions fixes n’a été exécutée ; les réponses, citations, taux et résultats observés restent inconnus.
Localisez la couche défaillante
- Défaillance de la source : le site ne contient pas de réponse claire et actuelle. Corrigez la source de vérité.
- Défaillance d’accès ou d’index : une source publique autorisée n’est pas accessible au robot ou n’est plus à jour dans l’index. Corrigez l’accès ou actualisez l’index.
- Défaillance de recherche : la bonne source est indexée, mais le passage attendu n’est pas sélectionné. Examinez la structure du contenu et la recherche.
- Défaillance de génération ou de justification : les éléments probants sont présents, mais la réponse ajoute, omet ou contredit une condition importante. Restreignez la réponse et recommencez le test.
- Défaillance d’affichage des citations : des éléments probants ont peut-être été utilisés, mais l’évaluateur ne peut pas les examiner. Ne qualifiez pas la réponse de vérifiable.
- Non évaluable : les éléments probants internes du système ne sont pas disponibles. Consignez cette limite au lieu de supposer.
Prenez une décision circonscrite
Ne transmettez le cas d’usage à une revue humaine de lancement que lorsque les cas positifs critiques pour l’activité disposent d’éléments probants visibles, que les cas critiques portant sur des données absentes ou privées restent encadrés et que chaque avertissement a un responsable. Révisez et rejouez le test lorsqu’il existe une correction concrète de la source, de l’accès, de la fraîcheur, de la recherche, de la génération ou de la citation. Ne lancez pas ce cas d’usage lorsque les sources nécessaires ne sont pas prises en charge ou sont privées, que des affirmations critiques restent sans justification, ou que le parcours des éléments probants ne peut pas être examiné.
Utilisez une feuille versionnée pour consigner et rejouer les éléments probants au niveau des affirmations, au lieu de remplacer les lignes ayant échoué par des questions plus simples.
Chatbot de site géré, RAG personnalisé ou fine-tuning ?
Le meilleur modèle opérationnel dépend du niveau de contrôle dont vous avez besoin et du travail que votre équipe peut prendre en charge.
| Approche | Cas le plus adapté | Ce qui reste à la charge de l’équipe |
|---|---|---|
| Chatbot ou moteur de recherche géré pour un site | Sources publiques du site, réponses générées, citations et intégration sans exploiter l’intégralité du backend de recherche | Périmètre et qualité des sources, décisions d’accès, tests et évaluation ; les capacités varient selon les produits. |
| RAG personnalisé | Contrôle de l’ingestion, de la recherche, des autorisations, de l’évaluation et des intégrations | Architecture, infrastructure, sécurité, actualisation, observabilité et évaluation continue. |
| Fine-tuning | Adaptation du comportement ou d’une tâche reposant sur des exemples étiquetés appropriés | Qualité du jeu de données, entraînement, évaluation du modèle, déploiement et surveillance. Il ne remplace pas la récupération des informations changeantes d’un site. |
L’artefact produit d’Achla décrit une recherche gérée par l’IA sur le contenu public d’un site : le propriétaire intègre un script au lieu d’exploiter l’intégralité du backend de réponse. Il affiche également les sources et un état d’absence de réponse. Ce sont des faits d’implémentation, pas des promesses de résultats. Découvrez ce qu’une configuration gérée supprime et ce que le propriétaire doit encore tester.
Erreurs courantes lors de l’entraînement d’un chatbot de site
- Appeler l’ingestion « fine-tuning ». Nommez séparément l’indexation, la recherche, la génération et l’ajustement des paramètres.
- Indexer toutes les pages. Prenez une décision explicite :
include,fix,excludeouunsupported. - Considérer `robots.txt` comme un outil de confidentialité. Utilisez l’authentification et l’autorisation pour les contenus protégés.
- Supposer qu’une exploration prouve la recherche. Testez la question exacte et examinez les éléments probants renvoyés.
- Considérer toute citation comme une justification. Vérifiez le passage, les conditions, le périmètre et la date.
- Tester uniquement les questions faciles. Ajoutez des cas de test négatifs partiels, sans réponse, obsolètes, privés et ambigus.
- Mettre à jour le contenu sans rejouer le test. Vérifiez la version actualisée, puis répétez la même requête.
FAQ
Peut-on entraîner un chatbot à partir d’un site web ?
Oui, si « entraîner » signifie utiliser le contenu autorisé du site comme source de recherche. Le workflow habituel consiste à sélectionner des pages publiques, à les préparer, à les explorer ou à les importer, à les indexer, puis à tester les réponses générées. Il ne procède pas nécessairement au fine-tuning du modèle de base.
Entraîner un chatbot de site revient-il à faire du fine-tuning ?
Non. Le fine-tuning modifie les paramètres du modèle ou les adapters appris à l’aide d’exemples d’entraînement. Un chatbot de site récupère généralement des passages actuels dans un index de contenu et les fournit comme contexte au moment de répondre. Un produit peut employer les deux méthodes, mais elles répondent à des problèmes différents.
Comment le RAG utilise-t-il le contenu d’un site ?
Le RAG recherche des informations pertinentes dans une source de connaissances approuvée et ajoute le contexte sélectionné à la génération. Les mises en œuvre varient : certaines emploient des embeddings, des signaux de mots-clés ou une recherche hybride. Testez le passage attendu pour chaque requête importante au lieu de supposer que l’architecture garantit la justification.
À quelle fréquence faut-il actualiser le contenu d’un chatbot de site ?
Actualisez-le après des modifications significatives de la source et selon les mécanismes documentés du produit choisi. Évitez d’appliquer un calendrier universel. Consignez la version de la source, vérifiez que la version actualisée est interrogeable et rejouez les questions fixes afin que la fraîcheur soit observée et non supposée.
Un chatbot de site public peut-il utiliser des données privées ou protégées par une connexion ?
Uniquement si le produit dispose d’un workflow distinct, vérifié et autorisé pour les données privées. Un robot d’exploration de site public ne doit pas contourner les écrans de connexion ni ingérer des identifiants, des ressources de réseau privé ou des données non autorisées. Les éléments examinés pour cet article ne démontrent pas la prise en charge par Achla de l’ingestion d’une base de connaissances privée.
Limites et prochaine étape
Les architectures des fournisseurs, les contrôles d’exploration, le comportement d’indexation, le calendrier d’actualisation, les méthodes de recherche et le fonctionnement des citations varient. Une source actuelle peut être manquée, un passage récupéré peut être mal utilisé, et une citation peut être non pertinente ou incomplète. Les règles robots ne constituent pas une authentification, et l’exploration d’un site public n’est pas un connecteur de données privées. Ce guide propose un protocole d’évaluation, pas un conseil juridique, une certification de sécurité, un benchmark ou une garantie d’exactitude, de classement, de conversion, de réduction des demandes d’assistance ou de délai de lancement.
Si un workflow géré pour un site public correspond à votre périmètre, connectez votre site, commencez avec un petit ensemble de sources autorisées et exécutez la matrice fixe de cas positifs et négatifs. Considérez le résultat comme un élément probant pour une décision humaine, et non comme une autorisation automatique de lancement.


