Solution de déploiement de localisation de base de connaissances RAG open source

🛒 Pour les entreprises et les équipes ayant des exigences de conformité des données, il fournit un chemin complet vers la sélection de la base de connaissances RAG, le déploiement privatisé, ainsi que l'exploitation et la maintenance.

Présentation de la solution

Il existe un grand nombre de documents, de systèmes, de FAQ et de supports commerciaux accumulés au sein de l'entreprise, mais ils sont dispersés partout et les employés « ne peuvent pas les rechercher, les trouver ou les comprendre ». RAG (Retrieval Augmented Generation) utilise la méthode « récupérer d'abord, puis générer » pour permettre à de grands modèles de répondre à des questions basées sur les propres connaissances de l'entreprise et de fournir une base de traçabilité. Cette solution se concentre sur la pile RAG open source + déploiement localisé pour résoudre l'exigence fondamentale de « la connaissance ne quitte pas l'intranet et les réponses sont bien documentées ».

Portrait de l'utilisateur cible

  • Entreprises ayant des exigences de conformité en matière de données (finances, médicales, gouvernementales, manufacturières, etc.) : les documents ne sont pas autorisés à sortir du domaine.
  • Équipe de gestion des connaissances/formation : il est nécessaire de transformer les systèmes, les SOP et les documents produits en une base de connaissances que les employés peuvent utiliser pour des questions et réponses en libre-service.
  • Equipe R&D : J'espère pouvoir vérifier rapidement RAG à faible coût et évoluer progressivement vers la production.

Résultats attendus et ROI

  • Cycle de déploiement : 1 à 3 jours pour la version autonome, 1 à 3 semaines pour le niveau de production.
  • Efficacité de récupération : le temps de « recherche et utilisation » pour les documents couramment utilisés est réduit de quelques minutes à quelques secondes.
  • Coût : par rapport à un SaaS entièrement géré, le déploiement local peut éviter des frais d'appel de connaissances à long terme basés sur des jetons, et les données restent sur l'intranet.

Conditions préalables

  • Un serveur ou un poste de travail disponible (la version CPU peut faire tourner des petits modèles, la version GPU a une meilleure expérience).
  • Les documents sont principalement dans des formats courants tels que PDF, Word, Markdown et TXT.
  • Clarifier la portée de la base de connaissances et les limites de l'autorité (qui peut lire et qui peut maintenir).

Positionnement de la scène et clarification des limites

Cette solution résout les « questions et réponses sur la récupération de connaissances privées ». Il n’est pas responsable d’un jugement factuel de haute précision ni d’un raisonnement multi-sauts complexe, et ne remplace pas non plus l’interrogation précise des bases de données structurées. Les conditions de saisie sont « un lot de documents aux formats standardisés + des scénarios de questions et réponses clairs » ; les normes de livraison sont « des réponses fondées, des sources cliquables, des autorisations contrôlées et peuvent être exécutées hors ligne ».

Conception du workflow (6 étapes)

Étape 1 : Portée des connaissances et inventaire des formats

  • Entrée : Liste des actifs documentaires existants.
  • Action : Nettoyez les documents en double et expirés, et unifiez le format et la dénomination.
  • Sortie : ensemble de documents importables + table des propriétaires de données.
  • Contrôle d'accès : les documents sont dédupliqués et anciens, et les fichiers sensibles sont marqués séparément.

Étape 2 : Sélection de la pile technologique

  • Entrée : taille du document, conditions matérielles, pile technologique de l'équipe.
  • Action : Sélectionnez la combinaison "Bibliothèque de vecteurs + Interface d'arrangement + Modèle".
  • Sortie : Tableau de conclusion de sélection.
  • Contrôle d'accès : 50 questions réelles ont été utilisées comme test de base et le taux de rappel a atteint un niveau acceptable.

Étape 3 : Déploiement local de modèles et de bibliothèques de vecteurs

  • Entrée : Conclusion de la sélection.
  • Action : Déployez un service d'inférence (tel que Ollama) et une bibliothèque de vecteurs (telle que Milvus).
  • Sortie : services de modèles et de vecteurs disponibles.
  • Contrôle d'accès : la latence d'inférence du modèle et la vitesse d'écriture vectorielle répondent aux normes.

Étape 4 : Stratégie d'importation et de segmentation de la base de connaissances

  • Entrée : Ensemble de documents nettoyés.
  • Action : Configurez la taille des blocs, le chevauchement et les métadonnées pour terminer la vectorisation et le stockage.
  • Résultat : base de connaissances consultable.
  • Contrôle d'accès : vérifiez au hasard 20 questions et récupérez les fragments liés aux hits.

Étape 5 : Configuration conjointe du débogage et de la traçabilité par questions-réponses

  • Entrée : base de connaissances + plateforme d'orchestration (telle que AnythingLLM / Open WebUI / FastGPT).
  • Action : Configurez les mots d'invite, l'affichage de référence et la politique de "rejet sans fondement".
  • Sortie : application de questions-réponses conversationnelles.
  • Contrôle d'accès : les réponses doivent être accompagnées de sources, et les questions sans fondement ne recevront pas de réponse rigide.

Étape 6 : Sécurité, surveillance et mises à jour continues

  • Entrée : application de questions-réponses avant la mise en ligne.
  • Action : contrôle d'accès aux accès, journaux d'audit, tâches de mise à jour incrémentielle et surveillance des effets.
  • Résultat : Plan d’exploitation et de maintenance de la production.
  • Contrôle d'accès : Les accès non autorisés sont bloqués et prendront effet dans les 24 heures suivant la mise à jour du document.

Tableau de mappage des outils

Outils Objectif Niveaux de compte Frais estimés Alternatives
AnythingLLM Interface Q&R de base de connaissances unique Open source/commercial Open source et gratuit Ouvrir l'interface utilisateur Web
Open WebUI Interface conversationnelle et gestion documentaire Source ouverte Gratuit N'importe quoiLLM
FastGPT Plateforme RAG de flux de travail visuel Version open source/commerciale À partir de gratuit Flowise
Flowise Orchestration visuelle Source ouverte Gratuit RapideGPT
Ollama Inférence locale de grand modèle Source ouverte Gratuit lama.cpp
Milvus Base de données vectorielles Source ouverte Gratuit Qdrant/Chroma

Remarque : le coût est basé sur la page officielle en temps réel ; la version open source est calculée sur la base des coûts des ressources auto-hébergées et le GPU est à la demande.

Coût, risque et seuil de mise en œuvre

Structure d'entrée

  • Effectif : 1 ingénieur, 1-3 semaines ; La compilation des connaissances nécessite la coopération du côté des entreprises.
  • Matériel : La version CPU démarre avec un minimum de 16 Go de mémoire ; Le GPU est recommandé pour le niveau de production (sous réserve du modèle et de la concurrence).
  • Coûts des outils : La pile open source est gratuite, principalement les coûts de matériel et de maintenance.

Contrôle des risques et des accès

  • Conformité des données : Confirmez que le document ne contient pas de contenu sensible qui ne doit pas entrer dans la base de connaissances.
  • Dérive de qualité : le fait de ne pas mettre à jour les documents en temps opportun peut conduire à des informations trompeuses. Des mises à jour incrémentielles et des enregistrements de version sont requis.
  • Hallucinations restantes : La double assurance « traçabilité des citations + refus de réponse infondé » doit être activée.
  • Seuil d'exploitation et de maintenance : l'auto-hébergement nécessite une sauvegarde, une mise à niveau et une surveillance pour éviter la perte de connexion d'un point unique.

Avantages et coûts cachés

  • Avantages : le taux de réutilisation des connaissances augmente, la formation des nouveaux employés et la main-d'œuvre chargée des questions et réponses du service client diminuent.
  • Coût : La base de connaissances est un « actif à long terme » et nécessite un maintien continu de la qualité des documents et du rythme de mise à jour.

Résultats attendus et critères d'acceptation

  • Acceptation 1 : Toutes les bases de connaissances sont stockées, les sources peuvent être retracées et les références peuvent être cliquées.
  • Acceptation 2 : 50 tests de base de questions réelles réussis et les questions non fondées ont été correctement rejetées.
  • Acceptation 3 : L'intranet fonctionne hors ligne et aucune donnée ne sort du domaine.
  • Acceptation 4 : les autorisations et l'audit sont efficaces et le mécanisme de mise à jour incrémentielle des documents est stable.

Foire aux questions et dépannage (FAQ)

  1. Les machines à processeur peuvent-elles exécuter RAG ?

    capable. Le petit modèle (version quantifiée 7B) peut être exécuté sur le CPU, mais la vitesse de réponse est lente ; Le GPU est recommandé lorsque la concurrence est élevée.

  2. Choisissez AnythingLLM ou FastGPT ?

    Choisissez AnythingLLM pour un lancement rapide (moins de configuration) ; choisissez FastGPT si vous avez besoin de flux de travail complexes et de plusieurs séries de branches conditionnelles.

  3. Que dois-je faire si la récupération des documents n'est pas autorisée ?

    Ajustez d'abord la taille du bloc (500 à 1 000 mots sont appropriés) et le chevauchement, puis vérifiez le modèle d'intégration et enfin utilisez un meilleur reclassement.

  4. Que dois-je faire si j'ai de nombreuses hallucinations ?

    Activez le "rejet sans fondement", forcez la citation des sources, augmentez la recherche TopK puis réorganisez.

  5. Comment maintenir la base de connaissances à jour ?

    Configurez les tâches de mise à jour incrémentielle des documents (analyse planifiée du répertoire ou déclenchement manuel) et refaites la vectorisation après les mises à jour.

  6. Comment isoler les autorisations de plusieurs départements ?

    La couche plate-forme est isolée par espace/collection, la bibliothèque de vecteurs est regroupée par collection et le frontal est filtré par rôle d'utilisateur.

Avancement et expansion

  • Récupération hybride : fusion vecteur + mot-clé (BM25) pour améliorer le rappel des questions longue traîne.
  • Reranking : Introduire le modèle de rerank pour affiner le classement du Top 50 au Top 5.
  • Stockage multimodal : accédez à l'OCR et à la vectorisation d'images, couvrant les documents numérisés.
  • Intégration avec Agent : Faire de la base de connaissances un outil de recherche d'Agent et relier les processus métiers.

Avis des utilisateurs

  • Chargement des avis...