← Retour aux projets

Private Knowledge Hub

TerminéLocal / Privé — pas de démo en ligne
Intéressé par une démonstration personnelle ? Me contacter →

Système de récupération de documents local pour les fichiers de projet privés. Indexe les fichiers CLAUDE.md, README et SKILL.md de plus de 10 projets et répond aux questions en langage naturel avec des références sources ancrées et un rendu markdown formaté.

Technologies

PythonFastAPIPostgreSQLpgvectorAWS RDSmarked.js

Problème

Plus de 65 documents de projet personnels (fichiers CLAUDE.md, README, SKILL.md, fichiers de code) sont dispersés dans plusieurs repos. Pas d'interface unifiée pour interroger les connaissances à travers les projets ou récupérer du contexte à la demande.

Approche

FolderIngester avec parcours récursif de dossiers, 18 types de fichiers supportés, déduplication SHA-256 et limite de 50 Mo. MarkdownLoader avec pipeline de nettoyage regex (supprime ##, **, syntaxe de tableau) avant l'embedding pour de meilleurs scores de similarité. Seuil de similarité calibré à 0,25 — les documents markdown scorent moins bien que les PDF en prose. Scopé via app_name="private_hub" dans la base de données pgvector partagée sur AWS RDS.

Résultat

65+ documents de projet personnels indexés. FastAPI en local sur localhost:8001 — complètement séparé de la démo RAG publique. Suppression et désindexation par document avec nettoyage en cascade des chunks et embeddings. Réponses rendues en markdown formaté via marked.js.

Apprentissages

Le seuil de similarité dépend du type de document : les documents markdown avec syntaxe structurelle scorent moins bien que les PDF en prose — le nettoyage avant l'embedding améliore mesurables la qualité de récupération. Le scoping par app_name permet la réutilisation multi-tenant d'une base de données pgvector partagée sans mélange de données.

Pertinence

Démontre des outils IA privacy-first, la réutilisation pratique d'une infrastructure partagée et la construction d'outils de productivité personnels pour les travailleurs du savoir — sans dépendances externes ni déploiements cloud pour le contenu privé.