← Journal
Note·septembre 2026·Journal

Une base de connaissance que l'IA peut lire

Trois couches, un format ouvert, un tissage entre fiches : ce qui rend un corpus interrogeable — mesuré sur 8 934 documents.

AVANT / APRÈS L'IAAVANTArchive rangéeRetrouvé plus tard — valeur différéeAPRÈSFichiers .mdchez soiAssistant IAlit toutDialogueRéponse depuis vos propres notes — pas depuis le web.
L'archive rangée pour plus tard laisse place à des fichiers plats lus par un assistant, qui répond depuis vos propres notes.

Pourquoi les outils de notes ne suffisent pas

Les applications propriétaires optimisent la capture, pas le rappel par une IA. Base opaque, format fermé, recherche par mots-clés : un modèle ne peut ni parcourir l'ensemble ni raisonner dessus. On empile une connaissance qu'on ne mobilise jamais. Et le jour où l'outil ferme ou double son prix, le corpus est captif — or cette donnée est un actif que l'IA ne commoditise pas.

Le cadre : trois couches, pas un outil

Le modèle de référence a été formalisé par Andrej Karpathy en 2026, sous le nom de LLM wiki. Il tient en trois couches, et c'est la séparation qui compte :

  1. Les sources brutes, immuables. Documents, comptes-rendus, transcriptions. Le modèle les lit, il n'y écrit jamais.
  2. Le wiki compilé. Des fiches de synthèse par entité et par concept, écrites et maintenues par le modèle, reliées entre elles. Chaque nouvelle source met à jour dix à quinze fiches — c'est le tissage qui fait la valeur, pas l'empilement.
  3. Le schéma. Un fichier court qui dit au modèle comment la base est organisée, où chercher, ce qu'il a le droit de modifier.

Le format, lui, est sans surprise : du texte brut, des métadonnées légères en tête de fichier, une arborescence stable. Lisible par n'importe quel modèle, aujourd'hui et dans dix ans.

Ce que ma propre base m'a appris

J'ai mesuré la mienne contre ce cadre en septembre 2026. Le résultat n'est pas flatteur, et c'est pour cela qu'il est utile.

  • La fondation est solide : le schéma, les règles de routage, la mémoire de l'assistant. C'est là que la plupart des bases échouent ; la mienne tient.
  • Le wiki est plat. 1 565 fiches reliées par des liens, mais chacune produite isolément : une source nouvelle crée une fiche, elle n'en met pas quinze à jour. Le tissage manque — et c'est le levier principal.
  • La recherche est par mots-clés. Pas de couche sémantique. J'avais fixé le seuil à 800 fiches avant de l'installer ; il est dépassé. Le moteur retenu, open source et local, expose la base au modèle sans qu'un document en sorte.
  • L'automatisation nocturne dépendait d'un poste allumé. Elle s'est arrêtée le 1er mai 2026 sans prévenir. Le récit complet est dans L'IA qui rêvait.

Deux illusions, au passage. « Trop de documents, ça va ramer » : faux — 8 934 fichiers texte pèsent quelques dizaines de méga-octets. Et « l'IA rangera à ma place » : faux aussi. Laissée sans garde-fou, elle gonfle la base de texte plausible jusqu'à en faire un décor. La règle qui tient : le modèle propose, l'humain valide, tout est versionné, et un seul processus écrit à la fois.

Une base de connaissance ne vaut que par ce qu'on peut en retirer sans la relire. Le format ouvert et le tissage entre fiches sont les deux conditions ; l'outil n'en est pas une.

Ce que cela change pour une organisation

Décisions passées, comptes-rendus, procédures, retours clients : la connaissance interne cesse d'être un entrepôt mort et devient un actif interrogeable, sans que la donnée quitte le périmètre de l'entreprise. C'est le socle d'un usage sérieux de l'IA en interne — souverain, durable, indépendant de l'outil du moment. Et c'est un chantier de structure avant d'être un chantier de logiciel : le choix du format et l'ordre de rangement décident de tout ce que l'IA pourra faire ensuite.

C'est le socle que je mets en place chez Orogen, à partir de ce que j'ai construit et mesuré sur ma propre base. Écrivez-moi, on en parle.

Sources

  • Andrej Karpathy, LLM Wiki, note publiée sur GitHub, 2026 — le modèle en trois couches : sources brutes, wiki compilé, schéma — gist.github.com.
  • Mesure de la base MoonLab au 13 septembre 2026 : 8 934 fichiers Markdown, 1 565 fiches de synthèse, 211 états de l'art, 18 dossiers de premier niveau — comptage réalisé sur le dépôt lui-même.
  • Sur la panne silencieuse de l'automatisation nocturne : voir la ressource L'IA qui rêvait.