Si vous copiez-collez encore le code fichier par fichier dans la fenêtre de Claude ou ChatGPT, vous ne perdez pas seulement votre temps, vous privez aussi le modèle de la compréhension des relations au sein de l'architecture du projet.
Pour un travail correct avec un LLM, la base de code doit être correctement empaquetée. Pour automatiser ce processus, il existe actuellement deux outils raisonnables. Ils ont le même objectif, mais des philosophies et des écosystèmes différents.
🛠 Repomix
Objectivement, le meilleur outil à ce jour. Insérer une URL GitHub ou un dossier local est une fonctionnalité de base. Sa vraie valeur réside ailleurs :
🟢 Balises XML. Il empaquette le code dans une structure arborescente de balises XML. Si vous m'écoutez au Point de Rassemblement, vous savez que les modèles modernes analysent le balisage XML bien plus précisément que d'autres formats.
🟢 Compression AST. Sous le capot, Tree-sitter analyse l'arbre syntaxique et peut supprimer les détails d'implémentation (corps de fonctions), ne laissant que les interfaces, classes et signatures. Cela économise jusqu'à 70% de la fenêtre de contexte sans perte de compréhension de l'architecture.
🟢 Vérification de sécurité. Secretlint intégré vous tapera sur les doigts si vous essayez de nourrir un réseau neuronal open source avec des clés ou mots de passe codés en dur.
🟢 Serveur MCP. Capable de fonctionner via le protocole Model Context Protocol. Les agents IA peuvent interagir directement avec votre base de code localement.
🐍 Gitingest
La réponse de la communauté Python. Techniquement plus simple (sans magie AST ni compression), mais il a ses atouts.
🟡 Magie d'URL. Le moyen le plus rapide d'obtenir un dump d'un dépôt tiers. Étant sur GitHub, changez simplement
github.com en gitingest.com dans la barre d'adresse — le texte est prêt à être copié-collé.🟡 Python natif. S'installe via
pip et s'appelle directement depuis votre code. Besoin de nourrir un projet dans un pipeline RAG personnalisé ? summary, tree, content = ingest("path") et c'est parti.🟡 Asynchrone sous Jupyter. Supporte
await ingest_async(), ce qui en fait une béquille idéale pour les analystes et data scientists qui ne quittent pas leurs notebooks.💡 Que choisir ?
Si vous devez analyser un gros projet avec une structure complexe pour un refactoring — installez Repomix.
Si vous écrivez vos propres outils en Python ou devez extraire du code de GitHub en 3 secondes sans terminal — utilisez Gitingest.
Les deux outils comptent eux-mêmes les tokens, respectent votre
.gitignore, ont des versions web et des extensions de navigateur.#toolbox
Commentaires
0Aucun commentaire pour le moment.
Connectez-vous pour participer à la discussion.