工具介绍
Marquez-le
> [!IMPORTANT]
> MarkItDown effectue des E/S avec les privilèges du processus actuel. Comme open() ou requests.get(), il accédera aux ressources que le processus lui-même peut accéder. Sanitisez vos entrées dans des environnements non fiables, et appelez la fonction `convert *` la plus étroite nécessaire à votre cas d'utilisation (par exemple `convert stream()`, ou `convert local()`). Voir la section Considérations de sécurité de la documentation pour plus de renseignements.
MarkItDown est un utilitaire Python léger pour convertir différents fichiers en Markdown pour utilisation avec les LLM et les pipelines d'analyse de texte connexes. À cette fin, il est le plus comparable à la textract, mais en mettant l'accent sur la préservation d'une structure et d'un contenu importants comme Markdown (y compris: rubriques, listes, tableaux, liens, etc.) Bien que la production soit souvent raisonnablement présentable et respectueuse de l'être humain, elle est destinée à être consommée par des outils d'analyse de texte -- et peut ne pas être la meilleure option pour les conversions de documents à haute fidélité pour la consommation humaine.
MarkItDown prend actuellement en charge la conversion de:
- PDF
- PowerPoint
- Parole
- Excel
- Images (métadonnées EXIF et OCR)
- Audio (métadonnées EXIF et transcription vocale)
- HTML
- Formats textuels (CSV, JSON, XML)
- Fichiers ZIP (ordonne le contenu)
- URLs YouTube
- EPubs
- et plus encore !
Pourquoi Markdown ?
Markdown est extrêmement proche du texte simple, avec un balisage ou un format minimal, mais toujours
fournit un moyen de représenter une structure de document importante. Les LLMs principaux, tels que
GPT-4o d'OpenAI, nativement " speak " Markdown, et souvent incorporer Markdown dans leur
réponses non sollicitées. Cela suggère qu'ils ont été formés sur de grandes quantités de
Texte au format Markdown, et bien comprendre. En contrepartie, les conventions de Markdown
sont également très efficaces.
Préalables
MarkItDown nécessite Python 3.10 ou plus. Il est recommandé d'utiliser un environnement virtuel pour éviter les conflits de dépendance.
Avec l'installation standard de Python, vous pouvez créer et activer un environnement virtuel en utilisant les commandes suivantes:
Si vous utilisez `uv`, vous pouvez créer un environnement virtuel avec:
Si vous utilisez Anaconda, vous pouvez créer un environnement virtuel avec:
Installation
Pour installer MarkItDown, utilisez pip: `pip install 'markitdown[all]'. Vous pouvez aussi l'installer à partir de la source :
Utilisation
Ligne de commande
Ou utilisez `-o` pour spécifier le fichier de sortie:
Vous pouvez également utiliser le contenu de la pipe:
Dépendances facultatives
MarkItDown a des dépendances optionnelles pour activer différents formats de fichiers. Plus tôt dans ce document, nous avons installé toutes les dépendances optionnelles avec l'option `[all]`. Cependant, vous pouvez également les installer individuellement pour plus de contrôle. Par exemple:
installe uniquement les dépendances pour les fichiers PDF, DOCX et PPTX.
Actuellement, les dépendances facultatives suivantes sont disponibles:
* `[tous]` Installe toutes les dépendances optionnelles
* `[pptx]` Installe les dépendances pour les fichiers PowerPoint
* `[docx]` Installe les dépendances pour les fichiers Word
* `[xlsx]` Installe les dépendances pour les fichiers Excel
* `[xls]` Installe les dépendances pour les anciens fichiers Excel
* `[pdf]` Installe les dépendances pour les fichiers PDF
* `[regarder]` Installe les dépendances pour les messages Outlook
* `[az-doc-intel]` Installe des dépendances pour Azure Document Intelligence
* "[az-contenu-compréhension]" Installe des dépendances pour Azure Content Compréhension
* `[audio-transcription]` Installe les dépendances pour la transcription audio des fichiers wav et mp3
* `[canscription youtube]` Installe des dépendances pour récupérer la transcription vidéo YouTube
Greffons
MarkItDown prend également en charge les plugins tiers. Les plugins sont désactivés par défaut. Pour lister les plugins installés :
Pour activer l'utilisation des plugins :
Pour trouver les plugins disponibles, recherchez GitHub pour le hashtag `#markitdown-plugin`. Pour développer un plugin, voir `packages/markitdown-sample-plugin`.
bitdown-ocr Plugin
Le plugin `markitdown-ocr` ajoute la prise en charge de l'OCR aux convertisseurs PDF, DOCX, PPTX et XLSX, en extrayant le texte des images intégrées en utilisant LLM Vision — le même modèle `llm client` / `llm model` que MarkItDown utilise déjà pour les descriptions d'images. Aucune nouvelle bibliothèque ML ou dépendance binaire requise.
**Installation:**
**Utilisation:**
Passez les mêmes `llm client` et `llm model` que vous utiliseriez pour les descriptions d'images :
Si aucun `llm client` n'est fourni, le plugin se charge toujours, mais OCR est silencieusement ignoré et le convertisseur intégré standard est utilisé à la place.
Voir `packages/markitdown-ocr/README.md` pour une documentation détaillée.
Comprendre le contenu
Azure Content Understanding offre une conversion de meilleure qualité avec extraction structurée en champ (matière avant YAML)