工具介绍
マークダウン
> 【重要】
> MarkItDown は、現在のプロセスの特権を持つ I/O を実行します。 open() や Request.get() と同様に、プロセス自体がアクセスできるリソースにアクセスします。 信頼できない環境で入力をSanitizeし、使用例(例えば、`convert stream()`、`convert local()`)` の最も狭い `convert *` 関数を呼び出します。 詳細については、ドキュメントのセキュリティ検討セクションを参照してください。
MarkItDown は、さまざまなファイルを LLM および関連テキスト解析パイプラインで使用するための Markdown に変換する軽量な Python ユーティリティです。 そのためには、テックストラクターに最も匹敵しますが、重要な文書構造とコンテンツをマークダウンとして保存することに焦点を当てています(例:見出し、リスト、テーブル、リンクなど) 出力は合理的に提示可能で人間に優しいが、テキスト分析ツールによって消費されることを意味し、人間の消費のための高忠実度文書変換のための最良の選択肢ではないかもしれません。
MarkItDown は現在、次の変換をサポートしています。
- PDFファイル
- パワーポイント
- 言葉
- エクセル
- 画像(EXIFメタデータとOCR)
- 音声(EXIFメタデータと音声変換)
- HTML
- テキストベースのフォーマット(CSV、JSON、XML)
- ZIPファイル(コンテンツを上回る)
- YouTubeのURL
- EPubs
-...もっと!
なぜマークダウン?
マークダウンは、最小限のマークアップまたはフォーマットで、テキストを平らに非常に近いが、まだ
重要な文書構造を表す方法を提供します。 主流 LLM のような、
OpenAI の GPT-4o, ネイティブ " speak " マークダウン, マークダウンを組み込むことが多い
応答は不通しました。 これは、彼らが膨大な量で訓練されていることを示唆しています
マークダウン形式のテキスト、よく理解します。 副作用として, マークダウン条約
トークン効率が高い。
前提条件
MarkItDown は Python 3.10 以上が必要です。 依存関係の競合を避けるために仮想環境を使用することをお勧めします。
標準の Python インストールでは、次のコマンドを使用して仮想環境を作成および活性化できます。
`uv` を使うと、仮想環境を以下のように作成できます。
Anacondaを使用している場合は、以下の仮想環境を作成できます。
インストール
MarkItDown をインストールするには、 pip: `pip install 'markitdown[all]'` を使用します。 代わりに、ソースからインストールできます。
使用方法
コマンドライン
出力ファイルを指定するには `-o` を使用します。
また、パイプコンテンツ:
オプションの依存関係
MarkItDownには、さまざまなファイル形式を有効にするためのオプションの依存性があります。 このドキュメントでは、`[all]`オプションですべてのオプションの依存関係をインストールします。 しかし、複数の制御のために個別にインストールすることもできます。 例えば:
PDF、DOCX、およびPPTXファイルに対する依存関係のみをインストールします。
現時点では、次のオプションの依存関係が利用可能です。
* `[all]` 任意の依存関係をすべてインストールする
* `[pptx]` PowerPointファイルに対する依存関係をインストールします
* `[docx]` Wordファイルへの依存性をインストールする
* `[xlsx]` Excelファイルに対する依存性をインストールする
* `[xls]` 古いExcelファイルに対する依存性をインストールする
* `[pdf]` PDFファイルへの依存関係のインストール
* `[見通し]` Outlook メッセージの依存関係をインストールする
* `[az-doc-intel]` Azure文書インテリジェンスの依存性をインストールする
* `[az-content-understanding]` Azureコンテンツの理解のための依存性をインストールする
* `[audio-transcription]` wav と mp3 ファイルの音声変換の依存関係をインストールする
* '[youtube-transcription]` YouTube動画のトランスクリプションを取得するための依存性をインストール
プラグイン
MarkItDown はサードパーティのプラグインもサポートしています。 デフォルトではプラグインは無効になっています。 インストールされたプラグインをリストするには:
プラグインの使用を有効にするには:
利用可能なプラグインを見つけるには、ハッシュタグ `#markitdown-plugin` の GitHub を検索します。 プラグインを開発するには、`packages/markitdown-sample-plugin` を参照してください。
markitdown-ocr プラグイン
`markitdown-ocr` プラグインは PDF、DOCX、PPTX、XLSX コンバーターへの OCR サポートを追加し、LLM Vision を使用して埋め込まれた画像からテキストを抽出します。同じ `llm client`/`llm model` パターンは、MarkItDown は既に画像の説明に使用されます。 必要な新しいMLライブラリやバイナリ依存関係はありません。
**インストール:**
**使用法:**
同じ `llm client` と `llm model` を渡します。
`llm client` がプラグインがまだロードされていない場合、OCR はサイレントにスキップされ、標準の組み込みコンバーターは代わりに使用されます。
詳細は `packages/markitdown-ocr/README.md` を参照してください。
Azureコンテンツの理解
Azure コンテンツの理解により、構造化されたフィールド抽出(YAML フロントの問題)により、高品質の変換を実現します