工具介绍
下标
[有价值]
> MarkItDown 以当前进程的特权执行 I/O 。 和open()或request.get()一样,它将访问进程本身可以访问的资源. 在不可信的环境中对您的投入进行无害化,并称您使用时所需的最窄的“转换”功能(如“转换”或“转换”)。 更多信息见文件的安全考虑部分。
MarkItDown是一个轻量级的Python工具,用于将各种文件转换为Markdown,与LLMs和相关文本分析管道一起使用. 为此,它与文本内容最相类似,但侧重于保留重要的文档结构和内容为Markdown(包括标题,列表,表格,链接等). 虽然产出往往可以合理呈现和方便人,但意在被文本分析工具所消耗 -- -- 可能不是用于人类消费的高可靠性文件转换的最佳选择。
MarkItDown 目前支持从 :
- PDF 软件
- 电源点
- 说
- 埃克塞尔
- 图像(EXIF元数据和OCR)
- 音频(EXIF元数据和语音记录)
- HTML 语句
- 基于文本的格式(CSV、JSON、XML)
- ZIP文件(超过内容的输入)
- YouTube URLs (中文(简体) ).
- EPUBs (英语)
- 还有更多!
为什么是Markdown?
Markdown极接近纯文本, 最小的标记或格式化, 但是仍然
提供了一种代表重要文件结构的方法。 主流有限责任公司,例如
OpenAI的GPT-4o,原产地为" speak " Markdown,并经常将Markdown纳入他们的作品中.
反应不迅速。 这意味着,他们接受了大量培训。
标出格式的文字,并清楚明白. 作为附带利益,Markdown公约
也具有很高的象征性效率。
先决条件
MarkItDown要求Python 3.10或更高. 建议利用虚拟环境来避免依赖性冲突。
通过标准Python安装,可以使用以下命令创建并激活虚拟环境:
如果使用 “ uv” , 您可以创建虚拟环境 :
如果您正在使用Anaconda, 您可以创建虚拟环境 :
安装
要安装 MarkItDown,请使用 pip : “ pip 安装 markitdown[all] ” 。 或者,你可以从源头安装:
使用量
命令行
或使用 "-o " 指定输出文件:
您也可以管道内容 :
可选的依赖关系
MarkItDown 具有激活各种文件格式的可选依赖性 。 在本文件中的早些时候,我们安装了所有带有`[所有]”选项的可选依赖。 不过,也可以单独安装,以进行更多的控制. 例如:
将只安装 PDF 、 DOCX 和 PPTX 文件的依赖性 。
目前,有以下可选的依附关系:
* `[所有] ' 安装所有可选的依赖性
* `[pptx]' 安装PowerPoint文件的依赖性
* `[docx]' 安装 Word 文件的依赖性
* `[xlsx]' 安装 Excel 文件的依赖性
* “[xls]” 安装旧 Excel 文件的依赖性
* “[pdf]” 安装 PDF 文件的依赖性
* `[外 看' 安装 Outlook 信件的依赖性
* `[az-doc-intel] ' 安装 Azure 文件智能的依赖性
* `[内容理解]' 安装 Azure 内容理解的依赖性
* `[音频-调 ' 安装 wav 和 mp3 文件音频复制的依赖性
* `[youtube-transcription]' 。 安装获取 YouTube 视频复制的依赖性
插件
MarkItDown还支持了第3党的插件. 插件默认被禁用 。 要列出已安装插件 :
要启用插件使用 :
要找到可用的插件, 请搜索 GitHub 的标签 。 要开发一个插件,请参见“包装/标记下-样品-插件”。
标记下- ocr 插件
“ markitdown- ocr” 插件在 PDF、 DOCX、 PPTX 和 XLSX 转换器中添加了 OCR 支持, 使用 LLM Vision 提取嵌入式图像的文本—— 和 MarkItDown 已经用于图像描述的“ llm client” / “ llm model” 模式相同 。 不需要新的 ML 库或二进制依赖 。
** 安装:**
** 用户:**
传出同样的“llm client”和“llm model”用于图像描述:
如果未提供“ llm client” , 插件仍然装入, 但OCR 被悄悄跳过, 而使用标准的内置转换器 。
详细文件见`packages/markitdown-ocr/README.md'。
Azure 内容理解
Azure Content Conference 以结构化的字段提取(YAML前置物)提供更高质量的转换