
将 Word、PowerPoint、Excel、OpenDocument、RTF、EPUB、CSV 和 PDF 转换为清晰的 Markdown。内置 R
将 Word、PowerPoint、Excel、OpenDocument、RTF、EPUB、CSV 和 PDF 转换为清晰的 Markdown。内置 R
anydoc Fast Rust 库可将文档(Word、PowerPoint、Excel、OpenDocument、RTF、EPUB、CSV 和 PDF)转换为清晰的 GitHub 格式的 Markdown。包括用于 Node.js、Python 和浏览器 (WebAssembly) 的绑定。由 Firecrawl 打造,可在单位毫秒内将任何办公文档转换为 LLM 格式的 Markdown,无论输入的格式是什么,输出都始终一致。它支持 Firecrawl Parse,因此如果您不想自己运行它,托管的 API 可为您提供相同的转换,以及任何doc 无法自行识别的扫描页面的 OCR 模型。在浏览器中尝试它:演示页面使用 WebAssembly 运行该库,因此文件在本地转换,永远不会离开您的机器。快速入门 代理技能 anydoc 以代理技能的形式提供,因此您的代理可以读取遇到的任何文档:bash npx skills add firecrawl/anydoc 该技能教会代理使用 anydoc CLI 转换文档。与 Claude Code、Codex、Cursor、OpenCode 和任何其他兼容代理一起使用。CLI bash npx @firecrawl/anydoc report.docx # Markdown 到 stdout npx @firecrawl/anydoc slides.pptx -o slides.md # 或写入文件 npx @firecrawl/anydoc - --format csv 全部 API 参考:node/README.md Python bash pip install firecrawl-anydoc Python import anydoc 从文件路径:markdown = anydoc.tomarkdown("report.docx") 要启用 OCR:markdown = anydoc.tomarkdown("report.docx", ocr="hosted") 从字节中,根据内容检测格式:markdown = anydoc.tomarkdownbytes(data) 或者指定格式,需要无签名格式(CSV):markdown = anydoc.tomarkdownbytes(data, "csv") 或者停留在文档模型上,其中还包含嵌入的资产:document = anydoc.todocument(data) 全部 API 参考:Python/README.md 浏览器 (WebAssembly) bash npm install @firecrawl/anydoc-WASM js import init, { toMarkdownBytes, toDocument } from '@firecrawl/anydoc-WASM'; await init(); // 从字节中,根据内容检测格式:const markdown = toMarkdownBytes(bytes); // 或者指定格式,需要无签名格式(CSV):const fromCsv = toMarkdownBytes(bytes, 'csv'); // 或者停留在文档模型上,其中还包含嵌入的资产:const document = toDocument(bytes); 全部 API 参…
anydoc-wasm still ships pdf-inspector 1.14.2 — the RTL extraction fix (pdf-inspector#440) isn't included
Multi-column tables collapse into unreadable single-column blobs during PDF conversion
Ligature characters (fi/fl/ffi) are dropped instead of expanded when extracting PDF text
OOXML: recoverable allocation failure in Package::part is classified as malformed