#52·anydoc

特性请求: 支持 HTML / MHTML 文件( 如 Jira 导出)

作者: thvroyal创建于 2026年8月7日更新于 2026年8月28日
标签enhancementP3

□ 问题

Jira作为独立的HTML文件导出,文件被“Content-Type:应用程序/vnd.ms-word”所包裹,经常被“.doc”扩展保存。 这些文件是平版 HTML 文档(不是 OLE2 复合 二进制),目前任何文件都以错误的形式拒绝它们:

错误的文档:不是 OLE2 复合文件: 无效 CFB 文件(错误的魔法编号): [3c, 21, 44, 4f, 43, 54, 59, 50]

魔法字节`3c 21 44 4f 43 54 59' = Q! DOCTYPE' - 这是一个有效的HTML文件.

□ 使用大小写

许多企业工具(Jira, Congress, SharePoint)作为HTML或MHTML(.mht',.mhtml')文件导出内容. 能够通过任何道克将这些材料转换成Markdown,对于从这些工具中取出出口的单据管道将很有价值。

□ 建议的解决办法

添加对独立 HTML 文件的支持作为输入格式. EPUB 解析器已经在内部处理 HTML,所以解析逻辑中的大部分可能可以再用.

至少,通过现有的 HTML 到模型管道的路由将覆盖 Jira 导出案例。 完整的 MHTML(多部分的MIME 有像图像这样的嵌入式资源)支持将是一种奖金.

□ 示例文件

[jira export ticket.doc] (https://GitHub.com/user-attachments/files/30816559/AI1SOLHPCHAT-98.doc) (中文(简体) )

内容来源: firecrawl/anydoc