【开源自荐】mm-asset-rag:让文档、表格和图片一起被准确检索
Author: lgy1027Created Sep 15, 2026Updated Sep 15, 2026
mm-asset-rag 是一个面向真实资料库场景设计的多模态知识库检索引擎。
它不仅能检索纯文本,还能理解文档中的表格、截图、流程图和图片,让混合类型的资料可以在同一个知识库中统一搜索。
项目亮点
- 文本和图片统一检索:支持文本搜文本、文本搜图片、以图搜图和文本/图片混合检索。
- 面向复杂文档:支持 PDF、Word、PPT、Excel、Markdown、CSV、TSV、XLSX 和图片;自动提取 PDF、PPT 等文档中的嵌入图片。
- 多路检索融合:结合 Dense Embedding、BM25 与中文分词检索,并用 RRF 融合,兼顾语义匹配和关键词精确匹配。
- 回答有依据:返回答案时附带来源编号和证据摘要;按文档聚合结果,避免同一文档多个切块重复占位;证据不足或低置信度时自动拒答。
- 可直接落地:提供 FastAPI API、CLI 和 Web 测试工作台;支持拖拽上传、解析任务、检索调试,以及 collection、metadata、ACL 过滤。
- 模型接口灵活:LLM、VLM、Embedding 均支持 OpenAI 兼容接口;支持 Qdrant 本地模式与服务端模式。
- 自带评测能力:支持命中率、召回率、MRR,以及回答质量、证据充分性和拒答效果评估。
适用场景
- 企业内部文档和产品资料库
- 技术文档、论文和课件检索
- 包含表格、截图和流程图的项目资料
- 需要“答案 + 来源证据”的 RAG 应用
- 同时包含文字和图片的个人知识库
快速体验
pip install "mm-asset-rag[clip]"
mmrag-api
启动后访问:
http://127.0.0.1:8011/
项目地址:
https://github.com/lgy1027/mm-asset-rag
欢迎试用、Star 和反馈实际使用中的问题。
Source: GitHubDaily/GitHubDaily