【开源自荐】mm-asset-rag:让文档、表格和图片一起被准确检索

Author: lgy1027Created Sep 15, 2026Updated Sep 15, 2026

mm-asset-rag 是一个面向真实资料库场景设计的多模态知识库检索引擎。

它不仅能检索纯文本,还能理解文档中的表格、截图、流程图和图片,让混合类型的资料可以在同一个知识库中统一搜索。

项目亮点

  • 文本和图片统一检索:支持文本搜文本、文本搜图片、以图搜图和文本/图片混合检索。
  • 面向复杂文档:支持 PDF、Word、PPT、Excel、Markdown、CSV、TSV、XLSX 和图片;自动提取 PDF、PPT 等文档中的嵌入图片。
  • 多路检索融合:结合 Dense Embedding、BM25 与中文分词检索,并用 RRF 融合,兼顾语义匹配和关键词精确匹配。
  • 回答有依据:返回答案时附带来源编号和证据摘要;按文档聚合结果,避免同一文档多个切块重复占位;证据不足或低置信度时自动拒答。
  • 可直接落地:提供 FastAPI API、CLI 和 Web 测试工作台;支持拖拽上传、解析任务、检索调试,以及 collection、metadata、ACL 过滤。
  • 模型接口灵活:LLM、VLM、Embedding 均支持 OpenAI 兼容接口;支持 Qdrant 本地模式与服务端模式。
  • 自带评测能力:支持命中率、召回率、MRR,以及回答质量、证据充分性和拒答效果评估。

适用场景

  • 企业内部文档和产品资料库
  • 技术文档、论文和课件检索
  • 包含表格、截图和流程图的项目资料
  • 需要“答案 + 来源证据”的 RAG 应用
  • 同时包含文字和图片的个人知识库

快速体验

pip install "mm-asset-rag[clip]"
mmrag-api

启动后访问:

http://127.0.0.1:8011/

项目地址:

https://github.com/lgy1027/mm-asset-rag

欢迎试用、Star 和反馈实际使用中的问题。