[Feature]We need a more powerful Markdown document chunking feature for handling complex scientific papers

Author: Naraku215Created Jun 29, 2026Updated Jul 7, 2026
Labelsenhancement

Markdown 结构分块存在表格 / 公式被切断、标题上下文丢失、句子分割误判等多处缺陷

桌面设备

  • 操作系统:Windows
  • 浏览器:谷歌浏览器(Chrome)
  • Easy Dataset 版本:最新版 使用模型
  • 模型提供商:deepseek
  • 模型名称:例如 DeepSeek V4-pro

复现步骤

  1. 进入文件处理页面。
  2. 上传 markdown 文档并且进行智能分块(选择 markdown 结构分块)。
  3. 在智能分割的 box 里查看分块。 可以看到如下情况:
  • 表格被任意拆分 — 逐页翻看可见,无表格检测,表格被 \n\n 分段切断
  • LaTeX 公式被破坏 — 无 $...$ / $$...$$ 检测,句子分割正则在公式中的 . 处错误截断
  • 可能产生空块 — 污染后续工作流
  • 标题上下文丢失 — 长段被拆分后,Part 2+ 没有标题,变成"孤儿块"
  • 累积逻辑缺陷 — 小段落被"卡住",末尾残余可能低于设置的最短分割大小 minLength
  • 句子分割过于简单 — 正则 /[^.!?。!?]+[.!?。!?]+/g 在小数、缩写、代码中误断

预期结果 对于各个专业垂直领域的文献,特别是结构和构成元素复杂的文献(包含多个特殊符号、表格、各种公式块,甚至代码块),能够得到最好的分割效果,并且有多维度、合理的评分体系对每个分块做出质量评分,能快速导航到所有文本块中分割效果最差/短/长的块,方便自主优化,且支持:

  • 自定义编辑/删除分块内容
  • 向相邻分块合并
  • 自主拆分块
  • 重评分与重新统计 -再根据重评分与统计导航低分/过长/过短分块循环优化,最终使得每一个分块长短适宜、标题上下文清晰、语义完整,表格、公式、列表等不被切断,得到适合于 RAG 或者微调数据集构建的高质量的文本分块。

截图

其他相关信息 对于用于生成数据集的文本块来说,其最终被喂给大模型时的质量非常重要,而现在的几个分块模块还是过于粗糙,自定义分块模式功能也比较单一,且操作中易卡顿,针对上述问题,我已在原项目分割方案——文档结构分块(Markdown)的基础上开发了新模块解决并且提交 PR。