[Feature]We need a more powerful Markdown document chunking feature for handling complex scientific papers
Author: Naraku215Created Jun 29, 2026Updated Jul 7, 2026
Labelsenhancement
Markdown 结构分块存在表格 / 公式被切断、标题上下文丢失、句子分割误判等多处缺陷
桌面设备
- 操作系统:Windows
- 浏览器:谷歌浏览器(Chrome)
- Easy Dataset 版本:最新版 使用模型
- 模型提供商:deepseek
- 模型名称:例如 DeepSeek V4-pro
复现步骤
- 进入文件处理页面。
- 上传 markdown 文档并且进行智能分块(选择 markdown 结构分块)。
- 在智能分割的 box 里查看分块。 可以看到如下情况:
- 表格被任意拆分 — 逐页翻看可见,无表格检测,表格被 \n\n 分段切断
- LaTeX 公式被破坏 — 无 $...$ / $$...$$ 检测,句子分割正则在公式中的 . 处错误截断
- 可能产生空块 — 污染后续工作流
- 标题上下文丢失 — 长段被拆分后,Part 2+ 没有标题,变成"孤儿块"
- 累积逻辑缺陷 — 小段落被"卡住",末尾残余可能低于设置的最短分割大小 minLength
- 句子分割过于简单 — 正则 /[^.!?。!?]+[.!?。!?]+/g 在小数、缩写、代码中误断
预期结果 对于各个专业垂直领域的文献,特别是结构和构成元素复杂的文献(包含多个特殊符号、表格、各种公式块,甚至代码块),能够得到最好的分割效果,并且有多维度、合理的评分体系对每个分块做出质量评分,能快速导航到所有文本块中分割效果最差/短/长的块,方便自主优化,且支持:
- 自定义编辑/删除分块内容
- 向相邻分块合并
- 自主拆分块
- 重评分与重新统计 -再根据重评分与统计导航低分/过长/过短分块循环优化,最终使得每一个分块长短适宜、标题上下文清晰、语义完整,表格、公式、列表等不被切断,得到适合于 RAG 或者微调数据集构建的高质量的文本分块。
截图 无
其他相关信息 对于用于生成数据集的文本块来说,其最终被喂给大模型时的质量非常重要,而现在的几个分块模块还是过于粗糙,自定义分块模式功能也比较单一,且操作中易卡顿,针对上述问题,我已在原项目分割方案——文档结构分块(Markdown)的基础上开发了新模块解决并且提交 PR。
Source: ConardLi/easy-dataset