提取包含 HTML 表格的文档时出现的碎片化问题

作者: anranshens创建于 2026年1月8日更新于 2026年9月7日

使用 langextract 提取包含 HTML 表格的文档信息时,假设我的表格内容非常长,那么分块逻辑是否会切割表格,导致后续分块缺少表格标题,阻碍 LLM 理解,最终导致提取结果数据丢失?对此问题有更好的解决方案吗?

内容来源: google/langextract