在 pretrain 阶段,处理 wudao 语料后,使用 2000 进行切割,随后再切割为 500。在 get_input_data.py 中构建 pretrain 的 source_tokens 和 target_tokens。这两个是否跨越多个文档?
作者: zhangyipin创建于 2023年2月14日更新于 2024年4月25日
你好,有个问题想请教一下。在 pretrain 阶段,处理 wudao 语料后,先切割为 2000,然后再切割为 500。在 get_input_data.py 中构建 pretrain 的 source_tokens 和 target_tokens。这两个是否会跨越多个文档?
内容来源: zai-org/GLM-130B