在pretrain阶段,处理wudao语料后,用2000切割,后续又切割为500。 在get_input_data.py中构建pretrain的source_tokens、target_tokens。这两个会跨越多个 document 吗

Author: zhangyipinCreated Feb 14, 2023Updated Apr 25, 2024

你好,请教个问题。 在pretrain阶段,处理wudao语料后,用2000切割,后续又切割为500。 在get_input_data.py中构建pretrain的source_tokens、target_tokens。这两个会跨越多个 document 吗