百亿参数的中英文双语基座大模型
CPM-Bee是一个完全开源、允许商用的百亿参数中英文基座模型,也是CPM-Live训练的第二个里程碑。它采用Transformer自回归架构(auto-regressive),在超万亿(trillion)高质量语料上进行预训练,拥有强大的基础能力。开发者和研究者可以在CPM-Bee基座模型的基础上在各类场景进行适配来以创建特定领域的应用模型。
** 开源可商用**:OpenBMB始终秉承“让大模型飞入千家万户”的开源精神,CPM-Bee基座模型将完全开源并且可商用,以推动大模型领域的发展。我们鼓励全球范围内的科研机构、企业和个人开发者在遵守开源许可协议的前提下,自由地在CPM-Bee基座模型上进行创新。
** 中英双语性能优异**:CPM-Bee基座模型在预训练语料上进行了严格的筛选和配比,同时在中英双语上具有亮眼表现,具体可参见评测任务和结果。
** 超大规模高质量语料**:CPM-Bee基座模型在超万亿语料进行训练,是开源社区内经过语料最多的模型之一。同时,我们对预训练语料进行了严格的筛选、清洗和后处理以确保质量。
** OpenBMB大模型系统生态支持**:OpenBMB大模型系统围绕高性能预训练、适配、压缩、推理开发了一系列工具,CPM-Bee基座模型将配套所有的工具脚本,高效支持开发者进行进阶使用。
** 对话和工具使用能力**: 结合OpenBMB在指令微调和工具学习的探索,我们在CPM-Bee基座模型的基础上进行微调,训练出了具有强大对话和工具使用能力的实例模型,API和内测将于近期开放。
Read this in English.
说明:CPM-Bee是一个基座模型,即从零开始通过预训练得来。我们鼓励用户在自己的场景和数据上适配/微调/对齐后再进行使用。例如,WebCPM 以CPM-Bee为基座,在人类网络检索的序列化数据上进行适配,获得了复杂问答和上网检索的能力。后续我们将会发布更多在CPM-Bee基座模型基础上适配的模型。
您需要克隆该仓库:
$ git clone -b main --single-branch https://github.com/OpenBMB/CPM-Bee.git
并确保您的环境符合要求:
- python>=3.7
- torch>=1.10,<2.0.0
我们建议使用Anaconda管理环境并从PyPI安装其他依赖项:
$ cd src
$ pip install -r requirements.txt
注意torch版本需与CUDA版本对应,不然会引起安装错误,尤其是torch也是通过pip install -r requirements.txt进行安装时,较为容易出现自动拉取安装的torch版本与本地CUDA版本不对应,导致BMTrain无法安装。
…
{
"input": "北京是中国的首都",
"prompt": "中翻英",
"<ans>": "Beijing is the capital of China"
}
{
"input": "父母都希望自己的孩子诚实、勇敢、有礼貌。要想让孩子成为这样的人,父母首先得从自己做起,要是连自己都做不到,又怎能要求孩子做到呢?",
"options": {
"<option_0>": "少提要求",
"<option_1>": "降低标准",
"<option_2>": "自己先做好",
"<option_3>": "让孩子拿主意"
},
"question": "教育孩子时,父母应该:",
"<ans>": "<option_2>"
}
{
"question": "下面哪项是正确的",
"options": {
"<option_0>": "1 << 2",
"<option_1>": "10 << 8",
},
"<ans>": "<option_0>"
}
数据清洗
...
...
How can cross training benefit groups like runners, swimmers, or weightlifters?\n\n1. Reduces the risk of injury...\n\n2. Improves overall fitness...
Are there any particular physical benefits to mindful walking, such as improved posture or increased physical fitness?\n\n1. Choose a quiet and peaceful environment...\n\n2. Start by tuning into your breath and becoming aware of your surroundings...
...
...
...
...
{"template": "Does the answer correctly answer the question", "sentence": "Unicode has the explicit aim of transcending ...", "question": "What is the aim of Unicode?", "options": {"<option_0>": "no", "<option_1>": "yes"}, "<ans>": "<option_1>"}
...
...
CPMBee/
├── src
| └── ...
└── raw_data(原始数据位置)
├── wiki
| └── raw.txt(txt原始数据)
└── flan
└── raw.json(json原始数据)
数据集生成
$ cd CPMBee/src
$ python build_dataset.py --input-path ../raw_data/wiki/ --output-path ../datasets/wiki/ --output-name wiki --data-type txt --min-length 100 --max-length 10000
$ python build_dataset.py --input-path ../raw_data/flan/ --output-path ../datasets/flan/ --output-name flan --data-type json
CPMBee/
├── src
| ├── ...
| └── build_dataset.py
├── raw_data
| ├── wiki
| | └── raw.txt
| └── flan
| └── raw.json
└── datasets(生成的数据集)
├── wiki(wiki对应的数据集)
| └── data
| ├── wiki
| └── meta.bin
└── flan(flan对应的数据集)
└── data
├── flan
└── meta.bin
任务转换脚本
import random
def transform(data, num_sample: int, r: random.Random):
...
import random
def rand(n: int, r: random.Random):
return int(r.random() * n)
def transform(data, num_sample: int, r: random.Random):
# 按照之前的步骤,wiki中的数据都为{'text':'...'}形式
text = data['text']
# 随机遮蔽50%~100%的内容进行预测
mid = rand(len(text) // 2, r)
# CPMBee需要<来识别特殊键,所以需要将内容中的<转换为<<进行转义
ipt = text[:mid].replace("<", "<<")
ans = text[mid:].replace("<", "<<")
return {"input": ipt,
"<ans>": ans}
import random
def transform(data, num_sample: int, r: random.Random):
# 按照之前的步骤,flan中的数据已经是选择题的json格式了,且包含<ans>键,所以直接返回进行训练
return data
CPMBee/
├── src
| ├── ...
| └── build_dataset.py
├── raw_data
| ├── wiki
| | └── raw.txt
| |
| └── flan
| └── raw.json
└── datasets
├── wiki
| ├── data
| | ├── wiki
| | └── meta.bin
| └── transform.py(wiki对应的任务转换脚本)
└── flan
├── data
| ├── flan
| └── meta.bin
└── transform.py(flan对应的任务转换脚本)
数据集脚本
[
{
"dataset_name": "wiki",
"task_name": "lm",
"weight": 1.0,
"path": "wiki/data",
"incontext_weight": [1.0],
"transforms": "wiki/transform.py"
},
{
"dataset_name": "flan",
"task_name": "nlu",
"weight": 1.0,
"path": "flan/data",
"incontext_weight": [1.0],
"transforms": "flan/transform.py"
}
]
CPMBee/
├── src
| ├── ...
| └── build_dataset.py
├── raw_data
| ├── wiki
| | └── raw.txt
| └── flan
| └── raw.json
└── datasets
├── datasets.json(数据集脚本)
├── wiki
| ├── data
| | ├── wiki
| | └── meta.bin
| └── transform.py
└── flan
├── data
| ├── flan
| └── meta.bin
└── transform.py
预训练脚本
…
- **案例**:写完预训练脚本后的文件路径结构
-
…
cd CPMBee/src
bash scripts/pretrain_cpm_bee.sh
…
基于OpenBMB的大模型系统生态,我们在训练CPM-Bee的过程中实现了全流程高效。同时提供了模型微调(基于BMTrain和OpenDelta)、工具使用(基于BMTools)、模型压缩(基于BMCook)、低资源推理(基于BMInf)的全套脚本,可以协助开发者快速上手和使用CPM-Bee。
基于BMTrain和OpenDelta,我们给出了两种微调方案:全参数微调和参数高效的增量微调,可以将CPM-Bee适配到各类下游场景中。
$ torchrun --nnodes=1 --nproc_per_node=4 --rdzv_id=1 --rdzv_backend=c10d --rdzv_endpoint=localhost:12345 finetune_cpm_bee.py
$ torchrun --nnodes=1 --nproc_per_node=4 --rdzv_id=1 --rdzv_backend=c10d --rdzv_endpoint=localhost:12345 finetune_cpm_bee.py \
--use-delta \
微调流程
要在特定任务上微调模型,您应该准备数据集并按如下方式执行:
<...>作为特殊token的标记,可能与文本中的<混淆,所以您应当对文本数据中的非特殊token的部分,做转义处理。例如,我们有如下数据{"input": "团队配合非常重要,如果不能做到<mask_0>,则可能会造成1+1<2的结果,所以,要更加注意<mask_1>", "<ans>": {"<mask_0>": "", "<mask_1>": ""}}
该数据中,<mask_0>与<mask_1>是特殊token,应保持不变,其余<均替换为<<,转义处理后的数据如下:{"input": "团队配合非常重要,如果不能做到<mask_0>,则可能会造成1+1<<2的结果,所以,要更加注意<mask_1>", "<ans>": {"<mask_0>": "", "<mask_1>": ""}}
$ python preprocess_dataset.py --input your/reformated/data/path --output_path your/binary/data/path --output_name data_name
预处理后,您将获得:
|-- your/binary/data/path
|-- folder1
| |-- data_name
| |-- meta.bin
|-- folder2
|-- data_name
|-- meta.bin
$ bash scripts/finetune_cpm_bee.sh
或者您可以直接通过torchrun运行finetune_cpm_bee.py。例如,您可以在具有4块GPU的服务器上对CPM-Bee进行增量微调,如下所示:
torchrun --nnodes=1 --nproc_per_node=4 --rdzv_id=1 --rdzv_backend=c10d --rdzv_endpoint=localhost:12345 finetune_cpm_bee.py \
--
No open issues yet, or sync has not completed.