我使用你们提供的 Llama3 中文版本推理速度非常慢

作者: fujingnan创建于 2024年9月24日更新于 2024年9月24日

火炬:2.1.2 闪光点:2.5.6 显卡A6000 48G QQ:QQ快起动. py:

导入火炬
从变压器导入自动调试器, AutoModelForCausalLM

设备 映射 = “ cuda: 0 ” 如果火炬.cuda.is  可用() 其它“ 自动”
型号 = AutoModelForCausalLM. from pretrain ('./pretrain'),设备 map=device map,火炬 dtype=torch.float16,
载入 in 8bit= True, 信任 remote code= True, 使用 flash attention 2= True)
型号=型号. eval()
参数化器 = AutoTokenizer. from  pretrained ('./pretrain', use fast=False) 自动调试器 。
orderizer.pad token = orderizer.eos token (中文(简体) ).
此时为 True :
文本 = 输入 ("QQ:")
提示 = f'<s> Human: {text}\n</s><s> 助理 : '. 替换 (''',')
输入 ids = 符号化器([trompt], return tenss="pt"),添加  special tokens=False. 输入( ID)
如果火炬.cuda.is 可用():
输入 ids = 输入 ids.to('cuda')
生成 输入={
"输入 ids":输入 ids,
"max new tokens": 512, (中文(简体) ).
"道":"实相".
"top k": 50, (英语).
"top p":0.95 (中文(简体) ).
""温":0.3,"".
"重犯 刑罚": 1.3,
"eos token id":活化剂.eos token-id,
"bos token id":活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活活
"纸上"(pad token id):指代器.pad token id
{\fn黑体\fs22\bord1\shad0\3aHBE\4aH00\fscx67\fscy66\2cHFFFFFF\3cH808080}你觉得呢?
生成  ids = model.generate (** generate  输入)
文本 = 表示器.decode(生成 ids[0])
打印(文本)

{\fn黑体\fs22\bord1\shad0\3aHBE\4aH00\fscx67\fscy66\2cHFFFFFF\3cH808080}什么? {\fn黑体\fs22\bord1\shad0\3aHBE\4aH00\fscx67\fscy66\2cHFFFFFF\3cH808080}什么

内容来源: LlamaChinese/Llama-Chinese