vllm 为 LLaMA 添加两个 BOS
作者: wenquanlu创建于 2025年8月6日更新于 2025年8月6日
- 复制
在与grpo trainer.py和LLaMA-3.2-3B-Instruct合作时,我注意到,与香草变压器推论相比,使用vllm的奖励显著下降。 我做了深入的调查 发现Vllm在一代人的时间里 预留了额外的宝斯代币 如下所示
[Python] 带有剖析 context(自, “vLLM. generate” ): all outputs=自. LLM.generate(所有 promts text,采样 params=采样 params,使用 tqdm=false) print ("vllm sorders id"), 全部输出 [0]. prompt token ids )
输出( 我使用 GRPO vllm 拼接模式 ):
vllm sir id [128000,128000,128006,9125,128007,271,38766,1303,33025,2696,25,6790,220,2366,18,198,15724,2696,25,220,2705,5033,220,2366,20,271,2675,527,5,527,264,11190,1559(2004)2,22603,430,430,5825,1664,5621,1525,291,3,11944,14847,13,1472,1176,1781,2792,279,4,429,429,459,459,459,5419,1647,7,3239,323,3293,1239,5269,529,429,429,269,269,269,269,269,269,269,269,269,269,269,269,6,6,269,269,6,269, . . . . . . . .
你可以看到有两个128000 在开始。 我想这个问题在这里已经提到 https://GitHub.com/vllm-project/vllm/issues/9519。
但似乎没什么问题
QQ 系统信息
倾角:0.1.8.
ZZ: 3.11.13.
变压器: 4.52.3
vllm:0.8.5. 后台1内容来源: huggingface/open-r1