#114·nano-vllm

[BUG] 当提示长度与 kvcache_block_size 相等时发生崩溃

作者: a710128创建于 2025年10月13日更新于 2026年4月13日
zz
提示 = [
"哈罗" *248,
* 513项

我用上面的提示跑出`例.py',它坠毁。

[排名0]:火炬. 加速器 Error: CUDA 错误:配置参数无效
[rank0]:CUDA内核出错可能是在其他API呼叫时同步报告的,所以下面的堆栈可能不正确.
[排名0]: 对于调试考虑通过 CUDA LAUNCH BLOCKING=1
[排名0]:用`TORCH USE CUDA DSA'来编译,以便允许设备方面的断言。

似乎由前缀缓存所引起,导致模型输入的收发长度为0.

内容来源: GeeeekExplorer/nano-vllm