RWKV

RWKV-6 部署显存与速度实测

本页记录的是 RWKV-6 1.6B、3B、7B、14B 在固定设备与旧版推理后端上的实测结果,用于理解模型规模和量化对资源占用的影响。它不是当前 RWKV-7 G1x 模型的显存承诺,也不应直接外推到其他显卡或后端版本。

量化通常可以降低显存或内存占用,但对生成质量的影响会随模型、量化算法和后端而变化。选择模型时,应先在同一个模型与任务上比较 FP16、INT8、NF4 或 GGUF 量化,不要把某次测试结论当作所有模型的固定排序。

当前 RWKV-7 G1x 常见规模为 0.1B、0.4B、1.5B、2.9B、7.2B、13.3B;由于尚无与下表相同设备、相同后端和相同参数设置下的完整实测,本页暂不拼接估算值。当前模型可以从 RWKV7-Gxx-GGUF 合集查看。

RWKV-6 实测数据

以下是不同推理后端和对应量化方式(默认量化所有层)的显存/内存需求:

测试环境:

  • CPU :i7-10870H
  • GPU: RTX 3080 Laptop ,16G 显存
  • 内存:32G
推理后端1B6 模型3B 模型7B 模型14B 模型
CPU-FP326.6G内存12G内存21G内存OOM(不建议使用)
rwkv.cpp-FP163.5G内存7.6G内存15.7G内存30G(内存)
rwkv.cpp-Q5_12G内存3.7G内存7.2G内存12.4G(内存)
CUDA-FP163.2G显存6.2G显存14.3G显存约28.5G显存
CUDA-INT81.9G显存3.4G显存7.7G显存15G显存
webgpu-FP163.2G显存6.5G显存14.4G显存约29G显存
webgpu-INT82G显存4.4G显存8.2G显存16G显存(量化41层,60层约14.8G)
webgpu-NF41.3G显存2.6G显存5.2G显存15.1G显存(量化41层,60层约10.4G)
webgpu(python)-FP163G显存6.3G显存14G显存约28G显存
webgpu(python)-INT81.9G显存4.2G显存7.7G显存15G显存(量化41层)
webgpu(python)-NF41.2G显存2.5G显存4.8G显存14.3G显存(量化41层)

不同推理后端/量化(默认量化所有层)的生成速度,单位为 TPS(tokens per second,每秒生成的 token 数)。token 与汉字或单词不是一一对应关系。

推理后端1B6 模型3B 模型7B 模型14B 模型
CPU-FP324.362.3极慢OOM(不建议使用)
rwkv.cpp-FP168.64.521
rwkv.cpp-Q5_11483.72.1
CUDA-FP16251815
CUDA-INT82216187.4
webgpu-FP16453821OOM,无法测试
webgpu-INT860443018
webgpu-NF460473420
webgpu(python)-FP16402917OOM,无法测试
webgpu(python)-INT845352315
webgpu(python)-NF443322118

表格中的推理后端来自不同的推理工具:

以上参数仅作为 RWKV 端侧推理的入门性能参考,随着量化层数等配置项的变化和显卡架构的新旧程度,模型的性能表现可能会改变。

这份文档对您有帮助吗?