RWKV-6 部署显存与速度实测
本页记录的是 RWKV-6 1.6B、3B、7B、14B 在固定设备与旧版推理后端上的实测结果,用于理解模型规模和量化对资源占用的影响。它不是当前 RWKV-7 G1x 模型的显存承诺,也不应直接外推到其他显卡或后端版本。
量化通常可以降低显存或内存占用,但对生成质量的影响会随模型、量化算法和后端而变化。选择模型时,应先在同一个模型与任务上比较 FP16、INT8、NF4 或 GGUF 量化,不要把某次测试结论当作所有模型的固定排序。
当前 RWKV-7 G1x 常见规模为 0.1B、0.4B、1.5B、2.9B、7.2B、13.3B;由于尚无与下表相同设备、相同后端和相同参数设置下的完整实测,本页暂不拼接估算值。当前模型可以从 RWKV7-Gxx-GGUF 合集查看。
RWKV-6 实测数据
以下是不同推理后端和对应量化方式(默认量化所有层)的显存/内存需求:
测试环境:
- CPU :i7-10870H
- GPU: RTX 3080 Laptop ,16G 显存
- 内存:32G
| 推理后端 | 1B6 模型 | 3B 模型 | 7B 模型 | 14B 模型 |
|---|---|---|---|---|
| CPU-FP32 | 6.6G内存 | 12G内存 | 21G内存 | OOM(不建议使用) |
| rwkv.cpp-FP16 | 3.5G内存 | 7.6G内存 | 15.7G内存 | 30G(内存) |
| rwkv.cpp-Q5_1 | 2G内存 | 3.7G内存 | 7.2G内存 | 12.4G(内存) |
| CUDA-FP16 | 3.2G显存 | 6.2G显存 | 14.3G显存 | 约28.5G显存 |
| CUDA-INT8 | 1.9G显存 | 3.4G显存 | 7.7G显存 | 15G显存 |
| webgpu-FP16 | 3.2G显存 | 6.5G显存 | 14.4G显存 | 约29G显存 |
| webgpu-INT8 | 2G显存 | 4.4G显存 | 8.2G显存 | 16G显存(量化41层,60层约14.8G) |
| webgpu-NF4 | 1.3G显存 | 2.6G显存 | 5.2G显存 | 15.1G显存(量化41层,60层约10.4G) |
| webgpu(python)-FP16 | 3G显存 | 6.3G显存 | 14G显存 | 约28G显存 |
| webgpu(python)-INT8 | 1.9G显存 | 4.2G显存 | 7.7G显存 | 15G显存(量化41层) |
| webgpu(python)-NF4 | 1.2G显存 | 2.5G显存 | 4.8G显存 | 14.3G显存(量化41层) |
不同推理后端/量化(默认量化所有层)的生成速度,单位为 TPS(tokens per second,每秒生成的 token 数)。token 与汉字或单词不是一一对应关系。
| 推理后端 | 1B6 模型 | 3B 模型 | 7B 模型 | 14B 模型 |
|---|---|---|---|---|
| CPU-FP32 | 4.36 | 2.3 | 极慢 | OOM(不建议使用) |
| rwkv.cpp-FP16 | 8.6 | 4.5 | 2 | 1 |
| rwkv.cpp-Q5_1 | 14 | 8 | 3.7 | 2.1 |
| CUDA-FP16 | 25 | 18 | 15 | |
| CUDA-INT8 | 22 | 16 | 18 | 7.4 |
| webgpu-FP16 | 45 | 38 | 21 | OOM,无法测试 |
| webgpu-INT8 | 60 | 44 | 30 | 18 |
| webgpu-NF4 | 60 | 47 | 34 | 20 |
| webgpu(python)-FP16 | 40 | 29 | 17 | OOM,无法测试 |
| webgpu(python)-INT8 | 45 | 35 | 23 | 15 |
| webgpu(python)-NF4 | 43 | 32 | 21 | 18 |
表格中的推理后端来自不同的推理工具:
- CUDA、CPU 来自 RWKV 官方 pip 包
- rwkv.cpp 来自 rwkv.cpp 项目
- webgpu 来自 web-rwkv 项目,一个基于 webgpu 的 Rust 推理框架
- webgpu(python) 来自 web-rwkv-py,web-rwkv 项目的 Python 版本
以上参数仅作为 RWKV 端侧推理的入门性能参考,随着量化层数等配置项的变化和显卡架构的新旧程度,模型的性能表现可能会改变。
这份文档对您有帮助吗?