RWKV-7 FP8 quantized inference - 6.4x decode speedup on Blackwell GPUs with <0.3% accuracy loss. Full FP8 E4M3 weight quantization with fused Triton kernels.
nvidia triton quantization model-quantization blackwell inference-acceleration weight-quantization low-bit-quantization llm fp8 rwkv rwkv7 kernel-optimization rtx-5070-ti e4m3
-
Updated
Aug 6, 2026 - Cuda