DC娱乐网

llama.cpp也吃上了NVFP4的红利

我之前两张50系小显存卡用llama.cpp跑大模型一直有个很尴尬的地方,就是50系对FP4的提升完全吃不到。
如果切到vLLM这条路线又会损失大量上下文。明明llama.cpp这边可以跑256K,切换到vLLM这边不仅要折腾WSL2,上下文更是只剩64 t/s,还要忍受连llama.cpp都不如的速度,何苦呢。

但是现在社区提供了解决方案,就是把NVFP4+GGUF:用GGUF当容器,其中主要模型权重采用NVFP4表示。如果说Unsloth的UD-Q4量化“BF16 → UD-Q4”是一次量化 + 模型特化/敏感层保护,那么NVFP4版GGUF就是“BF16 → FP8 → NVFP4”,优势是NVFP4本身可能更准确,劣势是多经过一次量化,性能可能会有损失。

所以这个版本的优势也就很明显了,填充性能prefill大幅提升,p2中测的甚至能有+46%。这对于50系等NVFP4优化的卡在长上下文场景、长程任务上可能会有些许提升。目前测试下来和MTP、DFlash2兼容性也很友好。

缺点也挺明显的,就是精度仍然是个谜,需要大量测试。差不多体积的NVFP4打打老Q4应该是没问题的,但是跟Unsloth的UD Q4比就很难说了。还需要大量测试。同时并没有节省显存。整体上适合50系用户尝鲜。

最后补一段GPT-5.6 Sol的评价:NVFP4-GGUF 的核心优势,是“更先进的 4bit 表示 + GGUF 易用性 + Blackwell 硬件潜力”;核心风险,则是部分模型存在 FP8→NVFP4 的二次量化,以及为了全 NVFP4 而压掉原本刻意保留的高精度敏感层。像是一个特别适合 RTX 50 系、很有潜力,但仍需要实际质量 benchmark 验证的新路线。

#ai #大模型 #nvfp4 #qwen38_27b #llama #qwen #本地部署