DC娱乐网

我部署了qwen 3.8 27B,在pg500-216上跑的(v100s pci

我部署了qwen 3.8 27B,在pg500-216上跑的(v100s pcie oem版)。速度不是很理想,输出大约30 tok/s。如果开mtp,可以达到40+。但也就这样了。

好像llama.cpp现在支持response api了,可以配置codex搭配它使用。

qwen 3.8 27b, 缺点就是慢。因为它是dense模型,每token都要把完整权重扫一遍,所以会遇到内存墙。速度3090/4090系列,速度都在20-40左右,高不到哪里去,使用体验比较差。

不过,qwen 3.8 27b,跑分还是可以的。live code bench v6,达到90+,跟opus老版本一个水平。live code bench题库是更新的,所以刷题可能性较小(但也未必不能刷,毕竟qwen3.8刚出来,live code bench v6出来有一段时间了)。但是,开源模型一般不会刷,因为别人可以等live code bench v7出来再测,如果分数暴跌,那就丢人了。

live code bench高分,说明不了太多问题,因为这个是小规模编程题,不能体现大规模架构能力。

现在llama.cpp已经支持response api了。我把它接入codex,居然真的能用。然后,加载了多模态,拖了一张图片,居然真的能识图,神奇。后来我又拖了个视频进去,结果codex要给我安装抽帧工具,想抽取关键帧看。