DC娱乐网

AI Max 395 实测:125B 模型 60t/s

AMD 这颗 AI Max 395,很多人默认它只能跑跑小模型。我把 Qwen3.8-Flash-Next 这个 125B 参数的 MoE 塞进一体机,代码生成实测到了 60 token 一秒,256K 上下文也稳。折腾了两周,弯路没少走,写下来省得你重复踩。

先给结论:这玩意儿快不快,跟显存关系不大,看的是内存带宽,还有投机解码有没有开对。125B 看着吓人,实际每生成一个 token 只激活 6B 权重,82G 权重躺在那,每次只读一小截。CPU 和 GPU 共用 128G,带宽 273G/s,刚好喂饱这种架构。

我干过最蠢的一件事是乱调参。一开始觉得 KV 缓存用 f16 更"高级",投机草稿拉长,概率门控删掉,结果速度从 28 掉到 17,越优化越慢。回头对照官方 serve 脚本一行行看,注释里写得很明白:这个注意力结构 head dim 256,用 f16 每次都得把整个缓存重算一遍,纯属给自己加负担。老老实实改回 q8_0 + MTP n4 + 门控 0.75,代码生成直接翻三倍。

引擎也得挑对。社区有人专门给 Strix Halo 维护了一个分支,带三个关键补丁:GPU 端 top-k(不然上下文一深就丢回 CPU 算)、原生 MTP 投机头、ngram 草稿。配合 ROCm 10.0,gfx1151 原生支持不用版本伪装了,prefill 和长上下文都不掉链子。

数字放这,同一台机器、温度 0、关思考:代码 60.7 token/秒,JSON 结构化 36 到 53,散文 23,256K 上下文性能基本不衰减。顺手对比了下,主流笔记本本地跑 7B 小模型也就 30 到 40,这台跑 125B 反而更快。听着反直觉,但 MoE 就是这么吃的带宽。

配置明细: 参考图

本地大模型这条路,AMD 统一内存机型算是真能打了。125B 不插独显不租云,一体机自己跑,256K 上下文做 agent 够用. 评论区有大神知道怎么再提高么?

#AMD #aimax395 #本地大模型 #Qwen3 #开源模型 #AI实测
#AI工具