用辅助驾驶芯片跑 Qwen3-4B 对比 DGX Spark 肯定是烂活了,这种东西只能是市场公关想出来的。
实际上想要知道马赫 100 的性能表现,它们自己的团队是发过论文的,对比的就是 Thor-U, 这个靠谱多了。
M100: An Orchestrated Dataflow Architecture Powering General AI Computing
有兴趣可以直接看原文,我在这直接总结:
1️⃣用UniAD测,因为有大量并行卷积和注意力计算,数据依赖关系复杂但相对固定,所以恰好是马赫 100 最擅长应对的场景。
M100整体帧率达到30 FPS,Thor-U为7.9 FPS
有3.8倍差距,而且这个倍数在子模块层面(3.8-6.3倍)甚至比整体帧率更高,说明瓶颈可能出现在数据搬运和模块间衔接环节,而不仅是单模块计算效率。
这恰恰印证了论文反复强调的核心论点,M100真正的优势不在于算力,而在于编译器驱动的数据流规划消除了GPU架构里缓存调度带来的不确定性开销。
2️⃣如果用LLaMA2-7B测,这是整篇论文最有说服力的部分,因为它没有全面碾压。
论文把LLM推理拆成Prefill和Decode两个阶段单独测试,输入序列长度设定为1024 token,Prefill阶段权重INT8/激活INT8量化。
M100为79msThor-U为154ms
M100快1.95倍。
但Decode阶段,权重INT4/激活FP16量化
M100为21.34ms,Thor-U为20ms,
M100反而略慢。
因为 Decode 阶段本质上受内存带宽限制,M100的数据流优势建立在「计算与数据搬运重叠」这个前提上,但Decode阶段是逐token生成、计算强度低、几乎纯粹被内存带宽卡住吞吐上限。
这时候双方DDR带宽相同,都是273GB/s 自然拉不开差距。
3️⃣最后是理想自己真实业务的MindVLA测试,这部分只测了LLM部分,不含视觉编码,只有 431M
Decode阶段
M100为0.1msThor-U为0.3ms
Prefill阶段
M100为0.84msThor-U的1.74ms
这里MindVLA的Decode性能反而比LLaMA2-7B的Decode结果要好得多,合理的解释是MindVLA作为车企自研模型,输入输出规格更小,更适配M100的张量粒度指令集设计。
⏹️所以最终结论是什么呢?
论文证明了同一颗芯片在Prefill和Decode两阶段的相对表现可能完全不同,甚至方向相反。
Prefill阶段M100全面领先,而 Decode阶段则要看具体模型规格和量化精度,通用大模型(LLaMA2-7B)甚至跑不赢Thor-U。
车企自研芯片本身就是跑自己模型的,也不对外卖,所以其实很难横向去对比,M100 的优点肯定是对自家优化好,以及只需要 TSMC N5A 成本低,缺点就是内存带宽不够。
要说统一标准的话,目前中国有一份专门的行业标准《人工智能芯片基准测试评估方法》试图统一测试口径。
它包含车载异构计算测评规范,明确要求采用INT8稠密算力作为统一对比基准,理由是避免了算力虚标和对比条件不统一造成的问题。
本质上是让不同厂商的芯片都脱离自己的专属优化,回到同一起跑线上比拼。
但这个性能又几乎不可能等于自家芯片+自家模型的性能,所以难啊。






