DC娱乐网

瞎傻了!2.78万亿参数模型,8GB内存也能跑!

最近一个叫 kimi-k3-in-c 的开源项目火了:纯 C99 写成的推理引擎只有约 176KB,不需要 GPU、不需要 CUDA,甚至号称在只有 8.24GB RAM 的 CPU 机器上,也能运行拥有 2.78 万亿参数的超大模型。乍一看,似乎意味着昂贵的 GPU 要被淘汰了,但真正值得关注的技术突破,其实不是“8GB 装下 2.78T”。

秘密在于 MoE(Mixture-of-Experts)。MoE 模型虽然总参数量巨大,但生成每个 token 时并不会调用所有参数,而只激活其中少数 experts。kimi-k3-in-c 更进一步:不把全部专家权重加载进内存,而是让大量权重留在 SSD,需要哪个 expert,就从磁盘按需读取哪个。

这意味着一个重要变化:模型有多大,和运行它需要多少 RAM/VRAM,开始可以逐渐解耦。过去部署大模型首先问“显存够不够”,未来可能变成另一个问题:如何在 CPU、RAM、SSD 甚至网络之间,以最低成本动态调度参数。SSD 不再只是保存模型文件的仓库,而可能成为 AI inference memory hierarchy 的一部分。

当然,“能跑”绝不等于“好用”。如果每生成一个 token 都需要频繁从 SSD 读取大量权重,I/O bandwidth 和 latency 很快就会成为瓶颈。所以判断这种项目有没有实际价值,不能只看“2.78T 参数、8.24GB RAM、176KB”这些惊人的数字,更应该看 tokens/s、每个 token 激活参数量、SSD 读取量和首 token 延迟。

真正值得兴奋的,是 AI 基础设施思维正在改变。未来未必是“GPU 不重要了”,而可能是模型架构、quantization、expert caching、SSD 和 memory hierarchy 被联合优化。当参数规模不再被显存容量牢牢锁死,超大模型的本地运行门槛可能被重新定义。

#人工智能 #大模型 #Kimi #开源AI #MoE #LLM #AI技术 #本地大模型 #人工智能前沿 #科技趋势