美银证券(BofA)在对前微软AI工程高管的访谈中指出,随着代理式AI(Agentic AI)的普及,推理阶段的内存需求将结构性上升,投资判断不能只盯着GPU数量,更要关注KV缓存放在哪里、搬得多快。原因是多方面的:上下文长度正从约12.8万token向100万token扩展;多个代理并发工作需要共享任务上下文;KV缓存不仅存储先前token,还包含企业上下文、安全护栏和代理的决策记录,部分代理工作负载下KV缓存甚至可达模型权重的约10倍。虽然通过压缩、降低精度或将闲置缓存卸载到DRAM、NVMe、闪存可以降低单次成本,但效率提升往往会带动用户和任务量增长,整体内存需求仍将持续攀升,HBM需求预计保持高位、供给依然紧张。与此同时,推理的瓶颈正从“算力”转向“数据搬运”:GPU要持续高效运转,就必须及时获取所需的KV缓存,当GPU周边内存不足时,更大的内存池、高带宽网络、光连接(可拉长处理器与内存距离,但量产普及尚不明朗)以及Ultra Ethernet等方向的重要性日益凸显,而这些恰恰是被市场低估的领域。在模型选择上,报告认为未来将是混合架构:前沿模型适合模糊推理、复杂决策和高质量软件开发;开源权重模型则更适合范围窄、重复性高的内部流程,当年用量达到约50亿token时可认真测算自建是否划算,但需综合考量开发、托管、安全、隐私等隐性成本,核心是通过模型无关的抽象层按能力、成本和治理灵活调度。
