过去三周,每个推理任务的平均输出Token升了11%至2.4万个,推理密集型任务尾部涨9%到4万个。输出Token占比升至41%,缓存活动降至57%,输入Token稳定在2%。
模型每次调用消耗的计算资源在变。没有架构层面的突破,以输出和缓存为主的工作会形成负载。
过去三周,每个推理任务的平均输出Token升了11%至2.4万个,推理密集型任务尾部涨9%到4万个。输出Token占比升至41%,缓存活动降至57%,输入Token稳定在2%。
模型每次调用消耗的计算资源在变。没有架构层面的突破,以输出和缓存为主的工作会形成负载。