每开源一个大模型,算力产业都要重新答一次题
站在产业厂商的角度看,中科曙光面对的机会和压力其实是同一件事:模型迭代速度越来越快。曙光要做的,不只是把机器建出来,而是让新模型能够快速迁移、稳定运行,并以可接受的成本提供服务。
大模型不断更新发布,国产算力厂商几乎进入适配竞赛。外行看到的是一条条“完成适配”的新闻,内行看到的却是一系列工程问题:算子是否兼容、显存如何分配、专家并行怎样通信、长上下文推理是否稳定、集群发生故障后能否快速恢复。
这些问题不能靠单卡参数解决。模型规模越大,越考验计算、网络、存储、液冷和调度系统的协同。中科曙光布局超节点、万卡超集群和Gridview管理调度平台,其价值就在于把分散的硬件资源组织成一套能长期运行的生产系统。
尤其在开放模型越来越多的情况下,企业不可能为每个模型重新建设一套封闭环境。曙光提出开放计算架构,支持多种国产加速卡并兼容主流软件生态,是一条更符合国内产业现实的路线。
未来厂商真正争夺的,不是“第一时间宣布适配”,而是谁能让模型更快上线、成本更低、利用率更高。中国AI已经不缺好模型,下一道题是如何把这些模型变成稳定、便宜、普遍可用的生产工具。
中科曙光 模型适配 算力运营 开放计算