100张图片,不到20美分。DeepSeek在8月21日晚用这个数字,给多模态定下了新锚点。
当天上线的 DeepSeek-V4-Flash-Vision-Exp 是首个实验性多模态视觉理解模型,已在API平台开放,文本能力与V4-Flash正式版持平,等于是让V4-Flash长出了眼睛。
怎么用,一次能处理多少接口直接瞄准批量场景。兼容OpenAI与Anthropic两套API,迁移成本低;支持Base64、URL(32 MiB)、免费Files API(64 MiB)三种传图;单次请求最多600张图,这不是单图问答演示,而是为批量文档解析、长视频抽帧这类重活准备的。
来源:DeepSeek官方X 2026-08-21 17:35、API更新日志 2026-08-21 17:26
分数逼近Opus-4.8,含金量在哪最受关注的是第三方披露的两组分数。X账号阿易AI Notes称,多模态Agent评测中该模型已接近Opus-4.8:Agents Last Exam 27.3对25.7,ZeroBench 35.0对34.0。
这两项考的是多步规划与零样本泛化,不是看图说话。能接近Opus-4.8,说明视觉能力已可作为Agent的眼睛。但需标注口径:这是第三方自测,非官方榜单,数据集和提示词差异都会影响结果,更准确的理解是进入同段位区间。
AIHOT热度显示,事件在8月21日22:00冲至峰值121,24小时后仍在70左右。
来源:X阿易AI Notes 2026-08-21 18:44、The Decoder 2026-08-22 03:28
定价才是真正的武器计费很简单:单张图片最多占384个token,价格与V4-Flash文本同价。
按此测算,100张图不足20美分,高分辨率扫描件也能通过64 MiB的Files API直接处理。DeepSeek从V3、R1到V4一直靠低价提供顶级文本能力,多模态此前是唯一的成本缺口,现在用同价策略补上,配合600张的批量上限,等于告诉做票据、审核、试卷批改的团队:批量看图不用再单独算账了。
来源:DeepSeek API更新日志 2026-08-21 17:26、The Decoder 2026-08-22 03:28
映射到投资,冷静看Exp三点映射。一是利好AI应用层,办公自动化、金融票据、政务数字化等重度看图场景弹性先出来。二是算力侧分化而非利空,单价下降换来600张并发的总量上升,利好推理算力,承压的是靠高价API维持毛利的闭源厂商。三是Exp本身是提醒,权重未开源、边界会快速迭代,适合压测而非直接替换核心链路,benchmark为第三方口径,不能线性外推。
当看图不再是奢侈品,稀缺的就不再是模型,而是你手里有多少值得被批量看见的数据。
