DeepSeek 今天在 X 上发布公告:
实验性多模态视觉理解模型 V4-Flash-Vision-Exp 已上线 API。
三个要点:
1. 文本能力与 V4-Flash 相当(代理、推理、世界知识);
2. 多模态 Agent 基准测试大幅提升,4 项评测与 Anthropic Opus-4.8 打成 2 胜 2 负(Agents' Last Exam 27.3 对 25.7、ZeroBench 35.0 对 34.0、ApexBench 36.5);
3. DeepSeek Harness 0.1.1 同步发布,内置支持新模型,另上线免费 Files API。
用人话说:以前 AI 只能读文字,现在它能看截图、看屏幕、边看边干活——
给它一张报错截图,它能自己看、自己改,不用你先把信息翻译成文字。
我的看法:
实验版适合尝鲜和测试,生产环境慎用。
但方向值得盯:
接下来 AI 最卷的地方,是谁能看懂你的屏幕、替你干活。
DeepSeekAI多模态AI产品人工智能
