《关于 DeepSeek 补齐多模态对话能力、支持直接发图的用户建议书》
致:DeepSeek 产品与生态团队
一、背景
国产 AI 竞争已经进入深水区。DeepSeek 在推理、代码、数学和性价比上有明显优势,但产品体验仍有短板。最典型的一个场景:用户在对话里想要一张郭德纲舞台照,模型只能给外部链接,无法在聊天框里直接展示图片。用户等半天,最后还得自己点链接、自己找、自己存。
这不是小问题,这是多模态入口的缺失。
二、核心痛点
1. 对话内不能直接发图、收图、展示图。2. 图片搜索、图片理解、图片生成彼此割裂。3. 工具调用和插件生态不够开放。4. 开发者想集成,缺少便捷 API 和机器人能力。5. 用户体验经常被“链接”打断,不够顺滑。
三、用户诉求
· 聊天框里直接发图、收图、看图、存图。· 支持以图搜图、图片理解、OCR、图生图。· 集成图库搜索,返回可展示缩略图并标注来源。· 开放 API 和机器人能力,让开发者能直接发图。· 快、稳、便宜、合规。
四、功能清单与优先级
P0:
· 图片上传、粘贴、多图上传。· 图片理解、OCR、以图搜图。· 对话内直接渲染图片,支持下载和保存。
P0:
· 图片搜索工具,直接返回缩略图 + 来源 + 版权信息。
P1:
· 文生图、图生图、图片编辑、风格化。· 开发者 API、插件、Telegram / Discord / 企业微信机器人发图。
P2:
· 个人图库、收藏夹、分享页、团队协作。· 视频、语音等多模态能力。
五、竞品对标
ChatGPT、Gemini 已支持图像输入输出;国内豆包、Kimi、文心、通义也在补多模态。DeepSeek 强在模型能力,如果补上产品闭环,优势会更大。否则用户会因为“发不了图”这种小痛点流失。
六、实施建议
1. 先做 P0:对话内图片上传 + 理解 + 展示,最快见效。2. 再接图库搜索:Bing、Wikimedia、百度等,标注版权。3. 开放 API 和机器人能力,让开发者帮你们补场景。4. 合规先行:内容审核、版权、隐私、未成年人保护。5. 收集用户反馈,公开路线图。
七、预期价值
· 留存与使用时长提升。· 开发者生态扩大。· 口碑从“模型强”变成“产品也好用”。· 在国内 AI 竞争中占据更稳的头部位置。
八、结语
我们不反对领先,我们反对止步不前。中国 AI 需要良性竞争,用户需要更好的软件。DeepSeek 有机会成为排头,但排头不是喊出来的,是把“直接发一张图”这种小事做好做透。
——一名希望国产 AI 更好的用户生活手记
