终于,小红书 IMO 满分夺金模型的同系列版本开源了!
上个月,小红书自研大模型「dots-note-3.0」创下了一个历史记录:AI 首次在国际奥数竞赛中斩获官方认证的满分42 分。此后,社区最关心的问题,就是模型什么时候开源。
就在今天,小红书 dots 模型实验室(以下简称 dots 实验室)宣布开源 dots3-note preview!它也是 dots3 系列模型首个开源版本,瞄准了更贴近现实、更难评测的长程任务。
从参数来看,dots3-note preview 的总参数为 280B,其中激活参数为 16B,支持 512K 超长上下文窗口,具备了文本、视觉与语音多模态理解能力,并针对复杂推理、Agent 和多模态感知进行了优化。
IMO 满分验证了该系列模型在数学推理与证明上的能力,此次开源把挑战带到了另一类更难标准化的场景:旅行规划、婚礼筹备、开店经营。这类任务没有唯一答案,时间还可能拉长到数小时、数天甚至更久。
dots3-note preview 将重心放在长程任务上,也踩中了当前 Agent 发展的一条主线:它们开始被要求独立承担越来越长、越来越完整的工作。OpenAI 曾披露,今年 5 月,超过 70% 的用户让 Codex 处理需要人类一小时以上才能完成的工作;到 6 月,OpenAI 内部使用量最高的 1% 活跃用户每天产生超过 60 小时的 agent turns。
不过当任务落到不同场景里,难度很快就会拉开。与数学、代码和工程等 Agent 表现比较成熟的场景不同,真实生活环境更开放、需求更模糊。dots3-note preview 选择把「考场」放在这里,对自身的长程规划、判断与纠错能力提出了更高要求。
从多项主流 benchmark 数据来看,在多项推理及智能体任务上,模型可比肩甚至超过参数规模数倍于自身的大尺寸模型,视觉能力在同尺寸区间表现突出。
此前,小红书已经陆续开源了文本大模型 dots.llm1、多语言文档布局解析模型 dots.ocr 和多模态视觉理解大模型 dots.vlm1。最新的开源,补上了 Agent 这一块拼图。
有一手实测,完整内容戳全文👆🏻哈~
#小红书 #dots3 #点点 #dots #大模型 #AI #人工智能 #小红书科技AMA















