DC娱乐网

训练和开源dots3-note 的几个原因

dots 模型实验室开源了 dots3-note Preview。
280B 总参数、16B 激活参数、512K 上下文、文本/视觉/语音多模态理解,系列将包含 note、jazz 与 aria 三款模型,覆盖不同层级的任务复杂度、响应速度与计算成本需求。

但更值得关注的还是两个词:Memory 和 Learning。

过去我们看 Agent,主要看它会不会调用工具、能不能操作浏览器、能不能连续完成复杂任务。
但Agent 干完一次活之后,下一次真的会更聪明吗?大多数情况下,并不会。

现在很多 Agent 也有 Memory,但更像外挂:对话摘要、用户偏好、执行历史都被存起来,下次再检索回来。模型本身并没有真正“学会”。

dots3-note 进一步探索:什么值得记?什么时候该更新?什么时候应该推翻之前的判断?
这也是 Self-Critique 的价值。

现实中的长程任务,比如旅行、装修、婚礼筹备,可能持续几周甚至几个月,期间存在各种变化。

dots 团队提出的 TEMPO,也是为了缓解长程任务里的奖励稀疏和 Credit Assignment 问题。

更有意思的是,他们还用 ARC-AGI-3 测试 Test-Time Continual Learning,获得了高分。
ARC Prize Foundation 负责人 Greg Kamradt 也转发了这个实验,并评价:“Not verified yet, but interesting.”

Agent 的竞争正在进入新阶段:过去比谁知识更多,后来比谁 Reasoning 更强,再后来比谁更会调用工具。
下一步可能会比:谁能从自己的执行经历中持续获得经验,并走入真实生活任务中,这恰巧跟的定位一致。

第一次靠探索,第二次少走弯路,第十次形成策略。
这时候,Memory 不再只是数据库,Trajectory 也不只是日志。

每一次执行,都可能成为下一次决策的学习材料。
所以 dots3-note 真正值得关注的,不是 280B,也不是 512K。

而是它在尝试让 Agent 从“会调用工具”,走向“能够从工具调用中积累经验”。