【大模型/评测】近期大模型发布与评测要点如下:
一直有一种观点,就是小模型加 Harness,就能达到大模型的智能效果: > 只需要一个 10 亿参数的小模型作为“认知核心”,其余能力靠联网搜索、执行代码等工具补齐就够了。 Jason Wei (思维链提示技术的核心作者之一)的新推文,反驳了“小模型+工具”路线,认为光靠工具,撑不起顶级智能,把知识“内化在大脑”和“现查现用”是两回事小模型+工具就能行的观点之所以流行,因为理论上确实说得通:模型不知道的冷门知识,可以上网查;不会算的题,可以调用代码。小模型加工具,似乎没有做不到的事。而小模型意味着更低的算力成本,对整个行业都很有吸引力。 他用自己学羽毛球打了个比方。教练教的每个动作他都能做出来,但要在实战中流畅串联,跟练了上万次形成肌肉记忆的人完全不是一个级别。语言模型也一样,内化了知识的大模型和靠工具临时检索的小模型,体验差距很明显。 具体来说有三点。第一是速度,直接给出答案远比调用工具搜一圈再回答快得多。第二是理解的深度,比如你问一个音乐节的口碑如何,大模型能基于海量数据给出综合判断,而小模型只能搬运搜索结果里排在前面的几条评论。第三是可靠性,每次都要重新查资料、重新推导,出错的概率更高,在复杂的长任务中错误还会层层累积。 回顾“苦涩的教训”(Bitter Lesson)里面的观点:历史反复证明,靠扩大规模获得的能力提升,总是胜过精巧的工程设计。工具让小模型能做更多事,但追求最高质量的用户,始终会需要更大的模型。 x.com/_jasonwei/status/2089429555371024577 ---- 原推转译 ---- 工具调用无法取代更大的语言模型语言模型刚开始能够熟练使用工具时,我很认同一种说法:我们不需要继续扩大语言模型的规模,只需要一个足够强大的「认知核心」——比如拥有 10 亿参数——其余一切都可以通过工具调用来完成,例如浏览互联网或执行代码。我想,当时很多人都认同这个观点。确实,我们很难找出一项有意义的任务,是一个能够充分使用工具的 10 亿参数模型在理论上无法完成的。例如,大语言模型知道的任何冷门事实,原则上都可以从互联网上检索出来,再交给一个 10 亿参数的语言模型进行推理。 但现在,我认为这个观点完全错了,原因很简单:不依赖工具也能快速、自然地完成任务,这件事非常重要。 真正让我理解这一点的,是我今年学习羽毛球的亲身经历。打羽毛球时,我就很像一个「10 亿参数的认知核心」。教练教我的每一种击球动作,从身体能力上说我都做得出来,但我要在脑中记住每个动作要领,再把它们组合到一起,需要付出很大努力。练习时,我几乎可以完美地完成一次击球;可一旦进入连续的对打,我就很难做到,在比赛中更不可能稳定发挥。这显然不同于那些把一个动作练习过上万次、已经能凭本能轻松完成的人。 同样,语言模型无需调用工具、直接在内部掌握一个事实,是有实际意义的。第一,我们显然很在意速度。相比让模型长时间思考以确认答案,或者再去浏览网页,你当然更希望立刻得到回答。第二,有些东西就是更适合通过大量数据上的反向传播来学习。假如你问大家通常怎么看 Shambhala 音乐节,你会更希望大语言模型根据互联网上的全部数据给出一种综合意见,而不是复述网页搜索排在最前面的三条评论。第三,费很大力气寻找答案,可靠性不如一开始就知道答案。理论上未必一定如此,但至少目前在实践中很可能就是这样。如果每次都要重新查找事实,或者重新做一遍数学推导,出错的概率就会更高;在长周期任务中,这些错误还可能不断累积。 一旦你认同「不使用工具、直接依靠模型参数完成任务」具有价值,就必须承认:…
Anthropic公开了Claude水印技术的原理:不加字符,改的是随机数的来源。 Claude 生成文本隐形水印的实现方式——没往文本里塞任何隐藏字符,而是改了模型选词时随机性的来源。很多人以为"无损水印"技术上不成立,这次官方说明证明这个思路是可行的。 1. 水印怎么工作:换掉随机数的来源大模型生成文本是一个词一个词往下选的。像"今天天气很冷,而且……",下一个词大概率是"阴沉"或"多云",两个词选哪个,对句子含义几乎没区别,这种低风险的选择通常由一个随机数决定。 水印技术做的事情是:这类随机选择,本来是用任意随机数生成器决定的,现在换成用一个密钥(key)加上前面几个词来决定。 1)选出来的词依然是"随机"的,只是这个随机性不再来自纯随机数生成器,而是来自密钥和上下文的组合。 2)事后如果知道这个密钥,就能检查一段文本里的词语选择序列,是否符合"用这个密钥会做出的选择",从而判断这段文字是否可能是 Claude 生成的。 3)水印不会让模型偏向某个固定的词。这句话里选"阴沉"还是"多
【大模型/评测】 近期大模型发布与评测要点如下: 一直有一种观点,就是小模型加 Harness,就能达到大模型的智能效果: > 只需要一个 10 亿参数的小模型作为“认知核心”,其余能力靠联网搜索、执行代码等工具补齐就够了。 Jason Wei (思维链提示技术的核心作者之一)的新推文,反驳了“小模型+工具
阅读:0
点赞:0