这次DeepSeek V4 Pro正式版反响不好,据说只有在DeepSeek Harness的极简模式才能拿到好分数。有人说这是出现了过拟合,这个我就不太懂了,但是让我想起之前接触过的两个过拟合,首先是端到端智驾,最头疼的就是数据加了很多之后出现模型背路线。如果过度拟合了特定城市的高频路况,遇到长尾场景就会出现理解崩塌,出现莫名其妙的输出。智驾工程师为了减少过拟合现象,在数据选择搭配上花了不少精力,而且最后还需要一些特殊处理。
之前用尝试AI做量化因子挖掘也发现,最大的敌人也是过拟合。在历史数据里回测,夏普比率高得惊人、收益曲线完美向上,上了实盘后面对真实世界的未来,因子瞬间失效。我个人的量化实盘就遇到这个问题,当时自我分析原因是AI极容易把过去的历史噪音和阶段性运气当成了长期的Alpha。后来真正做量化的朋友告诉我,这是必然了,他们需要花一半以上时间预防和排除这种现象。
汇到现实生世界中,我感觉个人或者组织也很容易陷入现实版过拟合中。在过去越是取得巨大成功,就越容易把那套成功经验做为权重极大的因子,习惯性把过去的爆款公式套在新的时代需求上,有些时代红利赋予的运气当成自己个人能力的必然。突然想起那句话“拼运气赚的钱,凭实力亏回去了”,哈哈。
技术上解决过拟合可以靠增加数据噪声,主动给系统制造残缺与意外,最简单的逻辑解释数据等方式,但在现实认知里该怎么对抗经验上的过拟合?或许同样需要定期把过去的成功归零,主动引入反对意见和跨界视角,打碎固有的思维惯性,第一性原理,小步快跑的测试迭代。
很久没写大D聊聊天 这个话题了,以后尽量文字记录一下。
