AI到底是怎么学会“认东西”的?
很多人以为,AI识别一只猫,是因为工程师提前告诉它:“猫有耳朵、四条腿、会喵喵叫。”
其实不是。
AI更像一个没有经验的小孩。
一开始,给它看大量图片:这张是猫/这张不是猫。
每看一张,它都会尝试猜答案。
- 猜错了,就根据“标准答案”调整自己内部的参数;- 猜对了,就继续强化这种判断方式。
这个反复修改的过程,就是AI训练。
拿图像识别来说:
神经网络里的不同层,会逐渐学会发现不同特征:
- 第一层:发现颜色、边缘、线条;
- 中间层:组合出形状,比如眼睛、耳朵、轮廓;
- 更深层:综合这些特征,判断“这大概率是一只猫”。
- 最后,它形成一个数学模型。
下一次看到一张新图片,它不会像人一样说:“我知道这是一只猫。”
它只是根据过去学到的大量规律,计算:“这张图片和我见过的猫有多像?”
然后输出一个概率。
所以,AI的“认识”和人的“理解”其实不一样。
人看到猫,会想到毛茸茸、会抓人、喜欢吃鱼,是一种结合了视觉、触觉、经验和常识的理解。
AI看到猫,更多是:“这些像素组合,过去经常对应‘猫’这个标签。”
这也是为什么AI很强,但也会犯一些奇怪的错误:换个角度、换种光线,甚至加一点人类觉得无意义的变化,它可能就判断错。
因为它学习的是数据中的规律,而不是像人一样真正理解这个世界。
简单来说:人是“看懂了世界”,AI是“学会了世界留下的规律”。
而未来的具身智能,想让AI真正进入物理世界,核心挑战之一,就是让机器不仅会看,还要通过身体、环境和行动去积累经验。