在受控环境里,视觉模型可以被漂亮的准确率说服。但仓库、工厂和街道不会保持整齐:光线会变化,物体会遮挡,物品会出现在训练数据之外。

因此,机器人真正需要的不是一个总能给出结果的视觉系统,而是一个能表达置信度、识别异常并触发安全策略的系统。

不确定性是一种输出

当机器人看见一个从未遇到过的物体,它应该做的不是猜一个最接近的类别,而是把不确定性传给下一层决策。这个动作可能是减速、重新观察,或者请求人工确认。

这会改变系统的评价方式。除了准确率,还需要测量错误的代价、异常发现的速度,以及人类介入后流程能否继续。

从看见到协作

一台在现实世界里有用的机器人,必须让人理解它的判断。提示灯、声音、动作停顿和操作界面,都会成为视觉系统的一部分。

机器人视觉最后要解决的,不只是“它看见了什么”,而是“它和人如何共享对现场的理解”。