132、开集检测与零样本识别:CLIP驱动的开集感知 132、开集检测与零样本识别:CLIP驱动的开集感知从一次失败的抓取说起去年做仓储分拣项目的时候,我们遇到一个特别尴尬的场景。机械臂面前传送带上来了一个透明塑料盒,里面装着几颗螺丝钉——这玩意儿在训练集里压根没出现过。当时用的还是YOLO+分类头的传统方案,模型直接给了一个“背景”的预测,机械臂傻乎乎地空抓了一把,把盒子碰翻了。现场工程师骂骂咧咧地重启了流水线,我站在旁边盯着那个透明盒子,突然意识到一个本质问题:封闭集检测的假设——测试时的类别一定在训练集里——在真实物理世界里就是个伪命题。后来我们换上了CLIP驱动的开集感知方案,同样那个透明盒子,模型给出的预测是“透明塑料容器,置信度0.82”,机械臂调整了抓取策略,稳稳地把它挪到了指定区域。这个转变不是换了个模型那么简单,是整个感知范式的变化——从“识别我见过的”变成“理解我没见过的”。开集检测到底在解决什么问题先别急着上代码,我们把问题掰开揉碎了看。传统目标检测器,比如Faster R-CNN或者YOLO系列,输出层是一个固定维度的softmax,每个维度对应一个训练时定义好的类别。这意味着模型的决策边界被死死地锁在了训练集的类别空间里。测试时来了个新类别,模型要么把它硬塞进某个已知类别,要么干脆当成背景——这两种情况在机器人操作场景里都是灾难。开集检测(Open-set Detection)要解决的是:检测出未知类别的目标,并且最好能给出一个语义层面的描述。零样本识别(Zero-shot Recognition)更进一步,要求模型能根据自然语言描述来识别训练时完全没见过的类别。CLIP(C