在计算机视觉领域,我们长期面临一个痛点:传统的检测模型(比如 YOLO)就像个“死脑筋”,只能认出训练集里有的东西(人、车、猫)。如果你想让它识别“古籍里的木刻画”或者“电路板上的微小零件”,往往需要