首页 / 资讯详情

别再乱调图像塔了!浙大 IJCAI 论文揭露 VLM 非对称性真相,给 CLIP 微调「踩刹车」

雷锋网 2026-08-17 04:45 中文

摘要

A3B2自适应非对称适配器,诠释大模型微调的“克制”艺术。 作者丨张 璐 编辑丨幸丽娟 在视觉语言大模型(VLM)落地少样本迁移任务时,高效参数微调(PEFT)是大家普遍采用的低成本方案。然而,业界长期存在一个惯性思维:既然是做图像分类,给图像编码器多挂几个 Adapter、多做微调,模型理应能看懂更多视觉细节。但现实却演化出一个尴尬的矛盾:在面对未知的现实场景(域外数据/OOD)时,在图像编码器上微调得越激进,模型的泛化能力反而破坏得越惨烈。 预训练大模型原本拥有一双看懂万物的“好眼睛”,强行局部微调反而把它“改近视了”。这一矛盾引发了研究者的反思:在 VLM 微调中微调中,我们是否一定要死板地对称更新双塔?浙江大学陈静远教授课题组与斯旺西大学的联合团队提出了一个全新的方案——(自适应非对称适配器)。它放弃了对图像分支的硬性微调,而是引入预测置信度,自动在合适的时候给视觉塔“踩刹车”,在保留预训练强泛化力的同时实现高效适配。论文链接:https://arxiv.org/html/2605.13161v201颠覆直觉的发现:文本放开改,图像看情况为了彻底搞清楚双塔到底该怎么调,研究团队在 11 个主流视觉数据集上展开了严谨的实验。他们给 CLIP 的图像塔和文本塔分别挂载基础 Adapter,在不同任务场景下进行了交叉对比,最终总结出推翻传统范式的三大核心洞察:▎实验试出来的三条“微调铁律”洞察一:文本分支的改动收益更高 。在大多数任务中,微调文本编码器带来的性能提升,显著高于微调图像编码器。这是因为文本本身包含高度抽象的高层语义,通过微调文本端,模型能以极小的参数代价快速对齐新类别的概念。洞察二:已知场景,双管齐下。在分布内任务(例如基类到新类的泛化)中,由于测试集和训练集的数据分布一致,同时微调图像塔和文本塔能达到最佳表现。此时图像塔的微调有助于捕捉特定领域内的细粒度视觉特征。洞察三:未知场景,图像微调是“毒药”。一旦到了分布外任务(OOD)(例如跨数据集迁移或域泛化),激进地微调图像塔不仅带不来收益,反而会严重破坏 CLIP 原本强大的通用视觉表达。在(b)跨数据集评估和(c)域泛化等 OOD 任务中,仅微调图像分支(Image 柱)的准确率大幅下滑;而仅仅微调文本分支(Text 柱)反而能维持较高水准。这三条洞察扎中了工程师的痛点。如果你在实际业务(如电商商品识别、工业质检、医疗遥感等)中做过VLM落地,一定对这种“上线崩溃”不陌生。过去为了让 CLIP 适应自家的私有数据,大家第一反应就是抓着图像编码器猛调。结果模型在测试集上准确率飞升,一上线遇到用户上传的长尾图片、异常光照或未见过的品类(典型的 OOD 域外场景),性能立马断崖式下跌。很多团队只能硬着头皮不断人工补数据、重训模型。论文总结的这三条洞察,直接戳破了大家在工程落地时屡屡踩坑的根源:问题往往不是出在样本不够多,而是出在对图像塔的“过度侵入”上。盲目微调破坏了预训练底座最珍贵的通用视觉表达。▎陷入“开也不是,关也不是”的死局实验数据彻底颠覆了大家的固有认知。过去被当成“加分项”的图像塔微调,在未知数据面前竟然变成了毁掉模型的“毒药”!既然如此,那遇到未知场景时,把图像塔的 Adapter 手动关掉不就行了?想法很美好,现实泼了一盆冷水。线上实时流入的数据,从来

阅读原文(雷锋网)→

本站为资讯聚合平台,仅展示标题与摘要,原文版权归原发布方所有;如有侵权请联系我们删除。