一、文章主要内容总结
该研究聚焦大型视觉语言模型(LVLMs)的结构脆弱性,核心探索“移除少量关键神经元是否会引发模型灾难性崩溃”这一问题。通过提出CAN(Consistently Activated Neurons)方法,结合神经元激活强度与梯度敏感性对神经元重要性排序,进而通过渐进式屏蔽实验验证关键神经元的作用,主要发现如下:
- 极小神经元屏蔽即可触发崩溃:在LLaVA-1.5-7b-hf中,仅屏蔽语言模型前馈网络(FFN)的4-5个关键神经元,就会导致模型输出无意义文本(如重复字符、空输出),内部词汇分布(logits)严重紊乱;InstructBLIP-Vicuna-7b虽更稳健,但仅需屏蔽1200个左右神经元(占模型参数极小比例)也会崩溃。
- 关键神经元的分布特征:关键神经元主要集中在语言模型组件(而非视觉编码器、跨模态对齐模块等视觉相关组件);且FFN中的下投影层(down_proj)比门投影层(gate_proj)更脆弱,屏蔽该层神经元所需数量更少、崩溃程度更严重。
- 统一的两阶段崩溃模式:所有模型均呈现“先表达退化、后完全崩溃”的规律:第一阶段(表达退化)CLIP分数(图文对齐度)逐渐下降,困惑度(语言流畅度)稳定;第二阶段(完全崩溃)困惑度骤升、CLIP分数跌至临界值(≤22)或无定义,模型彻底丧失理解与生成能力,且崩溃后无法恢复。
- 视觉组件与语言组件的差异:屏蔽视觉相关组件(如视觉