【Bug已解决】CoRDA initialization lacks support for Conv1D layers in older models like GPT-2 解决方案.md

【Bug已解决】CoRDA initialization lacks support for Conv1D layers in older models like GPT-2 解决方案.md

【Bug已解决】CoRDA initialization lacks support for Conv1D layers in older models like GPT-2 解决方案.md

一、现象长什么样

CoRDA(Correlation Difference Adaptation)是一种 LoRA 初始化方法:它先用一批校准数据跑前向,统计每个目标层激活的协方差/相关性,再用“基座权重与激活相关性之差”来初始化 LoRA 的AB矩阵,使 LoRA 起点就贴合数据分布,收敛更快。

但把它用在GPT-2(以及很多旧模型)上时,会发现:

  • GPT-2 的注意力/MLP 大量使用Conv1D(不是nn.Linear)——这是一种“kernel_size=1 的卷积层”,但数学上等价于线性层y = x @ weight.T + bias
  • CoRDA 的初始化逻辑只识别nn.Linear,对Conv1D视而不见,于是 GPT-2 里这些层根本没被 CoRDA 初始化,退化成随机初始化(或默认 LoRA 初始化),收敛优势丢失;
  • 更严重:CoRDA 在收集激活统计时按nn.Linear的钩子挂forward_hookConv1D没有走这条路径,激活统计为空,初始化时直接NaNshape mismatch
  • 报错如AttributeError: 'Conv1D' object has no attribute 'in_features'——因为 CoRDA 读linear.in_features,而Conv1D用的是weight.shape[1](输入维)而非in_features属性;
  • 训练 GPT-2 时 LoRA 部分层有效、部分层(Conv1D 那些)无效,整体效果打折却找不到原因。

根因:CoRDA 初始化只处理nn.Linear,不识别 GPT-2 等旧模型中普遍的Conv1D层,导致这些层的激活统计缺失、初始化被跳过或报错。

二、背景

GPT-2 的Conv1D定义大致是:

class Conv1D(nn.Module): def __init__(self, nf, nx): super().__init__() self.nf = nf self.weight = nn.Parameter(torch.empty(nx, nf)) self.bias = nn.Parameter(torch.zeros(nf)) def forward(self, x): # x: [..., nx]; y = x @ weight + bias return x @ self.weight + self.bias

注意它的weight形状是[nx, nf](即[in, out]),而nn.Linearweight[out, in]——两者转置关系相反!这是 CoRDA 适配时最容易踩的坑:若直接把nn.Linear的初始化代码套到Conv1D上,维度会反。

CoRDA 的核心步骤:

  1. 对目标层挂 hook,收集输入激活X(形状[N, in]);
  2. 计算激活相关性/协方差C = XᵀX(或其变体);
  3. C与基座权重W推导AB的初始值,使BA ≈ f(W, C)

nn.LinearW[out, in];对Conv1DW[in, out]。CoRDA 必须按各层的实际weight形状处理,且要能识别Conv1D类型、正确读取in/out维(从weight.shape读,而非in_features属性)。

下面用最小可运行代码演示“CoRDA 跳过 Conv1D”与“正确支持 Conv1D(含权重转置)”。

三、根因

根因一句话:CoRDA 初始化只识别nn.Linear、且从in_features/out_features属性读维度,而 GPT-2 的Conv1D既不在nn.Linear类型里、又没有in_features属性(维度藏在weight.shape且顺序与 Linear 相反),导致激活统计缺失、初始化被跳过或维度报错。

展开:

  1. 类型不匹配isinstance(m, nn.Linear)Conv1D为 False,被跳过。
  2. 维度属性缺失:CoRDA 读m.in_featuresConv1D没有该属性 →AttributeError
  3. 权重形状相反nn.Linear[out, in]Conv1D[in, out],套用同段代码维度反。
  4. 激活统计丢失:hook 只挂在nn.LinearConv1D的激活没被收集。

修复方向:让 CoRDA 同时识别Conv1Dnn.Linear;维度统一从weight.shape读取(in = weight.shape[1]for Linear /weight.shape[0]for Conv1D);按各层实际weight形状推导 A/B;hook 对两种类型都挂。

四、最小可运行复现

下面构造一个含Conv1D的迷你 GPT-2 风格模型,演示 CoRDA 初始化“只处理 Linear 跳过 Conv1D”的 bug,以及“同时支持两种类型”的修复。

import torch import torch.nn as nn class Conv1D(nn.Module): """GPT-2 风格的 Conv1D:y = x @ weight + bias,weight 形状 [in, out]。""" def __init__(self, nf, nx): super().__init__() self.weight = nn.Parameter(torch.empty(nx, nf)) self.bias = nn.Parameter(torch.zeros(nf)) nn.init.normal_(self.weight, std=0.02) def forward(self, x): return x @ self.weight + self.bias class MiniGPT2(nn.Module): def __init__(self): super().__init__() self.attn = Conv1D(16, 16) # GPT-2 用 Conv1D self.mlp = nn.Linear(16, 16) # 混用一个普通 Linear def dims_of(self, m): # 错误实现:只认 nn.Linear 的 in_features if isinstance(m, nn.Linear): return m.in_features, m.out_features raise AttributeError("只支持 nn.Linear") def corda_init_broken(model): """错误:只对 nn.Linear 初始化,Conv1D 抛错。""" for name, m in model.named_modules(): if isinstance(m, nn.Linear): in_f, out_f = m.in_features, m.out_features # 用激活统计推导 A/B(示意) A = torch.randn(4, in_f) * 0.01 B = torch.zeros(out_f, 4) elif isinstance(m, Conv1D): # 没处理 -> 跳过(或抛错) pass return "只初始化了 Linear,Conv1D 被跳过" def dims_of_fixed(m): """正确:从 weight.shape 读维度,兼容 Conv1D 与 Linear。""" if isinstance(m, nn.Linear): return m.in_features, m.out_features # weight [out, in] if isinstance(m, Conv1D): return m.weight.shape[0], m.weight.shape[1] # weight [in, out] raise TypeError(type(m)) def corda_init_fixed(model): for name, m in model.named_modules(): if isinstance(m, (nn.Linear, Conv1D)): in_f, out_f = dims_of_fixed(m) A = torch.randn(4, in_f) * 0.01 # [r, in] B = torch.zeros(out_f, 4) # [out, r] # 注意:Conv1D 的 weight 是 [in, out],若用 W 推导需转置 if isinstance(m, Conv1D): W = m.weight.T # -> [out, in],与 Linear 对齐 else: W = m.weight assert W.shape == (out_f, in_f) return "Linear 和 Conv1D 都已正确初始化" torch.manual_seed(0) model = MiniGPT2() print("错误初始化:", corda_init_broken(model)) print("正确初始化:", corda_init_fixed(model))

运行后:错误版跳过 Conv1D(GPT-2 的注意力层就没被 CoRDA 初始化),正确版两种类型都处理,且对 Conv1D 的weight做了转置对齐,维度一致。

五、解决方案(第一层:最小直接修复)

修复 1:同时识别 Conv1D 与 nn.Linear

TARGET_TYPES = (nn.Linear, Conv1D) for name, m in model.named_modules(): if isinstance(m, TARGET_TYPES): ... # 两种都处理

修复 2:维度从 weight.shape 读,别依赖 in_features

def dims_of(m): if isinstance(m, nn.Linear): return m.in_features, m.out_features # [out, in] if isinstance(m, Conv1D): return m.weight.shape[0], m.weight.shape[1] # [in, out]

修复 3:Conv1D 的 weight 转置对齐 Linear

CoRDA 推导A/B时通常假设W[out, in]。对Conv1DW = m.weight.T再参与推导,保证数学一致:

W = m.weight.T if isinstance(m, Conv1D) else m.weight # 后续用 W[in_f, out_f] 的转置参与 CoRDA 公式

六、解决方案(第二层):结构性改进

改进 1:封装激活收集 hook,兼容两种类型

def register_act_hook(module, storage): def hook(_mod, inp, out): x = inp[0].detach().reshape(-1, inp[0].shape[-1]) storage.append(x) return module.register_forward_hook(hook) # 对 Linear 和 Conv1D 都挂 for m in model.modules(): if isinstance(m, (nn.Linear, Conv1D)): register_act_hook(m, stats[m])

改进 2:统一“线性层抽象”,屏蔽 Conv1D/Linear 差异

class LinearLike: @staticmethod def weight(m): return m.weight.T if isinstance(m, Conv1D) else m.weight @staticmethod def in_out(m): if isinstance(m, nn.Linear): return m.in_features, m.out_features return m.weight.shape[0], m.weight.shape[1] # CoRDA 全程用 LinearLike,不关心具体类型

改进 3:在 GPT-2 上自动探测 Conv1D

def find_linear_like(model): return [(n, m) for n, m in model.named_modules() if isinstance(m, (nn.Linear, Conv1D))] # 注入前先打印,确认 Conv1D 也被纳入 print([n for n, _ in find_linear_like(model)]) # 应包含 attn(Conv1D)

七、解决方案(第三层):断言 / CI 守护

import torch import torch.nn as nn import pytest class Conv1D(nn.Module): def __init__(self, nf, nx): super().__init__() self.weight = nn.Parameter(torch.empty(nx, nf)) self.bias = nn.Parameter(torch.zeros(nf)) def dims_of(m): if isinstance(m, nn.Linear): return m.in_features, m.out_features if isinstance(m, Conv1D): return m.weight.shape[0], m.weight.shape[1] raise TypeError(type(m)) def test_conv1d_dims_read_from_weight(): m = Conv1D(16, 32) # in=32, out=16 assert dims_of(m) == (32, 16) def test_linear_dims_unchanged(): m = nn.Linear(16, 32) assert dims_of(m) == (16, 32) def test_conv1d_weight_transpose_aligns(): m = Conv1D(16, 16) W = m.weight.T assert W.shape == (16, 16) # 与 Linear 的 [out, in] 对齐 def test_corda_init_covers_conv1d(): class M(nn.Module): def __init__(self): super().__init__() self.attn = Conv1D(16, 16) self.mlp = nn.Linear(16, 16) model = M() covered = [n for n, m in model.named_modules() if isinstance(m, (nn.Linear, Conv1D))] assert "attn" in covered and "mlp" in covered

这四个测试守护“Conv1D 维度从 weight 读、Linear 维度不变、Conv1D 权重转置对齐、CoRDA 覆盖 Conv1D”。

八、排查清单

CoRDA 在 GPT-2 上初始化失败时按序查:

  1. 确认是否有 Conv1D:GPT-2 注意力/MLP 用Conv1D,不是nn.Linear
  2. 检查类型识别:CoRDA 是否只isinstance(m, nn.Linear),漏了Conv1D
  3. 维度读 weight.shape:别用in_features属性,Conv1D没有。
  4. 权重转置对齐Conv1Dweight[in, out],需.T转成[out, in]再参与 CoRDA 公式。
  5. 激活 hook 要挂两种类型Conv1D的激活也必须收集,否则统计为空 → NaN。
  6. 打印纳入的层:注入前打印find_linear_like,确认 Conv1D 在列。
  7. 测试守护:维度读取、转置对齐、覆盖率必须有测试。
  8. 统一抽象:用LinearLike屏蔽 Conv1D/Linear 差异,避免散落判断。

九、小结

CoRDA initialization lacks support for Conv1D layers in older models like GPT-2的根因是:CoRDA 初始化只识别nn.Linear、从in_features属性读维度,而 GPT-2 的Conv1D既不在该类型里、又没有in_features(维度藏在weight.shape且顺序为[in, out]与 Linear 的[out, in]相反),导致 Conv1D 层的激活统计缺失、初始化被跳过或维度报错。

最小修复是让 CoRDA 同时识别Conv1Dnn.Linear、维度从weight.shape读取、对Conv1Dweight转置对齐[out, in]、激活 hook 两种类型都挂;结构性改进是封装兼容两种类型的激活收集 hook、用LinearLike抽象屏蔽差异、自动探测 GPT-2 的 Conv1D;最后用测试守护“维度读取正确、转置对齐、覆盖率完整”。这样 CoRDA 才能在 GPT-2 等旧模型上完整生效。