Skip to content

26.10.09 ​

1 ​

读论文 Bridge-d3 和 CoTaM,两篇文章可以说都是在解决 VCM (Video Coding for Machine) 中,在下游任务达到相同性能时,能否在发送端实现更低的码率。

相对来说,CoTaM 这篇文章在现象的分析以及推理上会更深入一些,它论述了图像在输入 MLLM 时,在不同深度 transformer 层之间的 attention distance 分布,并且提出了三阶段模型来分析视觉 tokens 的信息与注意力在 MLLM 内部的流动。

相比于其之后提出的外挂 adapter 蒸馏,以及 loss 函数的设计,个人觉得分析模型要更有含金量。

此外,这种残差学习的思路也让我 recall 到今天学《生成式 AI 导论》时看到的 model editing 早期的直接权重混合方式,在这种 model editing 的方式下,认为一个基模 A 在不同任务和场景下后训练得到的 B 和 C,其 "习得的能力" 可以用 Δ=τB−τA 也就是权重向量直接相减表示,因此令 τD=τB+τC−τA 得到的 D,可能能够同时具有 B 和 C 的能力,当然这种方法肯定不具有泛化性。

但感觉二者之间也许有着微妙的相关性?

在 Bridge-d3 中也能看到这种论证,即论文认为神经网络编码器 ga 对于图像的操作,和 MLLM 的 CLIP 前两层对输入图像所做的操作具有相似性,因此考虑缩短路径直接连通,在这个意义下,其外挂的 adapter 是更加符合我原始认知的 "表现形式转换" (码流 > embedding)或者接近字面意义的适配器。

2 ​

根据 claude 的说法,分析这类文章 "为什么能从先前的现象/问题导出到系统设计",通常不能像数学推导一样,指望作者给出一个完整的思考链条,而是应该以约束为驱动,去思考 "在系统这些部分冻结不能改动的情况下,剩余的部分可以如何改"。例如 CoTaM 其实编解码系统本身的模块都是不能改,那么能改的也就是各模块间的连接处。

此外再加以惯例做法(也就是经验/范式),形成了 "诊断+惯例+(蒸馏)训练" 的链条,才能更合理的去理解论文的动机以及这种改法是如何想到/设计出来的。

3 ​

为什么"外挂 + 残差加"恰恰是主流,而不是野路子

你觉得它像 hack,但它其实是这个领域最主流的范式。核心原理是学增量而不是学绝对输出,好处有二:

  • 初始等价安全:adapter 若末层零初始化,输出 Δ≈0,整个系统逐比特等价于原基线。你不可能把它改得更差,只能往上加。LoRA 就是这样(W + BA,B 零初始化),NLP 的 Adapter(Houlsby 2019)、ControlNet、Prefix/Prompt Tuning、Visual Prompt Tuning 全是同一套。
  • 降低学习难度:adapter 不必重建整个表示,只需学"健康特征减去病态特征"的那个差。压缩在中高码率下本来就保住了不少低层结构(CoTaM 的 Takeaway 3 明说了这点),把它丢掉重学是浪费。

最能说明问题的是 LLaVA 那个 connector。 它本身就是一个插在 ViT 和 LLM 之间、不属于任何一方的小 MLP。这两篇论文的实际主张是:标准 connector 没被训练过去抵消压缩失真,所以要在它旁边再加一个失真专用的模块。 这样看,它根本不是"凭空外挂",而是对已有设计模式的自然延伸。

所以对"是否是经验之谈"的回答是:是,而且不止是本领域的经验,是深度学习的通用工程范式——大模型冻结 + 边界处挂轻量可训练模块。两篇论文独立收敛到几乎相同的形状(码流 → 小 transformer → 特征 → 注入冻结视觉编码器的某个中间深度),这不是互相抄,而是约束相同:

三、外挂模块到底在"补"什么

它是这个信道的均衡器(equalizer)。通信里信道有确定的传递函数,均衡器就是学它的逆。这里"信道"就是编解码器,adapter 学的是编码失真在特征空间里的逆算子。

更具体一点:

  • 解码图 x̂ 只是"自然图像流形上"的一个点估计,但压缩伪影(块效应、模糊、色偏)是结构化的,而且是 CLIP 训练时从未见过的分布。patch embedding 只是像素的线性投影,它没有任何机制识别"这是压缩伪影,不是真实纹理",于是误差在层间复利式放大。
  • adapter 的工作是:把"病态 latent"映射成一个修正向量 Δ,使 C(patch_embed(x̂) + Δ) ≈ C(x)。让冻结编码器的内部"以为"自己看到的是未压缩图。
  • 关键前提:失真必须是系统性的、可复现的(给定编解码器和码率,失真几乎是确定的)。如果是随机噪声,任何小网络都学不会它的逆。压缩失真可逆,正是因为它是确定性的。

要注意它的能力边界:adapter 不理解图像,它只是一个回归器(函数逼近器),学的是"损坏输入 → 修正量"这个映射。它之所以能小到只用一个 transformer block,恰恰因为它解的是一道很窄的题——只做纠偏,不做感知。

为什么是"加"而不是"换"或"拼接"? 因为解码结果里大部分信息是对的(CoTaM Takeaway 3 说的:压缩基本保住了鲁棒的低层结构),你要丢掉它重学是自找麻烦。CoTaM 原话就是 fuse via element-wise addition "without disrupting the crucial low-level information"。

给初学者的一套读论文心法

读这类论文,不要顺着叙述的箭头读,要问四个问题:

  1. 这一步是"约束推导"还是"惯例选择"? 如果推不出来,八成是惯例。论文用"Motivated by this observation, we propose..."这种句式时,几乎总是惯例选择。
  2. 谁被冻结、谁可训、谁能反传? 这三条确定了可行解的空间。很多"设计"其实是被约束逼出来的唯一活路。
  3. 监督信号从哪来? 如果没有外部的自动标签(这里是"未压缩图像的特征"),方案就立不住。这是最该检查的一环。
  4. 那个测量的量,是机制还是相关? attention distance 是相关指标;蒸馏 loss 才是机制的执行。别把前者当后者的证明。

4 ​

关于 "现象分析与系统架构/解决方案谁更有含金量" 的讨论

看泛化性,可复用性,有没有可能被后续的工作拿去做相邻/相关领域的研究,如果有的话,无论是方法还是分析都会很有含金量。

例如 CoTaM,它的现象分析就要比方法更有含金量,因为其方法与系统架构是在高度约束下形成的近似唯一解,更加通俗地来说我觉得就是 "不具有指导意义"。

要能被顶会接收,还要保证 "现象 + 方法 + 实验" 整一套的完整性(如 CoTaM),如果某个部分过弱很容易被审稿人攻击。