论文阅读笔记:When MLLMs Meet Compression Distortion (CoTaM)
[2509.24258] When MLLMs Meet Compression Distortion: A Coding Paradigm Tailored to MLLMs
- 论文题目:When MLLMs Meet Compression Distortion: A Coding Paradigm Tailored to MLLMs
- 机构:上海交大、东方理工、微软亚洲研究院(MSRA)
- 核心关键词:
MLLM、ICM (机器视觉编码)、Cross-Level Features (跨层特征)、Semantic Bit Allocation、CoTaM
模块一:研究背景与核心矛盾
1. 现实痛点与研究背景
在云-边协同架构中,边缘端(手机、车载芯片、监控相机)采集高分辨率图像/视频后回传云端供 MLLM(多模态大语言模型,如 GPT-4o、LLaVA)推理。有限的传输带宽与 MLLM 对高质量视觉数据的强依赖存在严重冲突。
2. 现有压缩方案的“偏科”与 ICM 背景
- 面向人眼的传统编码(HVS-centric,如 JPEG、VVC、ELIC):旨在取悦人眼感知(优化 PSNR/SSIM),主要滤除人眼不敏感的高频信号。在面对大字体 OCR、基础线条时表现好,但在深层语义理解上表现不稳。
- 面向机器的图像编码(ICM / MPEG-VCM,如 Bridge、ICMH):为传统特定任务(检测、分割)定制。这类算法往往激进地抛弃低层结构像素,纯粹保留高层语义抽象。
- 在 MLLM 上的失效:MLLM 是通用开箱即用的,既要懂微观纹理又要懂宏观意图。现有编码方式导致 MLLM 在不同子任务上的表现极度不稳定(Erratic Performance)。
模块二:核心科学发现(MLLM 特征流与失真机理)
发现 1:视觉编码器的“三阶段信息流模式”(Three-Stage Pattern)
通过分析 ViT 各层自注意力的注意力距离(Attention Distance,呈现 U 型曲线)、信息流入/流出(Inflow/Outflow)以及 PCA 特征分布,发现视觉处理遵循以下阶段:
- Stage 1:初步筛选(Shallow Layers,前 3 层):注意力分散且宽泛(Attention Distance 很高),全局快速扫描,提取初始纹理和边缘。
- Stage 2:局部信息提取(Middle Layers):注意力距离骤降,信息流收敛在相邻 Patch,提取清晰的局部几何与结构特征。
- Stage 3:全局语义整合(Deep Layers):注意力再次发散并最终汇聚到少数“Summary Tokens(汇总标记)”,丢弃底层几何,抽象出高阶语义概念。
发现 2:压缩失真引发“跨层特征(Cross-Level Features)”雪崩
- **纯低层特征(Stage 1-2)与纯高层抽象语义(Stage 3 晚期)**对压缩失真相对鲁棒(余弦相似度下降慢,深层甚至出现反弹)。因此像大字 OCR、场景分类任务不易被压缩破坏。
- 跨层特征(Stage 3 早期)在压缩后出现余弦相似度的断崖式下跌!
- 典型任务:目标计数(Counting)(如数清有几个草莓/几只狗)、微小场景文本识别(TextVQA)、材质分析(如辨别是否为针织品
Is it knitted?)、细粒度目标定位。 - 崩溃本质:这类任务要求将 Stage 2 精准的局部物理边界与 Stage 3 的全局语义做高精度合成。压缩伪影即使只破坏了微小的边缘像素,也会导致跨层融合彻底失败。
- 典型任务:目标计数(Counting)(如数清有几个草莓/几只狗)、微小场景文本识别(TextVQA)、材质分析(如辨别是否为针织品
模块三:CoTaM 架构与工作流程(端到端数据流还原)
CoTaM 并非从头重写编解码器,而是对主流神经网络编解码器(如 ELIC、DCAE)进行“外挂式增强”,核心理念是**“前端按需分配码率,后端双轨特征增强”**。
【边缘设备 / 前端】 【云端服务器】
原始图像
├─► [截取前 3 层浅层 CLIP] ─► 均值注意力 ─► 统计量化 (生成 128 bit 掩码)
│ │
└─► [基础编码器 Enc. (权重冻结)] ◄────────────────┘ (掩码动态选择 Multi-Quantizer)
│
(信道传输:压缩隐码 + 仅 128 bits 掩码)
▼
[云端接收]
├─► [基础解码器 Dec. (冻结)] ─► 重构 RGB 图像 ────► [MLLM 视觉底座]
│ (先验分支) ▲ (Patch Embedding 相加)
└─► [Adapter (1层 Transformer)] ─► 语义增强特征 ────────────┘
(隐码直接输入) │
▼
[LLM 语言模型] ─► 最终输出1. 编码端:Shallow CLIP 引导的语义码率自适应
- 开销微弱:仅前向运行冻结 CLIP 的前 3 层,提取
[CLS]空间注意力均值,生成下采样热力图(如)。 - 统计量化(
):离散化为 3 级掩码( 加码率, 维持基准, 减码率)。整张掩码仅占用 128 bits(16 字节)。 - 码率倾斜:掩码用于控制基础编码器内部的 Multi-Quantizer(多量化器缩放向量选择)。把背景狠压省下的码率,全额倾斜给关键语义区域。
2. 解码端:双轨保真机制(Dual-Track)
- 轨道一(重构先验 Reconstruction Prior):利用
Dec.解码出 RGB 图像。因为 MLLM 预训练于 RGB 空间,以此作为输入先验,牢牢锁定底层的低阶几何结构,避免特征域漂移。 - 轨道二(潜在特征适配器 Latent Feature Adapter):
- 输入:直接接收信道传来的压缩隐码(Latent code),不吃 RGB 解码图。
- 结构:极其轻量的 单层 Transformer Block。
- 融合:将提取的高维语义增强特征,直接与轨道一中 RGB 图像生成的第 1 层 Patch Embedding 进行逐元素相加(Element-wise addition)。
模块四:训练策略与踩坑经验
1. 为什么不能端到端微调?
- 冻结编解码器 + 微调 MLLM:性能收益极低。
- 冻结 MLLM + 直接微调编解码器(ELIC-CFT):训练直接崩溃(Catastrophic Failure),导致模型完全丧失基础的图文理解能力。
- 结论:保持编解码器骨干和 MLLM 全程冻结,仅训练单层 Adapter 是最稳妥高效的方案。
2. 两阶段多层级损失训练(Two-Stage Protocol)
训练只在 100 万张 CC3M 图像上迭代 5 个 Epoch:
- 阶段一(第 1 个 Epoch - 初始化锚定):仅使用低层保真损失
。最小化重建与原始 Patch Embedding 间的 MSE,强制网络先学会对齐基础结构。 - 阶段二(第 2~5 个 Epoch - 联合优化):
:浅层 Patch Embedding 约束(保细节)。 :MLLM 视觉编码器最终层 Token 输出约束(保语义)。
模块五:重要实验结论与消融分析
1. 码率节省实测(Rate-Distortion 经济账)
- 引入 128 bit 掩码后,由于背景大幅压缩,在达到完全相同下游任务精度的前提下:
- 在 ELIC 底座上实现 -35.99% 的 BD-Rate 码率节省。
- 在 DCAE 底座上实现 -31.05% 的 BD-Rate 码率节省。
- 额外编解码时间开销仅增加 2.9% ~ 7.1%,Kodak 数据集上的自然图像 PSNR 几乎无损。
2. 消融实验深度透视(图 10、11)
- w/o Adapter:性能灾难性下滑,证明其在跨空间语义校准上的决定性作用。
- w/o Rec.(移除 RGB 图像重构分支):
- 含义:完全不解码 RGB 图像,试图仅靠 Adapter 将压缩隐码直接映射送给 MLLM(类似于传统 ICM)。
- 结果:在 TextVQA 和 SeedBench 等细粒度细节任务上性能发生雪崩式下跌。证明 RGB 重构先验对于抵抗域漂移、提供物理细节锚点不可或缺。
- 多层级 Loss 消融:仅用高层 Loss 丢失微观细节,仅用低层 Loss 缺乏宏观语义一致性,两者结合最优。
模块六:通用性、局限性与扩展
1. 通用性与即插即用表现
- 同源视觉底座(零样本即插即用):针对 LLaVA-1.5-7B 训练的 Adapter,可直接无缝插接到 LLaVA-1.5-13B 上使用(因两者均使用 CLIP-ViT-L/14 底座)。
- 异构视觉底座(方法论通用):换用 SigLIP(LLaVA-OneVision)或 InternViT(InternVL2)时,因特征维度不同,需要重新微调 Adapter,但训练仅需数小时,且展现出一致的高增益。
2. 高分辨率与视频扩展
- 高分辨率(Hierarchical Guidance):针对切块(Patch-based)机制,将全局缩略图生成的 Global Attention 与各局部切块的 Local Attention 相加融合,兼顾全局宏观感知与局部细节。
- 视频 MLLM:主流视频大模型均采用稀疏关键帧采样(如抽 16/32 帧),因此 CoTaM 可直接以单帧独立编码方式无缝切入视频大模型传输管道。
一句话核心总结
CoTaM 揭示了跨层特征是压缩破坏 MLLM 性能的元凶;通过前端仅 128 bit 的浅层 CLIP 掩码动态压榨冗余码率,并在云端结合“RGB 重构先验 + 单层轻量 Adapter”进行跨层补偿,以极低的改造成本换取了超过 35% 的端到端带宽净节省。
