PAPERARBOR / SINGLE
OPLD 精读:把教师的图解指导变成学生的内部计算
从一道形状变换题走通 OPLD:连续向量怎样反馈,教师如何分别提供轨迹参照与学生路径评分;用消融和干预区分收益、实际作用与可解释性边界。
目录 / 跳转到章节
01 · 先抓住问题:老师能看解题过程,学生考试只能看题
一张图、一道问题,老师训练时还能看解题文字和中间图,学生真正答题时却没有这些帮助。OPLD 研究的是:怎样把这些额外指导转成学生内部可用的计算,让学生只看原题也能回答?
它的办法是让学生先用自己的模型产生一串连续向量,再生成答案。教师提供两种反馈:一份自己的内部轨迹作参照;另一份是在学生已经走到的位置,比较接下来各个词应该有多大概率。
先记住两个区别:内部轨迹不是文字 CoT,也不是中间图片;教师的“轨迹参照”和“给学生评分”是不同前向过程。读懂这两点,才容易读懂后面的 Enc–Dec 和两种损失。
[S1] Method, pp.3–5; Tensor-level path, pp.11–12 · 原文第 4 页 ↗
按问题选择阅读路径
固定阅读 arXiv:2607.28154v1,首发/版本日期均为 2026-07-30,完整 PDF 22 页。以下是原文解读,不是独立复跑结果。
论文身份、材料核实与代码状态
正式标题:OPLD: On-Policy Latent Distillation for Multimodal Reasoning。作者 Shoutai Zhu、Tianyang Xu、Bin Sun、Mingyuan Xu、Yu Liu、Qinzhen Guo,署名机构 ByteDance。作者采用 arXiv 元数据;首页将 Bin Sun 排作 Sun Bin,将 Mingyuan Xu 排作 Xumingyuan。用户 PDF 与固定版本 PDF 的 SHA-256 相同,完整哈希见来源章。论文与元数据未给出本次可核实的官方实现或权重;这不等于证明它们不存在。
[S1] Versioned arXiv metadata; PDF p.1; retrieved PDF hash · 原文第 1 页 ↗
02 · 从一道形状变换题看信息差
Figure 8 给出一道形状变换题:对黄色形状先水平镜像,再依次平移,最后选择匹配的选项。学生看到原图、操作要求和选项,必须自己跟踪形状和位置的变化。教师训练时还看得到说明文字和每步中间图,信息更加充分。
[S1] Figure 8, PDF p.18 · 原文第 18 页 ↗
学生看到的题图:原始黄色形状与候选项
教师额外看到的中间图:镜像与平移后的状态
这两组图就是信息差:学生需要从操作指令自行跟踪状态;教师可以利用给定的中间状态和解释文字。OPLD 在训练中利用后者提供指导,测试时并不把这些中间图交给学生,也不输出这些图作为推理步骤。
[S1] Figure 8, PDF p.18; Problem Setup, p.3; Inference, p.12
学生视图 xˢ:部署时能拿到什么
原始问题 + 主图。示例的镜像、平移指令是题目的一部分,学生也能看;解题 rationale 和辅助图才是教师独有的信息。
教师视图 xᵀ:训练时多给什么
原始问题 + 主图 + 解题文字 + 辅助图。教师与学生从同一个底座初始化;这里的优势来自输入信息,不是必须换成更大的模型。
[S1] Problem Setup, Eqs.1–2, p.3; Implementation, p.10; Figure 8, p.18 · 原文第 3 页 ↗
显式视觉 CoT 可以在测试时继续写步骤、裁图或生成中间图,但需要对应的外部过程。作者希望把训练期的指导转进连续内部状态。与让 latent 模仿某张辅助图的压缩特征相比,OPLD 更关心这些状态是否真的推动后续答案生成。
上述方法动机来自作者的 Introduction / Related Work(pp.1–3),不是本页重新比较了所有相关方法。是否学到透明的人类逻辑步骤,仍要留给实验与限制章检验。
03 · 先认清对象,再看方法
hidden state:模型当前算出的状态
这是某个位置最后一层的连续向量 h,概括模型到该位置的计算结果。它不是已解码的文字。
latent code:用来反馈和对齐的向量
Enc 把 h 投影为 z。论文默认每个 z 是 2048 维;一个槽对应一次反馈,不对应一个可读单词或已命名的逻辑步骤。
embedding:语言模型能接收的输入
Dec 把 z 映回输入宽度,得到 e,再写入序列中的 latent 槽。z 与 e 的职责不同,不能在教师评分时随意互换。
rollout:当前学生实际生成的答案
记为 ŷ。它来自当前学生,可能正确,也可能错误。教师接下来给这条路径反馈,而不是只让学生学习一份预先写好的教师答案。
[S1] Eqs.4–10, pp.3–4; Tensor-level path, pp.11–12 · 原文第 4 页 ↗
两种反馈各管一件事:latent cosine 让学生向量的方向靠近教师参照;token 分布蒸馏让学生在自己的答案前缀上接近教师的词概率。论文用二者组合改善结果,但没有 cosine-only 对照,不能声称每个组件的独立作用都已被拆清。
[S1] Eqs.15–20, p.5; Table 2, p.7; Discussion, p.12 · 原文第 5 页 ↗
04 · 先看整体框架,再拆向量回路
先走学生的路径。原图和问题经原生多模态 chat template 进入模型;在 assistant generation prompt 与答案之间预留 latent 槽。下面的回路在答案生成前运行。
[S1] Recursive Latent Reasoning, pp.3–4 · 原文第 4 页 ↗
读图顺序:先看右侧三个训练阶段:有解题指导的教师预热、只看原题的学生预热、冻结教师后的蒸馏。再沿绿色 Deploy Student 箭头看左侧:部署只保留学生,它用 Enc–Dec 回填 latent 槽,完成内部循环后生成答案。橙色监督线发生在训练中,部署时不需要教师或辅助图。
[S1] Figure 2, PDF p.4; Three-Stage OPLD Training, pp.4–5
局部放大:一次向量反馈到底做什么
① 从槽前读出状态
第一轮读 assistant prompt 末端的最后层 hidden state;后续轮次读当前槽前的位置。输入是当前已有序列的计算结果,输出是 H 维向量 h。
② Enc 把状态投到 code 空间
编码器用可训练 MLP 与归一化生成 D 维向量 z。作者通过这个显式接口学习和校准内部表示,而不是直接拿原 hidden state 对齐。低维并不自动赋予“推理语义”;对应消融见后文。
[S1] Eqs.6–7, p.4; Table 2, p.7; Discussion, p.12 · 原文第 4 页 ↗
③ Dec 映回输入并继续计算
解码器把 z 映回 H 维 embedding e,写入该槽,再计算下一轮。后面的状态因此依赖前面回填的向量。这里没有把向量转成词,也没有生成一张新图片;完成固定槽数后才开始回答。
把回路读成一条公式
下面两式只描述“状态变 code,再变输入”的接口;完整循环还包括把 e 回填后重新前向。
pk 是第 k 个槽的位置,L 是最后一层,h 属于模型 H 维 hidden 空间;z 是 D 维连续 code,e 回到 H 维输入 embedding。第一个 code 来自 assistant prompt 的末端;回填后再计算下一个 code。默认 K=8、D=2048,不是 8 个离散词,也不是生成 8 张图片。
展开 Enc–Dec 的投影、归一化及原始架构图
W₁ 到 W₄ 是可训练投影,LN 是 LayerNorm,GELU 是非线性。Enc 的输出有 LN,Dec 的最终输出按原式没有再加 LN。作用是建立可以校准的 latent 接口;低维投影本身并不保证 code 自动获得“推理语义”。MLP 中间宽度与新增参数数目未在论文中列明。
05 · 一次蒸馏:学生先走,教师给两种反馈
这章只讲第三训练阶段:教师和学生已分别预热,随后教师冻结、学生继续学习。一次更新要分清以下三条前向路径;其中学生路径同时还用于计算可训练的学生词概率。
[S1] Eqs.13–17, p.5; Algorithm 1, p.15 · 原文第 5 页 ↗
蒸馏框架:同一学生轨迹上的两种监督
沿原图下支路看:当前学生从原题生成 latent 和答案;上支路的冻结教师利用训练期指导,提供 latent 参照与 token 分布。两条橙色监督线分别约束内部向量和答案概率。图是概览,精确的教师评分输入在后面的三个前向中展开。
[S1] Figure 3, PDF p.6 · 原文第 6 页 ↗
三个前向:同样的槽结构,不同的输入与用途
① 学生先生成自己的向量和答案
原题 xˢ → 学生 Enc / Dec 递归 → 学生 codes zˢ → 学生答案 ŷ
- 输入
- 只有原始图像与问题;不加入教师 rationale 或辅助图。
- 发生什么
- 当前学生先完成内部反馈,再 greedy decode 答案。这就是 on-policy:访问的是当前学生会产生的路径,不要求随机采样。
- 交给后续
- 保留学生 codes 和答案序列。下一步对齐 codes;评分步骤使用这些 codes 与相同学生答案前缀。
[S1] Eq.13, p.5; Student rollout, p.11; Algorithm 1, p.15 · 原文第 5 页 ↗
② 教师独立生成轨迹,作向量参照
特权输入 xᵀ → 教师 Enc / Dec 递归 → 教师自己的 codes zᵀ
- 输入
- 原题加 rationale 与辅助图。
- 发生什么
- 冻结教师沿自己的递归过程生成 codes。学生第 k 个 code 向教师第 k 个 code 作 cosine 对齐。
- 这里不做
- 不用教师的最终硬答案当蒸馏标签。相同 k 表示递归深度相同,不保证语义步骤相同。
[S1] Eqs.14–15, p.5; Tensor-level path, pp.11–12 · 原文第 5 页 ↗
③ 教师接收学生 codes,沿学生前缀评分
停止梯度的 zˢ → 教师 Dec → 教师输入 embedding;再结合 xᵀ 与学生答案前缀 → 教师词概率 pᵀ
- 沿用什么
- 学生生成的 codes 和答案前缀;不改走教师自己的 zᵀ 轨迹。
- 接口区别
- 教师 Enc 被绕过。这里用教师 Dec 解码 zˢ,而非直接送入学生 Dec 产生的 eˢ。codes 相同,不意味着两边 embedding 相同。
- 监督哪里
- 教师 pᵀ 与学生 pˢ 在同一答案前缀上比较,形成 token 分布反馈。教师与其输出均停止梯度,只更新学生。
[S1] Eqs.16–17, p.5; Teacher scoring / Why decode, pp.11–12 · 原文第 12 页 ↗
回到形状题:“教师参照”回答的是有额外图解时,教师内部会形成什么向量;“教师评分”回答的是学生已经这样表示题目、已经写了这些字,下一词的概率应该怎样调整。二者都不是强制学生复制教师的完整硬答案。
[S1] Tensor-level path, pp.11–12; Case Studies, pp.14–15 · 原文第 12 页 ↗
反馈 A:方向对齐,但不替每个槽命名
Cosine loss 对应 batch 中每个同序号的 code,比较方向是否接近;方向越接近,1−cos 这项损失越小。教师向量是固定目标。独立预热可能让坐标漂移,所以这里是向教师空间校准,而不是假设两者一开始就完全相同。
B 是 batch size,K 是递归槽数,S/T 为学生/教师,sg 表示停止梯度。Cosine 主要比较方向,减少幅值差异的影响。相同 k 只保证相同递归深度,不保证两者正在做相同的语义子步骤。独立全参数预热后坐标可能漂移,因此它是向冻结教师空间校准的目标,不是“预先同坐标”的数学保证。
[S1] Eq.15, PDF p.5; Warmup compatibility / Slot-wise alignment, PDF pp.11–12
反馈 B:同一前缀上的词概率,而非一个正确词标签
在答案的每个位置,教师和学生各给出候选词的概率。论文选取教师概率最高的 128 个词,计算 teacher → student 方向的 forward KL 型项。每个候选的影响按教师概率加权,使学生学习教师对候选词的相对偏好。下面的求和是对候选词,不是只惩罚学生实际选出的那个词。
ŷ 是学生生成的答案,|ŷ| 是其 token 数;𝒱ᵀₜ 为教师在该位置概率最高的 k 个词,本配置 k=128。公式方向是 teacher → student 的 forward KL 型项,监督整个选中词集的概率,而非只用教师 argmax 作标签。它不需要策略梯度奖励。
展开教师/学生条件分布,以及 top-k 归一化的复现缺口
pᵀ / pˢ 是位置 t 的下一 token 概率向量;φ 冻结,θ 更新。xᵀ 含特权证据,xˢ 不含。两边 codes 和离散答案前缀相同,但 decoder、模型参数与输入视图不同,因此不能理解成两边 embedding 或全部 hidden states 都相同。
[S1] Eqs.16–17, PDF p.5; Algorithm 1, PDF p.15; Tensor-level path, PDF pp.11–12
Eq.19 写原概率在 top-k 支持集上的截断求和,未写重归一化;附录又用 DKL 简写,无法确认实现是否重新归一化。不能给截断项自动套用完整 KL 的非负性。复现时需核实 softmax、gather、renormalize 的顺序。
组合目标:校准内部接口与输出行为
系数控制两项损失在优化中的相对权重。当前组合有消融支持,但论文没有证明它是对所有任务通用的最优权重。
正文 Eq.20 使用一般权重 λtext 与 λlat;附录最终配置将 text 权重取为 1,latent cosine 权重取为 0.05。标准答案 CE 只用于前两阶段;最后配置不加 policy-gradient loss 或任务专属 reward。
[S1] Eq.20, PDF p.5; Table 4, PDF p.11; Complementary objectives, PDF p.12
预热阶段的标准答案 CE 与这里的蒸馏目标不同。当前学生选出的离散词序列用于规定评分位置;greedy 选择本身不提供连续梯度。训练依靠学生概率与连续 latent 路径的可训练计算,最终配置没有 policy-gradient loss 或任务 reward。
[S1] Algorithm 1, p.15; Tensor-level path / objectives, pp.11–12;梯度路径含义为机制解释 · 原文第 12 页 ↗
06 · 三阶段训练:先会使用槽,再校准轨迹
阶段 1:教师预热
教师看特权视图,通过标准答案的交叉熵训练全参数,学习怎样把丰富证据用于回答。rationale 在输入里,损失只直接标注答案。
阶段 2:学生预热
学生只看原题,同样用标准答案训练全参数,先学会使用连续反馈结构。这样蒸馏从已有的学生计算协议开始。
阶段 3:冻结教师,蒸馏学生
当前学生自己生成,再接受两种反馈。更新学生底座和 Enc / Dec;教师的参照空间与评分参数均固定。
[S1] Eqs.11–20, pp.4–5; Table 4, p.11; Algorithm 1, p.15 · 原文第 4 页 ↗
“答案以外不算直接标签损失”不等于 latent 不学习。答案概率由前面的连续计算影响,答案 CE 仍能训练底座与 Enc / Dec;mask 掉的是 prompt / latent 位置的直接标签。
[S1] Eqs.11–12, pp.4–5; Implementation, p.10;mask 的计算含义为机制解释 · 原文第 4 页 ↗
展开预热的 answer-only CE 公式
这是把原文教师与学生两式合写的说明式:ω 对教师是 φ、对学生是 θ,x 与 z 取各自视图和轨迹;y* 是标准答案,N 为其 token 长度。预热用标准答案前缀,与蒸馏阶段的学生前缀不同。
怎样防止教师直接看到答案
数据来自 Zebra-CoT 与 Visual-CoT。作者用 GPT-5.4 API 检查教师上下文:直接显示答案、标出正确选项或给出完成解法时删除;只提供中间证据、仍需综合推理时保留,不确定则倾向保留。随后检查格式、图像引用和重复 ID。过滤是在控制教师捷径,不是给模型另加一种推理损失。
[S1] Training Data / Data Cleaning, p.9 · 原文第 9 页 ↗
| 样本来源 | 清洗前(样本) | 清洗后(样本) |
|---|---|---|
| Zebra-CoT | 178,695 | 129,463 |
| Visual-CoT | 88,257 | 88,257 |
| 合计 | 266,952 | 217,720 |
输入信息差也体现在数量上:学生平均可见 0.97 张图,教师 3.08 张;平均辅助图为 2.11 张。6,580 个样本(3.0%)没有学生图像,不能把整个集合都当作图像问答。学生/教师 prompt 均长 147.05 / 1,219.34 字符,不是 tokens。
[S1] Table 3, PDF p.10 · 原文第 10 页 ↗
展开完整配置:学习率、batch、长度、精度与未公开项
| 配置 | 教师预热 | 学生预热 | OPLD 蒸馏 |
|---|---|---|---|
| 初始化 | Qwen2.5-VL-7B-Instruct | Qwen2.5-VL-7B-Instruct | 两份独立预热 checkpoint |
| 可训练参数 | 全参数 | 全参数 | 仅学生(含 Enc / Dec) |
| 损失 | 答案 CE | 答案 CE | top-128 forward KL + 0.05 cosine |
| 学习率 | 语言模型/merger 1×10⁻⁵;视觉 2×10⁻⁶ | 语言模型/merger 1×10⁻⁵;视觉 2×10⁻⁶ | 1×10⁻⁶;视觉单独 LR 未列 |
| Epoch / 全局 batch | 1 / 16 | 1 / 16 | 1 / 未列 |
| weight decay / schedule / warmup ratio | 0.1 / cosine / 0.03 | 0.1 / cosine / 0.03 | 未列 / 未列 / 未列 |
| latent slots / dimension | 8 / 2048 | 8 / 2048 | 8 / 2048 |
| 最大生成长度 | 512 tokens | 512 tokens | 256 tokens |
| 最大 prompt 长度 | 未列 | 未列 | 8192 tokens |
| 精度 / 梯度检查点 | BF16 / 开启 | BF16 / 开启 | BF16 / 开启 |
预热每设备 batch 1,以梯度累积达到全局 16;BF16、TF32、SDPA、Liger 与 non-reentrant checkpointing。图像像素区间 100,352–1,317,120;正文蒸馏使用 8 张 NVIDIA B200。没有各阶段 GPU 时、吞吐、峰值显存及新增适配器参数量,缺失配置不从预热自动沿用。
[S1] Implementation, p.10; Table 4, p.11; Experimental Setup, p.5 · 原文第 10 页 ↗
07 · 测试时留下什么:只保留学生与内部反馈
原图与问题 → 原生多模态模板 → 学生 Enc / Dec 递归反馈 → 完成默认 8 个槽 → greedy 生成答案
教师、教师 decoder、rationale 与辅助图均被移除。学生保留自己的 Enc / Dec 和底座。前面形状题的操作要求仍是原题条件;模型不会在测试时向教师索取那几张中间图。
[S1] Inference, p.12; Eqs.6–10, p.4; Figure 8, p.18 · 原文第 12 页 ↗
成本边界不写显式 CoT,不代表答案前没有计算。论文描述每步重新前向,没有公开 KV cache 复用或实测延迟,也没研究自适应停止与更长链的 test-time scaling。因此可以确认部署少了一类外部信息依赖,不能给出已测得的倍数加速。
[S1] Recursive Latent Reasoning, p.4; Inference, p.12;成本解释为分析 · 原文第 12 页 ↗
08 · 先读收益和例外,再查完整主表
以下都是作者用 LMMS-Eval、greedy 和官方任务配置报告的分数。先看基础模型、SFT 与 OPLD 在三个任务上的关系;完整七项主表随后保留。测试只给学生原始输入,教师特权不进入部署评测。
[S1] Experimental Setup, p.5; Implementation, p.10; Table 1, p.7 · 原文第 7 页 ↗
怎么读:OPLD 的 V⋆、HR-8K 高于基础模型和 SFT;HallusionBench 则低于 SFT。实验首先支持当前方案在报告任务上的系统收益,不足以把每个涨分分配给某个模块。
[S1] Table 1, p.7;模块归因边界为分析 · 原文第 7 页 ↗
展开完整七项主结果与其他 latent 方法
各列是对应任务 overall / 汇总分(%,越高越好),不要把不同任务加成未经定义的总能力分。其他方法按论文命名,未确认其工具预算、槽数和训练成本全部一致。
| 模型/方法 | V⋆ | HR-4K | HR-8K | MMStar | Seed2+ | BLINK | Hall. |
|---|---|---|---|---|---|---|---|
| Qwen2.5-VL-7B | 71.20 | 65.12 | 58.00 | 59.70 | 65.31 | 53.60 | 56.57 |
| Qwen2.5-VL-7B + SFT | 73.82 | 68.00 | 60.75 | 61.36 | 69.38 | 56.56 | 66.67 |
| Qwen2.5-VL-7B + 32B OPD | 73.30 | 65.25 | 55.50 | 51.52 | 67.72 | 39.35 | 38.90 |
| Monet | 80.10 | 67.37 | 64.37 | 60.33 | 65.88 | 50.71 | 56.36 |
| HyLaR | 83.77 | 75.00 | 70.50 | 62.00 | 70.32 | 57.14 | 63.68 |
| OPLD(预热后蒸馏学生) | 85.86 | 73.75 | 71.37 | 63.86 | 70.88 | 58.56 | 65.19 |
协议缺口:原文未逐行给出 task commit、精确 split、样本数、全部提示和 checkpoint revision;没有置信区间或多种子结果。本页保留这些缺口,不把作者分数当作独立复跑。
对基础 Qwen,OPLD 在这里每项都更高;V⋆ 为 71.20 → 85.86,HR-8K 为 58.00 → 71.37,按表值相减分别是 +14.66 / +13.37 个百分点。对 SFT,改善覆盖六项,但 HallusionBench 是 66.67 → 65.19,即 −1.48 个百分点。这使“蒸馏全面提高幻觉鲁棒性”成为过强结论。
来源:[S1] Table 1, PDF p.7;差值为按表值计算的解释性推导。和 latent 方法比较也有例外:HyLaR 的 HR-4K overall 是 75.00,高于 OPLD 的 73.75;V⋆ Spatial 是 85.53,高于 81.58。Laser 的 HallusionBench 是 67.72,也高于 OPLD 的 65.19。更强商用模型与有工具的 agent 在若干项仍领先,因此“部分指标为所报 latent 方法最佳”比“全局最强”更准确。跨方法的增益只能说明整套方案的关联结果,不能当作 Enc–Dec 或 cosine 的单独因果证据。
来源:[S1] Table 1, PDF p.7。细粒度:FSP 的提升比 FCP 更显著
HRBench 保留原表 FSP / FCP 标签;本论文未展开它们的定义,这里不擅自补写任务语义。HR-4K 的 FSP 从基础模型 75.75 升到 90.00,FCP 从 54.50 升到 57.50;HR-8K 的 FSP 为 63.00 → 87.75,FCP 为 53.00 → 55.00。V⋆ Attribute 为 73.04 → 88.70,Spatial 为 68.42 → 81.58。作者将这些结果解释为 latent 组织细粒度视觉证据更有效,但它们没有直接可视化内部信息整合过程。
来源:[S1] Table 1, PDF p.7; Main Results, PDF p.6。特权教师参照:接近的是域内差距
在约 5K held-out 域内样本上,带特权输入的预热教师准确率 72.6%,原始输入的预热学生 29.4%,OPLD 学生 65.4%。作者报告学生增益 36.0 个百分点,缩小最初教师–学生差距的 83.3%,剩余 7.2 个百分点。这是域内参照,不是前述外部 benchmark 的总分,也不是教师的理论上界;论文未给出该 held-out 集合的完整拆分协议。
来源:[S1] Privileged Teacher Reference / Figure 5, PDF p.14。09 · 分三层检验证据:训练方案、接口、真实使用
主结果只能告诉我们系统表现变了。下面逐次收窄问题:整个训练流程是否有效?某类结构是否有帮助?已经学出的向量是否实际参与答案?这三类证据的归因强度不同。
A · 换训练方案:先看整套流程
Fig.4 / Table 5 使用同学生底座与数据,作者称训练 epoch 或 optimizer steps、batch 和学习率日程匹配。下表使用四项 overall 分数;“教师预热”在这里去掉了特权输入再评测,不能与域内 72.6% 的特权教师直接对照。Standard OPD 的教师换成 Qwen2.5-VL-32B,也改变了初始化与轨迹监督条件。
来源:[S1] Effect of Training Strategy, PDF pp.6–7; Table 5, PDF p.13。查看训练方案四项完整分数
| 策略 | V⋆ | HR-4K | HR-8K | MME-RW-Lite |
|---|---|---|---|---|
| 基础 Qwen | 71.20 | 65.12 | 58.00 | 45.75 |
| SFT | 73.82 | 68.00 | 60.75 | 46.33 |
| 仅学生预热 | 73.82 | 66.63 | 58.00 | 48.88 |
| 教师预热后移除特权输入 | 73.30 | 64.75 | 56.38 | 43.98 |
| 32B 标准 OPD | 73.30 | 65.25 | 55.50 | 32.83 |
| 完整 OPLD | 85.86 | 73.75 | 71.37 | 53.36 |
因果边界这些对照支持整套 OPLD 更有效,也支持去掉特权输入会造成分布迁移;但标准 OPD 同时改变了教师规模、学生预热及 latent 对齐等条件,不能仅凭它失败就断言“大教师无用”或“失败完全由缺少 latent loss 造成”。
B · 改槽、接口和 loss:靠近机制问题
查看槽数、接口和 loss 的完整消融表
| 分组/变体 | V⋆ | HR-4K | HR-8K | MME-RW-Lite | Avg. |
|---|---|---|---|---|---|
| 槽数 K=0 | 75.39 | 65.50 | 58.13 | 50.44 | 62.36 |
| 槽数 K=4 | 78.53 | 72.62 | 71.75 | 51.90 | 68.70 |
| 槽数 K=8 | 85.86 | 73.75 | 71.37 | 53.36 | 71.09 |
| Raw hidden states | 78.53 | 71.50 | 67.00 | 48.41 | 66.36 |
| Enc–Dec adapter | 85.86 | 73.75 | 71.37 | 53.36 | 71.09 |
| Reverse KL + PG + cosine | 74.87 | 71.37 | 67.75 | 49.92 | 65.98 |
| Top-k forward KL only | 78.53 | 63.88 | 58.63 | 48.20 | 62.31 |
| Top-k forward KL + cosine | 85.86 | 73.75 | 71.37 | 53.36 | 71.09 |
第一,K=8 的四项平均最高,但 HR-8K 上 K=4 是 71.75、K=8 是 71.37,因此不能推出“越长越好”。第二,Enc–Dec 优于 raw hidden,但结果没有区分投影空间、额外可训练容量和归一化各自的作用。第三,在当前配置中加 cosine 比 KL-only 更好,支持两类信号互补;reverse KL + PG + cosine 同时改了 KL 方向与优化方式,不能把差距全部归于 reverse KL。
来源:[S1] Tables 2 / 6, PDF pp.7,13。C · 不重新训练,直接扰动已经学出的向量
这组实验保持模型参数、原始输入与解码配置不变,直接改变答案生成前使用的 latent 状态,不额外训练。与重新训练 K=0 相比,它更直接回答“已经学出的轨迹是否参与输出”。
来源:[S1] Latent Intervention Analysis, PDF pp.13–14。[S1] Table 7, PDF p.13; Latent Intervention Analysis, pp.13–14 · 原文第 13 页 ↗
查看推理期干预的四项分数
| 推理期状态 | V⋆ | HR-4K | HR-8K | MME-RW-Lite | Avg. Drop(百分点) |
|---|---|---|---|---|---|
| 原始 latents | 85.86 | 73.75 | 71.37 | 53.36 | — |
| 加入随机噪声 | 76.96 | 64.12 | 57.50 | 48.62 | 9.29 |
| 全部置零 | 76.44 | 59.62 | 51.37 | 48.51 | 12.10 |
| 跨样本交换轨迹 | 65.45 | 54.63 | 48.25 | 44.61 | 17.85 |
证据强度交换轨迹仍使用模型自己产生的合法表示,却破坏其与当前样本的对应,下降最大。这比仅置零更支持“轨迹携带输入相关信息并影响答案”。但它并不能证明信息一定是可解释的逻辑推理,仍可能混合感知特征、任务线索与答案倾向;也不能给每个槽命名为一个人类解题步骤。
回到形状题:教师选错,学生为何仍能选对?
Figure 8 的形状变换例子里,预热教师回答 A、预热学生回答 D,都被标为错误,而蒸馏学生回答 C、标为正确。作者解释:训练使用的是教师在学生路径上的软分布和教师 latent 目标,并非教师独立 greedy rollout 的硬答案。教师 argmax 错了仍可能为正确 token 分配有用概率。这是合理机制解释,但论文没有展示该例子的概率向量或 latent 内部语义,案例不能单独验证解释。
来源:[S1] Figure 8, PDF p.18; Case Studies discussion, PDF pp.14–15。10 · 方法有效,哪些结论仍不能推出?
作者明确承认的边界
共享底座、Enc–Dec 初始化、维度与槽顺序仅提供共同结构起点;独立全参数预热后 latent 坐标并无严格等价保证。同深度对齐是一种时间归纳偏置,而非语义一一对应定理。作者也明确指出,干预证明轨迹有实际作用,却不确立每个槽或维度的可解释含义,并把 learned mapper、optimal-transport matching 与逐槽 probing 列作后续方向。
来源:[S1] Warmup compatibility / Slot-wise alignment limitation, PDF pp.11–12。本次阅读的技术评估
- 教师特权不等于可学习信息。如果辅助图提供原图里无法恢复的证据,学生只能学训练分布上的规律,不能凭蒸馏创造缺失观测。需要按“原图可推断 / 新增观测”区分收益来源。
- 清洗不是泄漏已消失的证明。过滤合计统计没有人工审计误差或独立泄漏率。定性拼图例子还展示完整场景作为特权图;它是否仍符合“只提供中间证据”的规则、是否属于清洗后保留样本,未明确标注,值得核实。
- 机制拆分还不足。没有 cosine-only、文字-only 教师、help-image-only 教师、换用学生 Dec 进行教师评分等直接对照;无法分别量化特权信息类型和 decoder 选择的贡献。
- 统计与外推有限。主表没有置信区间、重复随机种子或跨底座规模检验;训练数据重复 ID 为零不等于验证了 benchmark 内容级去污染。
- 计算与可复现性有限。未核实官方代码/权重;缺少蒸馏 batch、optimizer 详细设置、top-k 归一化约定、评测配置版本和延迟测量。不能把“少工具”直接写成已测得的速度优势。
11 · 用三个问题检查自己是否读懂
方法层面:OPLD 的关键是把教师的额外证据放在训练视图里,同时让蒸馏监督落在学生自己的路径上。低维 Enc–Dec 给两个模型提供可校准接口;教师目标轨迹校准表征,教师对学生轨迹评分校准回答。
证据层面:KL-only 与组合 loss 的对照支持 latent 对齐的实际价值,推理期跨样本交换则更直接支持轨迹内容被模型使用。它们共同支撑功能性 latent 计算,但还不能把“抽象推理”解释成每个槽都承载透明的逻辑步骤。
来源:[S1] Method, PDF pp.4–5; Tables 2/7, PDF pp.7,13; Discussion, PDF p.12。如果教师更有信息,为什么不在测试时直接用教师?
测试时拿不到教师训练视图里的 rationale 和辅助图。直接移除这些输入会改变教师输入分布;OPLD 则始终让学生用原题训练和部署,再用教师反馈改变学生参数。
[S1] Problem Setup, p.3; Training Strategy, pp.6–7 · 原文第 3 页 ↗
为什么教师评分要用学生 codes,却用教师 decoder?
前者把评分定位在学生当前轨迹上,后者把这些 codes 解释为教师自己的输入 embedding。绕过的是教师 Enc;替换为学生 embedding 或教师自己的 codes 都不是附录所述评分接口。
把 latent 交换后掉分,能证明每个槽都是一条逻辑步骤吗?
它支持轨迹带着当前样本有关的信息,并参与答案生成;不能区分这些信息究竟是感知线索、任务状态还是答案倾向。槽序只提供递归深度对应,作者也没有给逐槽语义保证。
[S1] Slot-wise alignment, p.12; Table 7, pp.13–14 · 原文第 13 页 ↗
准备复现:从张量接口到评测的检查顺序
若要复现,先落实以下可检查结果;这是本次阅读提出的实验顺序,不是作者已执行的额外实验:
- 固定输入数据与清洗决策文件,复核辅助图是否直接暴露答案,以及域内 held-out / 外部 benchmark 的内容重叠。
- 先通过一个 batch 验证连续反馈:槽前 hidden → Enc → Dec → 回填;核实 mask 只去掉直接标签,不切断学生的连续梯度。
- 逐项打印教师评分接口,确认使用 detached student codes 经教师 Dec,而不是教师自己的 codes 或学生 embeddings。
- 确认 top-k 求和的归一化、mask、长度平均及 teacher stop-gradient;再跑 KL-only / KL+cosine,并补 cosine-only 和 decoder 选择对照。
- 锁定 LMMS-Eval task/revision、split 与 greedy 配置,记录多次运行的不确定性;加入原始/置零/噪声/交换 latent 干预及统一延迟测量。
12 · 来源、覆盖与图像署名
- Zhu et al. · OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1首次提交与版本日期:2026-07-30。版本化 PDF · 原文 HTML。本文页码全部指 PDF 的 1-based 文件页码;原论文未编号的章节使用其英文标题定位,公式、图、表保持原编号。
阅读与证据复核日期:2026-10-10。覆盖 PDF 全文及补充材料;重要数字按原表精度记录,差值明确标为推导,分析判断另设标记。本文没有复现模型,也没有对相关工作的原论文逐篇精读,相关方法介绍以 OPLD 自己的叙述为范围。
原图 Figure 2 / 3 署名 Zhu 等作者,来源为 2607.28154v1。PDF 带有论文版权声明,arXiv 使用 non-exclusive distribution license;这不构成对第三方重新许可图片的开放授权。本文保留署名用于研究解读引用,PaperArbor 的 MIT 代码许可不覆盖论文原图。两张无损 PNG 为保留细字与连线,分别约 456 / 400 KiB,超过常用压缩目标;图片均内嵌,不依赖远程资源。
证据索引:本页完整离线证据索引(仓库另保留 data/evidence/opld-2607.28154.json)。哈希:969774c6fcdfb554d297ce80ff14ac11a642aa9663989b4336be17c95a93aba0。离线单文件正文、目录、图与公式可读;本页的静态证据与查证搜索也已内嵌;返回知识库需要目录,原文外链需要联网。
证据索引
完整 22 页 arXiv:2607.28154v1:方法、训练数据与过滤、实现、全部实验与消融/干预、定性案例。用户 PDF 与版本化 PDF 的 SHA-256 相同。重要事实、教学推导与分析分别登记;官方代码/权重、评测版本、top-k 归一化及延迟仍未核实,未独立复跑。
展开全部 95 条证据(断网可查)
- 原文事实
正式标题、完整作者、ByteDance、首发及v1日期2026-07-30;PDF共22页;首页作者拼写与元数据存在排版差异。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
arXiv abs/2607.28154v1; PDF metadata and p.1 - 分析判断
用户提供PDF与版本化arXiv PDF均为SHA-256 969774c6fcdfb554d297ce80ff14ac11a642aa9663989b4336be17c95a93aba0。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Retrieved local and primary PDF SHA-256 - 原文事实
OPLD包含输入不对称的同底座教师学生、递归latent推理、教师自身latent目标与使用学生codes的教师评分两条监督路径。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Method; Additional Method Details, PDF pp.3–5, 11–12 - 原文事实
作者将显式视觉轨迹与特征代理监督作为动机,主张用CoT诱导的模型内部轨迹监督latent;图形变换例子依据Figure 8。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Introduction / Related Work, PDF pp.1–3; Figure 8, PDF p.18 - 原文事实
教师学生均初始化于Qwen2.5-VL-7B-Instruct;同底座、同latent结构,不同信息视图;加入适配器后的总参数量未单列。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Additional Implementation Details, PDF p.10; Table 4, PDF p.11 - 分析判断
组合可解释为表征与行为校准;缺少cosine-only、教师文字与辅助图单独消融,无法完全拆解两种监督必要性。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Discussion, PDF p.12; Table 2, PDF p.7 - 图形证据
整体训练与推理原图;crop=(75,50,535,253) PDF points,1150×508 lossless PNG,467417 bytes。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Figure 2, PDF p.4 - 原文事实
递归code=z_k=Enc(h^L_{p_k-1}),embedding=e_k=Dec(z_k);h/e为H维、z为D维;默认K=8 D=2048。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eqs.6,9–10, PDF p.4; Table 4, PDF p.11 - 原文事实
原文Enc(h)=LN(W2 GELU(W1 LN(h))),Dec(z)=W4 GELU(W3 LN(z));轻量MLP编码解码模块。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eqs.7–8, PDF p.4; Discussion, PDF pp.11–12 - 说明式 / 推导
三条前向路径分别展示 student Enc→zS→student Dec→eS;teacher Enc→zT→teacher Dec;教师评分使用 sg(zS)→teacher Dec→教师词概率,绕过 teacher Enc,不直接复用学生 embeddings。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Tensor-level path of the three forward processes, PDF pp.11–12 - 说明式 / 推导
将原文Eq.11和12合写为统一answer-only CE说明式;只监督答案token,prompt/latent槽直接标签mask。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eqs.11–12, PDF pp.4–5 - 原文事实
蒸馏三前向:current student greedy rollout;privileged teacher independent latent target;teacher scoring使用sg(student codes)经teacher decoder,不重算teacher encoder、不使用student decoded embeddings;teacher所有目标detach,student包括encoder decoder可训练。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eqs.13–17, PDF p.5; Additional Method Details, PDF pp.11–12; Algorithm 1, PDF p.15 - 图形证据
蒸馏阶段原图crop=(78,52,535,228) PDF points,1142×440 lossless PNG,409283 bytes;概览图省略scoring的latent接口,附录用于精确解释。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Figure 3, PDF p.6 - 原文事实
原文cosine loss平均于B K个codes,teacher stop-gradient;共同初始化与结构缓解漂移但不保证坐标等价,槽索引对应递归深度而非严格语义。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eq.15, PDF p.5; Warmup compatibility / Slot-wise alignment, PDF pp.11–12 - 原文事实
教师pT=p_phi(.|xT,sg(zS),yhat_prefix),学生pS=p_theta(.|xS,zS,yhat_prefix),共享学生codes/答案前缀;teacher decoder处理zS,teacher outputs detached。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eqs.16–17, PDF p.5; Algorithm 1, PDF p.15; Tensor-level path, PDF pp.11–12 - 原文事实
原文Eq.19 top-k teacher support上的pT(log pT-log pS),按student response token长度平均,topk=128;forward KL非reverse KL。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eqs.18–19, PDF p.5; Table 4, PDF p.11 - 分析判断
正文截断概率求和与附录top-k DKL简写无法确认重归一化;复现需核实softmax/gather/renormalize,不能默认完整KL数学性质。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eq.19, PDF p.5; Complementary distillation objectives, PDF p.12 - 原文事实
最终配置L=Ltext+0.05 Llat;warmup CE与distill目标分开;policy gradient/task rewards disabled。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eq.20, PDF p.5; Table 4, PDF p.11; Complementary objectives, PDF p.12 - 原文事实
Zebra-CoT和Visual-CoT归一schema;GPT-5.4 API过滤直接答案泄漏/完成解法,uncertain KEEP;之后验证格式、图引用与重复ID;精确filter prompt公开。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Data Construction / Data Cleaning, PDF p.9 - 原文事实
训练集统计,单位samples,最终重复sample IDs=0;样本来源=Zebra-CoT;清洗前(样本)=178,695;清洗后(样本)=129,463
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 3, PDF p.10; Data Statistics, PDF p.9 - 原文事实
训练集统计,单位samples,最终重复sample IDs=0;样本来源=Visual-CoT;清洗前(样本)=88,257;清洗后(样本)=88,257
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 3, PDF p.10; Data Statistics, PDF p.9 - 原文事实
训练集统计,单位samples,最终重复sample IDs=0;样本来源=合计;清洗前(样本)=266,952;清洗后(样本)=217,720
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 3, PDF p.10; Data Statistics, PDF p.9 - 原文事实
删除49,232 samples(18.4%),Zebra-CoT占最终59.5%、Visual-CoT40.5%;未拆分泄漏/格式各自删除数。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 3, PDF p.10 - 原文事实
平均student images=0.97,teacher=3.08,auxiliary=2.11;zero-student-image samples=6580 (3.0%);student/teacher prompt均长147.05/1219.34 characters,非tokens。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 3, PDF p.10 - 原文事实
三阶段训练配置;配置=初始化;教师预热=Qwen2.5-VL-7B-Instruct;学生预热=Qwen2.5-VL-7B-Instruct;OPLD 蒸馏=两份独立预热 checkpoint
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 4, PDF p.11; Implementation Details, PDF p.10 - 原文事实
三阶段训练配置;配置=可训练参数;教师预热=全参数;学生预热=全参数;OPLD 蒸馏=仅学生(含 Enc / Dec)
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 4, PDF p.11; Implementation Details, PDF p.10 - 原文事实
三阶段训练配置;配置=损失;教师预热=答案 CE;学生预热=答案 CE;OPLD 蒸馏=top-128 forward KL + 0.05 cosine
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 4, PDF p.11; Implementation Details, PDF p.10 - 原文事实
三阶段训练配置;配置=学习率;教师预热=语言模型/merger 1×10⁻⁵;视觉 2×10⁻⁶;学生预热=语言模型/merger 1×10⁻⁵;视觉 2×10⁻⁶;OPLD 蒸馏=1×10⁻⁶;视觉单独 LR 未列
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 4, PDF p.11; Implementation Details, PDF p.10 - 原文事实
三阶段训练配置;配置=Epoch / 全局 batch;教师预热=1 / 16;学生预热=1 / 16;OPLD 蒸馏=1 / 未列
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 4, PDF p.11; Implementation Details, PDF p.10 - 原文事实
三阶段训练配置;配置=weight decay / schedule / warmup ratio;教师预热=0.1 / cosine / 0.03;学生预热=0.1 / cosine / 0.03;OPLD 蒸馏=未列 / 未列 / 未列
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 4, PDF p.11; Implementation Details, PDF p.10 - 原文事实
三阶段训练配置;配置=latent slots / dimension;教师预热=8 / 2048;学生预热=8 / 2048;OPLD 蒸馏=8 / 2048
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 4, PDF p.11; Implementation Details, PDF p.10 - 原文事实
三阶段训练配置;配置=最大生成长度;教师预热=512 tokens;学生预热=512 tokens;OPLD 蒸馏=256 tokens
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 4, PDF p.11; Implementation Details, PDF p.10 - 原文事实
三阶段训练配置;配置=最大 prompt 长度;教师预热=未列;学生预热=未列;OPLD 蒸馏=8192 tokens
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 4, PDF p.11; Implementation Details, PDF p.10 - 原文事实
三阶段训练配置;配置=精度 / 梯度检查点;教师预热=BF16 / 开启;学生预热=BF16 / 开启;OPLD 蒸馏=BF16 / 开启
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 4, PDF p.11; Implementation Details, PDF p.10 - 原文事实
warmup per-device batch1/global16,TF32 SDPA Liger non-reentrant checkpointing;image pixel range100352–1317120;正文distill8 NVIDIA B200 GPUs,epoch1 LR1e-6;没有训练GPU时/吞吐/峰值显存/adapter总参数。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Experimental Setup, PDF p.5; Additional Implementation Details, PDF p.10 - 原文事实
测试student-only original image question→K8 recursive codes via student EncDec→answer;去除teacher和privileged inputs,不需显式CoT/auxiliary visual operations;未报告动态停止或test-time scaling。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Inference, PDF p.12; Recursive Latent Reasoning, PDF p.4 - 分析判断
缺乏cache实现与wall-clock延迟数据,不可把省去外部视觉操作等同量化加速;部署需正确回填embedding与维护递归因果序。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Recursive Latent Reasoning, PDF p.4; Inference, PDF p.12 - 原文事实
LMMS-Eval official task configs greedy,主实验7 benchmarks;所有Table1 scores percentages higher better;未逐行列split/sample size/prompt/checkpoint revision和eval commit;不独立复跑。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Experimental Setup, PDF p.5; Implementation Details, PDF p.10; Table 1, PDF p.7 - 原文事实
Table1作者报告;percent, higher better;LMMS-Eval greedy/official task configs,精确split和revision未逐行列明;列为各任务对应overall/汇总分;模型/方法=Qwen2.5-VL-7B;V⋆=71.20;HR-4K=65.12;HR-8K=58.00;MMStar=59.70;Seed2+=65.31;BLINK=53.60;Hall.=56.57
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 1, PDF p.7 - 原文事实
Table1作者报告;percent, higher better;LMMS-Eval greedy/official task configs,精确split和revision未逐行列明;列为各任务对应overall/汇总分;模型/方法=Qwen2.5-VL-7B + SFT;V⋆=73.82;HR-4K=68.00;HR-8K=60.75;MMStar=61.36;Seed2+=69.38;BLINK=56.56;Hall.=66.67
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 1, PDF p.7 - 原文事实
Table1作者报告;percent, higher better;LMMS-Eval greedy/official task configs,精确split和revision未逐行列明;列为各任务对应overall/汇总分;模型/方法=Qwen2.5-VL-7B + 32B OPD;V⋆=73.30;HR-4K=65.25;HR-8K=55.50;MMStar=51.52;Seed2+=67.72;BLINK=39.35;Hall.=38.90
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 1, PDF p.7 - 原文事实
Table1作者报告;percent, higher better;LMMS-Eval greedy/official task configs,精确split和revision未逐行列明;列为各任务对应overall/汇总分;模型/方法=Monet;V⋆=80.10;HR-4K=67.37;HR-8K=64.37;MMStar=60.33;Seed2+=65.88;BLINK=50.71;Hall.=56.36
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 1, PDF p.7 - 原文事实
Table1作者报告;percent, higher better;LMMS-Eval greedy/official task configs,精确split和revision未逐行列明;列为各任务对应overall/汇总分;模型/方法=HyLaR;V⋆=83.77;HR-4K=75.00;HR-8K=70.50;MMStar=62.00;Seed2+=70.32;BLINK=57.14;Hall.=63.68
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 1, PDF p.7 - 原文事实
Table1作者报告;percent, higher better;LMMS-Eval greedy/official task configs,精确split和revision未逐行列明;列为各任务对应overall/汇总分;模型/方法=OPLD(预热后蒸馏学生);V⋆=85.86;HR-4K=73.75;HR-8K=71.37;MMStar=63.86;Seed2+=70.88;BLINK=58.56;Hall.=65.19
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 1, PDF p.7 - 说明式 / 推导
按同表值相减,OPLD vs Qwen V*=85.86-71.20=14.66pp,HR8K=71.37-58.00=13.37pp;OPLD vs SFT Hall=65.19-66.67=-1.48pp。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 1, PDF p.7 - 原文事实
例外:HyLaR HR4K overall75.00>OPLD73.75,V*Spatial85.53>81.58;Laser Hall67.72>OPLD65.19;作者表中商用/agent仍有领先,不支持全局SOTA。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 1, PDF p.7 - 原文事实
Qwen→OPLD HR4K FSP75.75→90.00 FCP54.50→57.50;HR8K FSP63.00→87.75 FCP53.00→55.00;V*Attr73.04→88.70 Spatial68.42→81.58;all percentages higher better official configs greedy,原文未展开FSP/FCP定义。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 1, PDF p.7 - 原文事实
约5K held-out in-domain samples accuracy teacher privileged72.6%, student warmup original29.4%, OPLD original65.4%;作者报告+36.0pp,gap recovery83.3%,remaining7.2pp;greedy official evaluations;完整split protocol未列。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Figure 5 / Privileged Teacher Reference, PDF p.14 - 原文事实
同Qwen2.5-VL-7B学生/相同数据训练策略,四项overall percent higher better,原始输入下评测;策略=基础 Qwen;V⋆=71.20;HR-4K=65.12;HR-8K=58.00;MME-RW-Lite=45.75
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Figure 4, PDF p.6; Table 5, PDF p.13 - 原文事实
同Qwen2.5-VL-7B学生/相同数据训练策略,四项overall percent higher better,原始输入下评测;策略=SFT;V⋆=73.82;HR-4K=68.00;HR-8K=60.75;MME-RW-Lite=46.33
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Figure 4, PDF p.6; Table 5, PDF p.13 - 原文事实
同Qwen2.5-VL-7B学生/相同数据训练策略,四项overall percent higher better,原始输入下评测;策略=仅学生预热;V⋆=73.82;HR-4K=66.63;HR-8K=58.00;MME-RW-Lite=48.88
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Figure 4, PDF p.6; Table 5, PDF p.13 - 原文事实
同Qwen2.5-VL-7B学生/相同数据训练策略,四项overall percent higher better,原始输入下评测;策略=教师预热后移除特权输入;V⋆=73.30;HR-4K=64.75;HR-8K=56.38;MME-RW-Lite=43.98
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Figure 4, PDF p.6; Table 5, PDF p.13 - 原文事实
同Qwen2.5-VL-7B学生/相同数据训练策略,四项overall percent higher better,原始输入下评测;策略=32B 标准 OPD;V⋆=73.30;HR-4K=65.25;HR-8K=55.50;MME-RW-Lite=32.83
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Figure 4, PDF p.6; Table 5, PDF p.13 - 原文事实
同Qwen2.5-VL-7B学生/相同数据训练策略,四项overall percent higher better,原始输入下评测;策略=完整 OPLD;V⋆=85.86;HR-4K=73.75;HR-8K=71.37;MME-RW-Lite=53.36
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Figure 4, PDF p.6; Table 5, PDF p.13 - 分析判断
标准OPD同时改变教师规模/初始化/监督等,比较不能隔离某单因子因果;teacher warmup removed privilege是分布迁移检验。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Effect of Training Strategy, PDF pp.6–7; Table 5, PDF p.13 - 原文事实
latent slot/architecture/loss消融,同Qwen2.5-VL-7B方案,LMMS-Eval greedy official configs,percent higher better;分组/变体=槽数 K=0;V⋆=75.39;HR-4K=65.50;HR-8K=58.13;MME-RW-Lite=50.44;Avg.=62.36
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 2, PDF p.7; Table 6, PDF p.13 - 原文事实
latent slot/architecture/loss消融,同Qwen2.5-VL-7B方案,LMMS-Eval greedy official configs,percent higher better;分组/变体=槽数 K=4;V⋆=78.53;HR-4K=72.62;HR-8K=71.75;MME-RW-Lite=51.90;Avg.=68.70
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 2, PDF p.7; Table 6, PDF p.13 - 原文事实
latent slot/architecture/loss消融,同Qwen2.5-VL-7B方案,LMMS-Eval greedy official configs,percent higher better;分组/变体=槽数 K=8;V⋆=85.86;HR-4K=73.75;HR-8K=71.37;MME-RW-Lite=53.36;Avg.=71.09
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 2, PDF p.7; Table 6, PDF p.13 - 原文事实
latent slot/architecture/loss消融,同Qwen2.5-VL-7B方案,LMMS-Eval greedy official configs,percent higher better;分组/变体=Raw hidden states;V⋆=78.53;HR-4K=71.50;HR-8K=67.00;MME-RW-Lite=48.41;Avg.=66.36
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 2, PDF p.7; Table 6, PDF p.13 - 原文事实
latent slot/architecture/loss消融,同Qwen2.5-VL-7B方案,LMMS-Eval greedy official configs,percent higher better;分组/变体=Enc–Dec adapter;V⋆=85.86;HR-4K=73.75;HR-8K=71.37;MME-RW-Lite=53.36;Avg.=71.09
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 2, PDF p.7; Table 6, PDF p.13 - 原文事实
latent slot/architecture/loss消融,同Qwen2.5-VL-7B方案,LMMS-Eval greedy official configs,percent higher better;分组/变体=Reverse KL + PG + cosine;V⋆=74.87;HR-4K=71.37;HR-8K=67.75;MME-RW-Lite=49.92;Avg.=65.98
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 2, PDF p.7; Table 6, PDF p.13 - 原文事实
latent slot/architecture/loss消融,同Qwen2.5-VL-7B方案,LMMS-Eval greedy official configs,percent higher better;分组/变体=Top-k forward KL only;V⋆=78.53;HR-4K=63.88;HR-8K=58.63;MME-RW-Lite=48.20;Avg.=62.31
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 2, PDF p.7; Table 6, PDF p.13 - 原文事实
latent slot/architecture/loss消融,同Qwen2.5-VL-7B方案,LMMS-Eval greedy official configs,percent higher better;分组/变体=Top-k forward KL + cosine;V⋆=85.86;HR-4K=73.75;HR-8K=71.37;MME-RW-Lite=53.36;Avg.=71.09
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 2, PDF p.7; Table 6, PDF p.13 - 分析判断
K4 HR8K71.75高于K8 71.37不支持严格单调;EncDec/raw对照未拆解空间/容量/归一化;RevKL+PG与ForwardKL相比同时改变方向和优化,不隔离KL因果。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Tables 2 / 6, PDF pp.7,13 - 原文事实
同一训练后OPLD checkpoint,same original input/greedy配置,only latents changed,不训练;four overall benchmarks and mean drop in percentage points;推理期状态=原始 latents;V⋆=85.86;HR-4K=73.75;HR-8K=71.37;MME-RW-Lite=53.36;Avg. Drop(百分点)=—
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 7, PDF p.13; Intervention Analysis, PDF p.14 - 原文事实
同一训练后OPLD checkpoint,same original input/greedy配置,only latents changed,不训练;four overall benchmarks and mean drop in percentage points;推理期状态=加入随机噪声;V⋆=76.96;HR-4K=64.12;HR-8K=57.50;MME-RW-Lite=48.62;Avg. Drop(百分点)=9.29
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 7, PDF p.13; Intervention Analysis, PDF p.14 - 原文事实
同一训练后OPLD checkpoint,same original input/greedy配置,only latents changed,不训练;four overall benchmarks and mean drop in percentage points;推理期状态=全部置零;V⋆=76.44;HR-4K=59.62;HR-8K=51.37;MME-RW-Lite=48.51;Avg. Drop(百分点)=12.10
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 7, PDF p.13; Intervention Analysis, PDF p.14 - 原文事实
同一训练后OPLD checkpoint,same original input/greedy配置,only latents changed,不训练;four overall benchmarks and mean drop in percentage points;推理期状态=跨样本交换轨迹;V⋆=65.45;HR-4K=54.63;HR-8K=48.25;MME-RW-Lite=44.61;Avg. Drop(百分点)=17.85
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 7, PDF p.13; Intervention Analysis, PDF p.14 - 分析判断
交换轨迹降幅最大支持样本相关信息功能贡献,不证明每槽可解释推理语义或区分感知信息/推理/答案倾向。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 7, PDF p.13; Intervention Analysis, PDF p.14; Slot-wise alignment, PDF p.12 - 原文事实
定性Tetris案例teacher=A incorrect,warmup student=D incorrect,OPLD=C correct;作者用soft distribution与different scoring trajectory解释,不提供实例概率/latent语义。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Figure 8, PDF p.18; Case Studies discussion, PDF pp.14–15 - 原文事实
作者承认坐标漂移与槽语义非一一对应;functional utility不建立每维语义;learned latent mapper/OT matching/probing是未来方向。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Discussion, PDF pp.11–12 - 分析判断
分析:额外观测未必由原图可恢复;过滤无审计误差,complete-scene jigsaw案例清洗保留状态未标明;缺cosine-only/input/decoder对照;无CI/multiseed/跨底座实验和内容级去污染保证;代码权重未核实、超参/评测revision/latency缺口。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Tables 1–4, PDF pp.7,10–11; Discussion, PDF p.12; Figures 9/12, PDF pp.19,22 - 分析判断
可带走机制为信息不对称教师+student on-policy轨迹+latent interface校准,证据支持功能性贡献但不建立逐槽可解释逻辑。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Method, PDF pp.4–5; Tables 2/7, PDF pp.7,13; Discussion, PDF p.12 - 分析判断
复现检查列表与追加对照为编辑建议,非作者已执行结果。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Based on implementation gaps in PDF pp.10–12; Tables 2/7, PDF pp.7,13 - 图形证据
原图作者署名;PDF License=arxiv nonexclusive-distrib/1.0与首页版权声明,MIT代码许可不覆盖paper figures;两张PNG超350KB为保持label legibility。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
PDF metadata / p.1 copyright notice; Figure 2 p.4 / Figure 3 p.6 - 原文事实
贯穿例来自黄色形状的水平镜像与连续平移;题目指令学生也可见,解题文字与中间图是教师特权。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Figure 8, PDF p.18 - 原文事实
学生和教师同底座但可见输入不同;教师更丰富信息不代表本方案必须换成更大的模型。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eqs.1–2, PDF p.3; Implementation p.10 - 说明式 / 推导
教学术语对应:h为最后层状态,z为Enc后的D维code,e为Dec后的H维输入embedding,ŷ为当前学生生成答案;向量不是词或图片。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eqs.4–10, PDF pp.3–4 - 图形证据
一轮反馈重绘:h→Enc→D维z→Dec→H维e→回填后重新前向;返回箭头指下一轮状态计算,K=8 D=2048,H只用符号。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eqs.6–10, PDF p.4; Table 4, p.11 - 原文事实
第一个code读assistant prompt末端最后层状态;后续读当前槽之前的位置。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eqs.6,9–10, PDF p.4 - 说明式 / 推导
Enc建立可训练code接口;低维投影不自动赋予可解释推理语义。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eqs.6–7, PDF p.4; Discussion pp.11–12 - 原文事实
Dec映回H维embedding并回填,后续code依赖此前反馈;固定K轮后开始回答。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eqs.8–10, PDF p.4 - 原文事实
学生以原始输入递归生成codes并greedy回答;确定性生成仍为当前student on-policy轨迹。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eq.13, PDF p.5; Student rollout p.11 - 原文事实
教师用特权输入独立递归产生自己的codes用于cosine,同槽序是递归深度,不是语义保证。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eqs.14–15, PDF p.5; Tensor-level path pp.11–12 - 原文事实
评分使用学生codes经冻结教师Dec解码,教师Enc旁路;两侧使用相同学生答案前缀,但views、decoder、embeddings和参数不同。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eqs.16–17, PDF p.5; Tensor-level path pp.11–12 - 说明式 / 推导
离散greedy选择只定义评分路径,不提供连续梯度;连续latent和学生概率路径训练学生,最终无PG或任务reward。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Algorithm 1, PDF p.15; Tensor-level path pp.11–12 - 原文事实
前两阶段各自全参数预热、只标答案;第三阶段冻结teacher,仅student底座与Enc/Dec更新。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eqs.11–20, PDF pp.4–5; Table 4, p.11 - 分析判断
过滤控制教师捷径而非新增模型loss;对辅助上下文的不确定判断偏KEEP,重复ID清除不是内容级去污染证明。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Data Cleaning, PDF p.9; Table 3, p.10 - 图形证据
0–100轴,percent higher better,LMMS-Eval greedy作者报告;Base/SFT/OPLD V⋆71.20/73.82/85.86;HR8K58.00/60.75/71.37;Hall56.57/66.67/65.19;包含OPLD低于SFT的例外。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 1, PDF p.7; Experimental Setup p.5 - 图形证据
同一checkpoint原始输入/解码仅改latents,不额外训练;四任务平均下降百分点 noise9.29 zero12.10 shuffle17.85,轴0–20;下降非相对百分比。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 7, PDF p.13; Intervention pp.13–14 - 说明式 / 推导
对非零向量,方向越接近则1−cos越小;这项监督校准同深度code的方向,不赋予槽语义。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eq.15, PDF p.5 - 说明式 / 推导
文本项按教师概率加权候选词,使学生学习其相对偏好;top-k归一化约定仍未知。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eq.19, PDF p.5; Complementary objectives, p.12 - 说明式 / 推导
loss系数控制两项优化相对权重;当前组合有消融支持,不证明通用最优权重。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Eq.20, PDF p.5; Table 4, p.11; Table 2, p.7 - 图形证据
原题图和五步中间图分别裁切并列:题图 crop=(154,159,217,265),440×740 PNG 29040 bytes;中间图 crop=(154,488,403,672),1200×886 PNG 68632 bytes。原题图与操作指令学生可见;辅助中间图和 rationale 是教师训练期特权输入,测试学生不接收或生成这些辅助图。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Figure 8, PDF p.18; Problem Setup p.3; Inference p.12 - 原文事实
整体原图右侧为教师预热、学生预热、蒸馏,绿色 Deploy Student 指向左侧部署路径;推理仅原图与问题、学生 Enc–Dec latent 回路和答案,不含教师或辅助图。
OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
打开原始来源 ↗ · 返回对应正文 ↑
Figure 2, PDF p.4; Three-Stage OPLD Training pp.4–5