↖ PaperArborOPD / Single / RESEARCH NOTE
查证

PAPERARBOR / SINGLE

OPLD 精读:把教师的图解指导变成学生的内部计算

从一道形状变换题走通 OPLD:连续向量怎样反馈,教师如何分别提供轨迹参照与学生路径评分;用消融和干预区分收益、实际作用与可解释性边界。

中文技术解读 · 来源范围见正文 · 离线可读

目录 / 跳转到章节

01 · 先抓住问题:老师能看解题过程,学生考试只能看题

一张图、一道问题,老师训练时还能看解题文字和中间图,学生真正答题时却没有这些帮助。OPLD 研究的是:怎样把这些额外指导转成学生内部可用的计算,让学生只看原题也能回答?

它的办法是让学生先用自己的模型产生一串连续向量,再生成答案。教师提供两种反馈:一份自己的内部轨迹作参照;另一份是在学生已经走到的位置,比较接下来各个词应该有多大概率。

先记住两个区别:内部轨迹不是文字 CoT,也不是中间图片;教师的“轨迹参照”和“给学生评分”是不同前向过程。读懂这两点,才容易读懂后面的 Enc–Dec 和两种损失。

[S1] Method, pp.3–5; Tensor-level path, pp.11–12 · 原文第 4 页 ↗

固定阅读 arXiv:2607.28154v1,首发/版本日期均为 2026-07-30,完整 PDF 22 页。以下是原文解读,不是独立复跑结果。

论文身份、材料核实与代码状态

正式标题:OPLD: On-Policy Latent Distillation for Multimodal Reasoning。作者 Shoutai Zhu、Tianyang Xu、Bin Sun、Mingyuan Xu、Yu Liu、Qinzhen Guo,署名机构 ByteDance。作者采用 arXiv 元数据;首页将 Bin Sun 排作 Sun Bin,将 Mingyuan Xu 排作 Xumingyuan。用户 PDF 与固定版本 PDF 的 SHA-256 相同,完整哈希见来源章。论文与元数据未给出本次可核实的官方实现或权重;这不等于证明它们不存在。

[S1] Versioned arXiv metadata; PDF p.1; retrieved PDF hash · 原文第 1 页 ↗

02 · 从一道形状变换题看信息差

Figure 8 给出一道形状变换题:对黄色形状先水平镜像,再依次平移,最后选择匹配的选项。学生看到原图、操作要求和选项,必须自己跟踪形状和位置的变化。教师训练时还看得到说明文字和每步中间图,信息更加充分。

[S1] Figure 8, PDF p.18 · 原文第 18 页 ↗

学生看到的题图:原始黄色形状与候选项

Figure 8 原题图:黄色形状与 A、B、C、D 四个候选图形。

教师额外看到的中间图:镜像与平移后的状态

Figure 8 教师特权输入中的五张中间图,保留 Step 1 至 Step 5 标签,展示镜像和平移后的黄色形状。
OPLD,arXiv:2607.28154v1,Figure 8,PDF p.18。分别裁取题图及完整五步中间图,按学生/教师可见内容并列展示;原页的解题文字与预测结果未包含在这两个裁片中。论文图版权归原作者,网站 MIT 许可不覆盖原图。查看完整案例 ↗

这两组图就是信息差:学生需要从操作指令自行跟踪状态;教师可以利用给定的中间状态和解释文字。OPLD 在训练中利用后者提供指导,测试时并不把这些中间图交给学生,也不输出这些图作为推理步骤。

[S1] Figure 8, PDF p.18; Problem Setup, p.3; Inference, p.12

学生视图 xˢ:部署时能拿到什么

原始问题 + 主图。示例的镜像、平移指令是题目的一部分,学生也能看;解题 rationale 和辅助图才是教师独有的信息。

教师视图 xᵀ:训练时多给什么

原始问题 + 主图 + 解题文字 + 辅助图。教师与学生从同一个底座初始化;这里的优势来自输入信息,不是必须换成更大的模型。

[S1] Problem Setup, Eqs.1–2, p.3; Implementation, p.10; Figure 8, p.18 · 原文第 3 页 ↗

显式视觉 CoT 可以在测试时继续写步骤、裁图或生成中间图,但需要对应的外部过程。作者希望把训练期的指导转进连续内部状态。与让 latent 模仿某张辅助图的压缩特征相比,OPLD 更关心这些状态是否真的推动后续答案生成。

上述方法动机来自作者的 Introduction / Related Work(pp.1–3),不是本页重新比较了所有相关方法。是否学到透明的人类逻辑步骤,仍要留给实验与限制章检验。

03 · 先认清对象,再看方法

hidden state:模型当前算出的状态

这是某个位置最后一层的连续向量 h,概括模型到该位置的计算结果。它不是已解码的文字。

latent code:用来反馈和对齐的向量

Enc 把 h 投影为 z。论文默认每个 z 是 2048 维;一个槽对应一次反馈,不对应一个可读单词或已命名的逻辑步骤。

embedding:语言模型能接收的输入

Dec 把 z 映回输入宽度,得到 e,再写入序列中的 latent 槽。z 与 e 的职责不同,不能在教师评分时随意互换。

rollout:当前学生实际生成的答案

记为 ŷ。它来自当前学生,可能正确,也可能错误。教师接下来给这条路径反馈,而不是只让学生学习一份预先写好的教师答案。

[S1] Eqs.4–10, pp.3–4; Tensor-level path, pp.11–12 · 原文第 4 页 ↗

两种反馈各管一件事:latent cosine 让学生向量的方向靠近教师参照;token 分布蒸馏让学生在自己的答案前缀上接近教师的词概率。论文用二者组合改善结果,但没有 cosine-only 对照,不能声称每个组件的独立作用都已被拆清。

[S1] Eqs.15–20, p.5; Table 2, p.7; Discussion, p.12 · 原文第 5 页 ↗

04 · 先看整体框架,再拆向量回路

先走学生的路径。原图和问题经原生多模态 chat template 进入模型;在 assistant generation prompt 与答案之间预留 latent 槽。下面的回路在答案生成前运行。

[S1] Recursive Latent Reasoning, pp.3–4 · 原文第 4 页 ↗

原文整体结构图:左侧学生递归latent推理,右侧教师预热、学生预热与蒸馏三个训练阶段。
OPLD,2607.28154v1,Figure 2,PDF p.4。裁切整张图,去掉页内正文,保留所有面板与标签。原图解释训练和部署;精确教师评分接口见下文三条前向路径;原图默认完整显示,可点击“放大图像”查看细字。

读图顺序:先看右侧三个训练阶段:有解题指导的教师预热、只看原题的学生预热、冻结教师后的蒸馏。再沿绿色 Deploy Student 箭头看左侧:部署只保留学生,它用 Enc–Dec 回填 latent 槽,完成内部循环后生成答案。橙色监督线发生在训练中,部署时不需要教师或辅助图。

[S1] Figure 2, PDF p.4; Three-Stage OPLD Training, pp.4–5

局部放大:一次向量反馈到底做什么

一轮 latent 反馈:hidden 经编码、解码和回填,再计算下一轮 读出:当前最后一层状态 h位于将要写入的槽之前,H 维Enc:投影成连续 code zD 维,作为对齐教师的接口Dec:映回输入 embedding e回到 H 维,语言模型可以消费回填当前槽,继续前向后续状态会受到这次反馈影响 回路:还有槽 → 计算下一轮完成固定 K 轮 → 开始生成答案默认 K=8、D=2048;H 用符号表示
解释性重绘:只画一轮计算接口,返回箭头指下一轮的状态计算,不是把原状态直接复制回来。H 为模型宽度,论文未单列适配器新增参数。

[S1] Eqs.6–10, PDF p.4; Table 4, p.11 · 原文第 4 页 ↗

① 从槽前读出状态

第一轮读 assistant prompt 末端的最后层 hidden state;后续轮次读当前槽前的位置。输入是当前已有序列的计算结果,输出是 H 维向量 h。

[S1] Eqs.6,9–10, p.4 · 原文第 4 页 ↗

② Enc 把状态投到 code 空间

编码器用可训练 MLP 与归一化生成 D 维向量 z。作者通过这个显式接口学习和校准内部表示,而不是直接拿原 hidden state 对齐。低维并不自动赋予“推理语义”;对应消融见后文。

[S1] Eqs.6–7, p.4; Table 2, p.7; Discussion, p.12 · 原文第 4 页 ↗

③ Dec 映回输入并继续计算

解码器把 z 映回 H 维 embedding e,写入该槽,再计算下一轮。后面的状态因此依赖前面回填的向量。这里没有把向量转成词,也没有生成一张新图片;完成固定槽数后才开始回答。

[S1] Eqs.8–10, p.4; Inference, p.12 · 原文第 4 页 ↗

把回路读成一条公式

下面两式只描述“状态变 code,再变输入”的接口;完整循环还包括把 e 回填后重新前向。

zk=Enc(hpk−1L),ek=Dec(zk)

pk 是第 k 个槽的位置,L 是最后一层,h 属于模型 H 维 hidden 空间;z 是 D 维连续 code,e 回到 H 维输入 embedding。第一个 code 来自 assistant prompt 的末端;回填后再计算下一个 code。默认 K=8、D=2048,不是 8 个离散词,也不是生成 8 张图片。

[S1] Eqs.6,9–10, PDF p.4; Table 4, PDF p.11

展开 Enc–Dec 的投影、归一化及原始架构图
Enc(h)=LN(W2GELU(W1LN(h)))Dec(z)=W4GELU(W3LN(z))

W₁ 到 W₄ 是可训练投影,LN 是 LayerNorm,GELU 是非线性。Enc 的输出有 LN,Dec 的最终输出按原式没有再加 LN。作用是建立可以校准的 latent 接口;低维投影本身并不保证 code 自动获得“推理语义”。MLP 中间宽度与新增参数数目未在论文中列明。

[S1] Eqs.7–8, PDF p.4; Discussion, PDF pp.11–12

[S1] Figure 2, PDF p.4 · 原文第 4 页 ↗

05 · 一次蒸馏:学生先走,教师给两种反馈

这章只讲第三训练阶段:教师和学生已分别预热,随后教师冻结、学生继续学习。一次更新要分清以下三条前向路径;其中学生路径同时还用于计算可训练的学生词概率。

[S1] Eqs.13–17, p.5; Algorithm 1, p.15 · 原文第 5 页 ↗

蒸馏框架:同一学生轨迹上的两种监督

沿原图下支路看:当前学生从原题生成 latent 和答案;上支路的冻结教师利用训练期指导,提供 latent 参照与 token 分布。两条橙色监督线分别约束内部向量和答案概率。图是概览,精确的教师评分输入在后面的三个前向中展开。

原文蒸馏阶段图:学生生成答案与latent,教师独立生成latent目标,并沿同一学生答案轨迹提供token分布。
OPLD,2607.28154v1,Figure 3,PDF p.6。裁切整张图,保留三组框、连线及 loss 标记。原图默认完整显示,可点击“放大图像”查看细节。该概览图省略了部分 latent 条件;实现时应以 PDF pp.11–12 的张量接口说明为准。

[S1] Figure 3, PDF p.6 · 原文第 6 页 ↗

三个前向:同样的槽结构,不同的输入与用途

① 学生先生成自己的向量和答案

原题 xˢ → 学生 Enc / Dec 递归 → 学生 codes zˢ → 学生答案 ŷ

输入
只有原始图像与问题;不加入教师 rationale 或辅助图。
发生什么
当前学生先完成内部反馈,再 greedy decode 答案。这就是 on-policy:访问的是当前学生会产生的路径,不要求随机采样。
交给后续
保留学生 codes 和答案序列。下一步对齐 codes;评分步骤使用这些 codes 与相同学生答案前缀。

[S1] Eq.13, p.5; Student rollout, p.11; Algorithm 1, p.15 · 原文第 5 页 ↗

② 教师独立生成轨迹,作向量参照

特权输入 xᵀ → 教师 Enc / Dec 递归 → 教师自己的 codes zᵀ

输入
原题加 rationale 与辅助图。
发生什么
冻结教师沿自己的递归过程生成 codes。学生第 k 个 code 向教师第 k 个 code 作 cosine 对齐。
这里不做
不用教师的最终硬答案当蒸馏标签。相同 k 表示递归深度相同,不保证语义步骤相同。

[S1] Eqs.14–15, p.5; Tensor-level path, pp.11–12 · 原文第 5 页 ↗

③ 教师接收学生 codes,沿学生前缀评分

停止梯度的 zˢ → 教师 Dec → 教师输入 embedding;再结合 xᵀ 与学生答案前缀 → 教师词概率 pᵀ

沿用什么
学生生成的 codes 和答案前缀;不改走教师自己的 zᵀ 轨迹。
接口区别
教师 Enc 被绕过。这里用教师 Dec 解码 zˢ,而非直接送入学生 Dec 产生的 eˢ。codes 相同,不意味着两边 embedding 相同。
监督哪里
教师 pᵀ 与学生 pˢ 在同一答案前缀上比较,形成 token 分布反馈。教师与其输出均停止梯度,只更新学生。

[S1] Eqs.16–17, p.5; Teacher scoring / Why decode, pp.11–12 · 原文第 12 页 ↗

回到形状题:“教师参照”回答的是有额外图解时,教师内部会形成什么向量;“教师评分”回答的是学生已经这样表示题目、已经写了这些字,下一词的概率应该怎样调整。二者都不是强制学生复制教师的完整硬答案。

[S1] Tensor-level path, pp.11–12; Case Studies, pp.14–15 · 原文第 12 页 ↗

反馈 A:方向对齐,但不替每个槽命名

Cosine loss 对应 batch 中每个同序号的 code,比较方向是否接近;方向越接近,1−cos 这项损失越小。教师向量是固定目标。独立预热可能让坐标漂移,所以这里是向教师空间校准,而不是假设两者一开始就完全相同。

ℒlat=1BK∑b=1B∑k=1K[1−cos(zS,bk,sg(zT,bk))]

B 是 batch size,K 是递归槽数,S/T 为学生/教师,sg 表示停止梯度。Cosine 主要比较方向,减少幅值差异的影响。相同 k 只保证相同递归深度,不保证两者正在做相同的语义子步骤。独立全参数预热后坐标可能漂移,因此它是向冻结教师空间校准的目标,不是“预先同坐标”的数学保证。

[S1] Eq.15, PDF p.5; Warmup compatibility / Slot-wise alignment, PDF pp.11–12

反馈 B:同一前缀上的词概率,而非一个正确词标签

在答案的每个位置,教师和学生各给出候选词的概率。论文选取教师概率最高的 128 个词,计算 teacher → student 方向的 forward KL 型项。每个候选的影响按教师概率加权,使学生学习教师对候选词的相对偏好。下面的求和是对候选词,不是只惩罚学生实际选出的那个词。

ℒtext=1|y^|∑t=1|y^|∑v∈𝒱tTptT(v)[logptT(v)−logptS(v)]

ŷ 是学生生成的答案,|ŷ| 是其 token 数;𝒱ᵀₜ 为教师在该位置概率最高的 k 个词,本配置 k=128。公式方向是 teacher → student 的 forward KL 型项,监督整个选中词集的概率,而非只用教师 argmax 作标签。它不需要策略梯度奖励。

[S1] Eqs.18–19, PDF p.5; Table 4, PDF p.11

展开教师/学生条件分布,以及 top-k 归一化的复现缺口
ptT=pφ(·∣xT,sg(z1:KS),y^<t)ptS=pθ(·∣xS,z1:KS,y^<t)

pᵀ / pˢ 是位置 t 的下一 token 概率向量;φ 冻结,θ 更新。xᵀ 含特权证据,xˢ 不含。两边 codes 和离散答案前缀相同,但 decoder、模型参数与输入视图不同,因此不能理解成两边 embedding 或全部 hidden states 都相同。

[S1] Eqs.16–17, PDF p.5; Algorithm 1, PDF p.15; Tensor-level path, PDF pp.11–12

Eq.19 写原概率在 top-k 支持集上的截断求和,未写重归一化;附录又用 DKL 简写,无法确认实现是否重新归一化。不能给截断项自动套用完整 KL 的非负性。复现时需核实 softmax、gather、renormalize 的顺序。

[S1] Eq.19, p.5; Complementary objectives, p.12 · 原文第 5 页 ↗

组合目标:校准内部接口与输出行为

系数控制两项损失在优化中的相对权重。当前组合有消融支持,但论文没有证明它是对所有任务通用的最优权重。

ℒOPLD=ℒtext+0.05ℒlat

正文 Eq.20 使用一般权重 λtext 与 λlat;附录最终配置将 text 权重取为 1,latent cosine 权重取为 0.05。标准答案 CE 只用于前两阶段;最后配置不加 policy-gradient loss 或任务专属 reward。

[S1] Eq.20, PDF p.5; Table 4, PDF p.11; Complementary objectives, PDF p.12

预热阶段的标准答案 CE 与这里的蒸馏目标不同。当前学生选出的离散词序列用于规定评分位置;greedy 选择本身不提供连续梯度。训练依靠学生概率与连续 latent 路径的可训练计算,最终配置没有 policy-gradient loss 或任务 reward。

[S1] Algorithm 1, p.15; Tensor-level path / objectives, pp.11–12;梯度路径含义为机制解释 · 原文第 12 页 ↗

06 · 三阶段训练:先会使用槽,再校准轨迹

阶段 1:教师预热

教师看特权视图,通过标准答案的交叉熵训练全参数,学习怎样把丰富证据用于回答。rationale 在输入里,损失只直接标注答案。

阶段 2:学生预热

学生只看原题,同样用标准答案训练全参数,先学会使用连续反馈结构。这样蒸馏从已有的学生计算协议开始。

阶段 3:冻结教师,蒸馏学生

当前学生自己生成,再接受两种反馈。更新学生底座和 Enc / Dec;教师的参照空间与评分参数均固定。

[S1] Eqs.11–20, pp.4–5; Table 4, p.11; Algorithm 1, p.15 · 原文第 4 页 ↗

“答案以外不算直接标签损失”不等于 latent 不学习。答案概率由前面的连续计算影响,答案 CE 仍能训练底座与 Enc / Dec;mask 掉的是 prompt / latent 位置的直接标签。

[S1] Eqs.11–12, pp.4–5; Implementation, p.10;mask 的计算含义为机制解释 · 原文第 4 页 ↗

展开预热的 answer-only CE 公式
ℒwarm=−∑n=1Nlogpω(yn*∣x,z1:K,y<n*)

这是把原文教师与学生两式合写的说明式:ω 对教师是 φ、对学生是 θ,x 与 z 取各自视图和轨迹;y* 是标准答案,N 为其 token 长度。预热用标准答案前缀,与蒸馏阶段的学生前缀不同。

[S1] Eqs.11–12, PDF pp.4–5

怎样防止教师直接看到答案

数据来自 Zebra-CoT 与 Visual-CoT。作者用 GPT-5.4 API 检查教师上下文:直接显示答案、标出正确选项或给出完成解法时删除;只提供中间证据、仍需综合推理时保留,不确定则倾向保留。随后检查格式、图像引用和重复 ID。过滤是在控制教师捷径,不是给模型另加一种推理损失。

[S1] Training Data / Data Cleaning, p.9 · 原文第 9 页 ↗

样本来源清洗前(样本)清洗后(样本)
Zebra-CoT178,695129,463
Visual-CoT88,25788,257
合计266,952217,720
删除 49,232 个样本,均来自 Zebra-CoT;论文将潜在泄漏与无效格式合计报告,没有分别给出两类删除数量。样本计数不等于 token 数。 来源:[S1] Table 3, PDF p.10; Data Statistics, PDF p.9。

输入信息差也体现在数量上:学生平均可见 0.97 张图,教师 3.08 张;平均辅助图为 2.11 张。6,580 个样本(3.0%)没有学生图像,不能把整个集合都当作图像问答。学生/教师 prompt 均长 147.05 / 1,219.34 字符,不是 tokens。

[S1] Table 3, PDF p.10 · 原文第 10 页 ↗

展开完整配置:学习率、batch、长度、精度与未公开项
配置教师预热学生预热OPLD 蒸馏
初始化Qwen2.5-VL-7B-InstructQwen2.5-VL-7B-Instruct两份独立预热 checkpoint
可训练参数全参数全参数仅学生(含 Enc / Dec)
损失答案 CE答案 CEtop-128 forward KL + 0.05 cosine
学习率语言模型/merger 1×10⁻⁵;视觉 2×10⁻⁶语言模型/merger 1×10⁻⁵;视觉 2×10⁻⁶1×10⁻⁶;视觉单独 LR 未列
Epoch / 全局 batch1 / 161 / 161 / 未列
weight decay / schedule / warmup ratio0.1 / cosine / 0.030.1 / cosine / 0.03未列 / 未列 / 未列
latent slots / dimension8 / 20488 / 20488 / 2048
最大生成长度512 tokens512 tokens256 tokens
最大 prompt 长度未列未列8192 tokens
精度 / 梯度检查点BF16 / 开启BF16 / 开启BF16 / 开启
破折号或缺失值在此写作“未列”,不会从预热配置自动沿用到蒸馏。最大长度沿用论文训练配置的序列长度含义;没有公开逐任务评测生成长度。 来源:[S1] Table 4, PDF p.11; Implementation Details, PDF p.10。

预热每设备 batch 1,以梯度累积达到全局 16;BF16、TF32、SDPA、Liger 与 non-reentrant checkpointing。图像像素区间 100,352–1,317,120;正文蒸馏使用 8 张 NVIDIA B200。没有各阶段 GPU 时、吞吐、峰值显存及新增适配器参数量,缺失配置不从预热自动沿用。

[S1] Implementation, p.10; Table 4, p.11; Experimental Setup, p.5 · 原文第 10 页 ↗

07 · 测试时留下什么:只保留学生与内部反馈

原图与问题 → 原生多模态模板 → 学生 Enc / Dec 递归反馈 → 完成默认 8 个槽 → greedy 生成答案

教师、教师 decoder、rationale 与辅助图均被移除。学生保留自己的 Enc / Dec 和底座。前面形状题的操作要求仍是原题条件;模型不会在测试时向教师索取那几张中间图。

[S1] Inference, p.12; Eqs.6–10, p.4; Figure 8, p.18 · 原文第 12 页 ↗

成本边界不写显式 CoT,不代表答案前没有计算。论文描述每步重新前向,没有公开 KV cache 复用或实测延迟,也没研究自适应停止与更长链的 test-time scaling。因此可以确认部署少了一类外部信息依赖,不能给出已测得的倍数加速。

[S1] Recursive Latent Reasoning, p.4; Inference, p.12;成本解释为分析 · 原文第 12 页 ↗

08 · 先读收益和例外,再查完整主表

以下都是作者用 LMMS-Eval、greedy 和官方任务配置报告的分数。先看基础模型、SFT 与 OPLD 在三个任务上的关系;完整七项主表随后保留。测试只给学生原始输入,教师特权不进入部署评测。

[S1] Experimental Setup, p.5; Implementation, p.10; Table 1, p.7 · 原文第 7 页 ↗

三项主结果:OPLD 的收益和相对 SFT 的 HallusionBench 例外作者报告分数(%),越高越好V⋆Base71.20SFT73.82OPLD85.86HR-8KBase58.00SFT60.75OPLD71.37HallusionBenchBase56.57SFT66.67OPLD65.19050100共用 0–100 刻度,保留原表两位小数
Base 为 Qwen2.5-VL-7B,SFT 为原表监督微调基线,OPLD 为蒸馏后的学生。主表节选,不表示三项可以加成统一能力分;任务配置与其他缺口见下文。

[S1] Table 1, PDF p.7; Experimental Setup, p.5 · 原文第 7 页 ↗

怎么读:OPLD 的 V⋆、HR-8K 高于基础模型和 SFT;HallusionBench 则低于 SFT。实验首先支持当前方案在报告任务上的系统收益,不足以把每个涨分分配给某个模块。

[S1] Table 1, p.7;模块归因边界为分析 · 原文第 7 页 ↗

展开完整七项主结果与其他 latent 方法

各列是对应任务 overall / 汇总分(%,越高越好),不要把不同任务加成未经定义的总能力分。其他方法按论文命名,未确认其工具预算、槽数和训练成本全部一致。

模型/方法V⋆HR-4KHR-8KMMStarSeed2+BLINKHall.
Qwen2.5-VL-7B71.2065.1258.0059.7065.3153.6056.57
Qwen2.5-VL-7B + SFT73.8268.0060.7561.3669.3856.5666.67
Qwen2.5-VL-7B + 32B OPD73.3065.2555.5051.5267.7239.3538.90
Monet80.1067.3764.3760.3365.8850.7156.36
HyLaR83.7775.0070.5062.0070.3257.1463.68
OPLD(预热后蒸馏学生)85.8673.7571.3763.8670.8858.5665.19
主表节选。V⋆ 与 HRBench 为 Overall;Seed2+ = SeedBench2-Plus,Hall. = HallusionBench。OPLD 基于 Qwen2.5-VL-7B-Instruct;其他方法依原文命名,不假设其 latent 步数、工具预算或训练成本一致。 来源:[S1] Table 1, PDF p.7。

协议缺口:原文未逐行给出 task commit、精确 split、样本数、全部提示和 checkpoint revision;没有置信区间或多种子结果。本页保留这些缺口,不把作者分数当作独立复跑。

对基础 Qwen,OPLD 在这里每项都更高;V⋆ 为 71.20 → 85.86,HR-8K 为 58.00 → 71.37,按表值相减分别是 +14.66 / +13.37 个百分点。对 SFT,改善覆盖六项,但 HallusionBench 是 66.67 → 65.19,即 −1.48 个百分点。这使“蒸馏全面提高幻觉鲁棒性”成为过强结论。

来源:[S1] Table 1, PDF p.7;差值为按表值计算的解释性推导。

和 latent 方法比较也有例外:HyLaR 的 HR-4K overall 是 75.00,高于 OPLD 的 73.75;V⋆ Spatial 是 85.53,高于 81.58。Laser 的 HallusionBench 是 67.72,也高于 OPLD 的 65.19。更强商用模型与有工具的 agent 在若干项仍领先,因此“部分指标为所报 latent 方法最佳”比“全局最强”更准确。跨方法的增益只能说明整套方案的关联结果,不能当作 Enc–Dec 或 cosine 的单独因果证据。

来源:[S1] Table 1, PDF p.7。

细粒度:FSP 的提升比 FCP 更显著

HRBench 保留原表 FSP / FCP 标签;本论文未展开它们的定义,这里不擅自补写任务语义。HR-4K 的 FSP 从基础模型 75.75 升到 90.00,FCP 从 54.50 升到 57.50;HR-8K 的 FSP 为 63.00 → 87.75,FCP 为 53.00 → 55.00。V⋆ Attribute 为 73.04 → 88.70,Spatial 为 68.42 → 81.58。作者将这些结果解释为 latent 组织细粒度视觉证据更有效,但它们没有直接可视化内部信息整合过程。

来源:[S1] Table 1, PDF p.7; Main Results, PDF p.6。

特权教师参照:接近的是域内差距

在约 5K held-out 域内样本上,带特权输入的预热教师准确率 72.6%,原始输入的预热学生 29.4%,OPLD 学生 65.4%。作者报告学生增益 36.0 个百分点,缩小最初教师–学生差距的 83.3%,剩余 7.2 个百分点。这是域内参照,不是前述外部 benchmark 的总分,也不是教师的理论上界;论文未给出该 held-out 集合的完整拆分协议。

来源:[S1] Privileged Teacher Reference / Figure 5, PDF p.14。

09 · 分三层检验证据:训练方案、接口、真实使用

主结果只能告诉我们系统表现变了。下面逐次收窄问题:整个训练流程是否有效?某类结构是否有帮助?已经学出的向量是否实际参与答案?这三类证据的归因强度不同。

A · 换训练方案:先看整套流程

Fig.4 / Table 5 使用同学生底座与数据,作者称训练 epoch 或 optimizer steps、batch 和学习率日程匹配。下表使用四项 overall 分数;“教师预热”在这里去掉了特权输入再评测,不能与域内 72.6% 的特权教师直接对照。Standard OPD 的教师换成 Qwen2.5-VL-32B,也改变了初始化与轨迹监督条件。

来源:[S1] Effect of Training Strategy, PDF pp.6–7; Table 5, PDF p.13。
查看训练方案四项完整分数
策略V⋆HR-4KHR-8KMME-RW-Lite
基础 Qwen71.2065.1258.0045.75
SFT73.8268.0060.7546.33
仅学生预热73.8266.6358.0048.88
教师预热后移除特权输入73.3064.7556.3843.98
32B 标准 OPD73.3065.2555.5032.83
完整 OPLD85.8673.7571.3753.36
作者报告总体准确率(%,越高越好),LMMS-Eval greedy / 官方配置;MME-RW-Lite = MME-RealWorld-Lite,精确 split 未列。匹配策略来自作者声明,缺少完整算力开销对照。 来源:[S1] Figure 4, PDF p.6; Table 5, PDF p.13。

因果边界这些对照支持整套 OPLD 更有效,也支持去掉特权输入会造成分布迁移;但标准 OPD 同时改变了教师规模、学生预热及 latent 对齐等条件,不能仅凭它失败就断言“大教师无用”或“失败完全由缺少 latent loss 造成”。

来源:[S1] Effect of Training Strategy, PDF pp.6–7。

B · 改槽、接口和 loss:靠近机制问题

查看槽数、接口和 loss 的完整消融表
分组/变体V⋆HR-4KHR-8KMME-RW-LiteAvg.
槽数 K=075.3965.5058.1350.4462.36
槽数 K=478.5372.6271.7551.9068.70
槽数 K=885.8673.7571.3753.3671.09
Raw hidden states78.5371.5067.0048.4166.36
Enc–Dec adapter85.8673.7571.3753.3671.09
Reverse KL + PG + cosine74.8771.3767.7549.9265.98
Top-k forward KL only78.5363.8858.6348.2062.31
Top-k forward KL + cosine85.8673.7571.3753.3671.09
原文 Table 2 的 overall 准确率(%)与四项算术平均,越高越好;全组基于同学生底座及数据,默认设置按原文。K=0 是该消融变体,不等同于未经训练的基础 Qwen。Raw hidden 的具体参数预算匹配、reverse-KL/PG 实现细节未充分展开。 来源:[S1] Table 2, PDF p.7; Table 6, PDF p.13。

第一,K=8 的四项平均最高,但 HR-8K 上 K=4 是 71.75、K=8 是 71.37,因此不能推出“越长越好”。第二,Enc–Dec 优于 raw hidden,但结果没有区分投影空间、额外可训练容量和归一化各自的作用。第三,在当前配置中加 cosine 比 KL-only 更好,支持两类信号互补;reverse KL + PG + cosine 同时改了 KL 方向与优化方式,不能把差距全部归于 reverse KL。

来源:[S1] Tables 2 / 6, PDF pp.7,13。

C · 不重新训练,直接扰动已经学出的向量

这组实验保持模型参数、原始输入与解码配置不变,直接改变答案生成前使用的 latent 状态,不额外训练。与重新训练 K=0 相比,它更直接回答“已经学出的轨迹是否参与输出”。

来源:[S1] Latent Intervention Analysis, PDF pp.13–14。
同一 OPLD 模型的 latent 干预:四项平均下降,单位为百分点对原始轨迹的平均下降(百分点)加入噪声9.29全部置零12.10跨样本交换17.8501020同 checkpoint、原始输入与解码,不重训练
原文 Table 7 的 Avg. Drop:V⋆、HR-4K、HR-8K、MME-RW-Lite 四项平均下降,越小越好。轴从 0 起;不是相对下降百分比,也不是单个任务准确率。

[S1] Table 7, PDF p.13; Latent Intervention Analysis, pp.13–14 · 原文第 13 页 ↗

查看推理期干预的四项分数
推理期状态V⋆HR-4KHR-8KMME-RW-LiteAvg. Drop(百分点)
原始 latents85.8673.7571.3753.36—
加入随机噪声76.9664.1257.5048.629.29
全部置零76.4459.6251.3748.5112.10
跨样本交换轨迹65.4554.6348.2544.6117.85
原文 Table 7;准确率(%)越高越好,Avg. Drop 表示对原始状态的平均下降、越小越好。噪声幅度/分布、交换种子与更细的干预实施位置未充分公开;不把 drop 当相对百分比。 来源:[S1] Table 7, PDF p.13; Intervention Analysis, PDF p.14。

证据强度交换轨迹仍使用模型自己产生的合法表示,却破坏其与当前样本的对应,下降最大。这比仅置零更支持“轨迹携带输入相关信息并影响答案”。但它并不能证明信息一定是可解释的逻辑推理,仍可能混合感知特征、任务线索与答案倾向;也不能给每个槽命名为一个人类解题步骤。

来源:[S1] Intervention Analysis, PDF pp.13–14; Slot-wise alignment limitation, PDF p.12。

回到形状题:教师选错,学生为何仍能选对?

Figure 8 的形状变换例子里,预热教师回答 A、预热学生回答 D,都被标为错误,而蒸馏学生回答 C、标为正确。作者解释:训练使用的是教师在学生路径上的软分布和教师 latent 目标,并非教师独立 greedy rollout 的硬答案。教师 argmax 错了仍可能为正确 token 分配有用概率。这是合理机制解释,但论文没有展示该例子的概率向量或 latent 内部语义,案例不能单独验证解释。

来源:[S1] Figure 8, PDF p.18; Case Studies discussion, PDF pp.14–15。

10 · 方法有效,哪些结论仍不能推出?

作者明确承认的边界

共享底座、Enc–Dec 初始化、维度与槽顺序仅提供共同结构起点;独立全参数预热后 latent 坐标并无严格等价保证。同深度对齐是一种时间归纳偏置,而非语义一一对应定理。作者也明确指出,干预证明轨迹有实际作用,却不确立每个槽或维度的可解释含义,并把 learned mapper、optimal-transport matching 与逐槽 probing 列作后续方向。

来源:[S1] Warmup compatibility / Slot-wise alignment limitation, PDF pp.11–12。

本次阅读的技术评估

  • 教师特权不等于可学习信息。如果辅助图提供原图里无法恢复的证据,学生只能学训练分布上的规律,不能凭蒸馏创造缺失观测。需要按“原图可推断 / 新增观测”区分收益来源。
  • 清洗不是泄漏已消失的证明。过滤合计统计没有人工审计误差或独立泄漏率。定性拼图例子还展示完整场景作为特权图;它是否仍符合“只提供中间证据”的规则、是否属于清洗后保留样本,未明确标注,值得核实。
  • 机制拆分还不足。没有 cosine-only、文字-only 教师、help-image-only 教师、换用学生 Dec 进行教师评分等直接对照;无法分别量化特权信息类型和 decoder 选择的贡献。
  • 统计与外推有限。主表没有置信区间、重复随机种子或跨底座规模检验;训练数据重复 ID 为零不等于验证了 benchmark 内容级去污染。
  • 计算与可复现性有限。未核实官方代码/权重;缺少蒸馏 batch、optimizer 详细设置、top-k 归一化约定、评测配置版本和延迟测量。不能把“少工具”直接写成已测得的速度优势。
来源:[S1] Tables 3–4, PDF pp.10–11; Tables 1–2, PDF p.7; Discussion, PDF p.12; Figures 9 / 12, PDF pp.19,22。

11 · 用三个问题检查自己是否读懂

方法层面:OPLD 的关键是把教师的额外证据放在训练视图里,同时让蒸馏监督落在学生自己的路径上。低维 Enc–Dec 给两个模型提供可校准接口;教师目标轨迹校准表征,教师对学生轨迹评分校准回答。

证据层面:KL-only 与组合 loss 的对照支持 latent 对齐的实际价值,推理期跨样本交换则更直接支持轨迹内容被模型使用。它们共同支撑功能性 latent 计算,但还不能把“抽象推理”解释成每个槽都承载透明的逻辑步骤。

来源:[S1] Method, PDF pp.4–5; Tables 2/7, PDF pp.7,13; Discussion, PDF p.12。
如果教师更有信息,为什么不在测试时直接用教师?

测试时拿不到教师训练视图里的 rationale 和辅助图。直接移除这些输入会改变教师输入分布;OPLD 则始终让学生用原题训练和部署,再用教师反馈改变学生参数。

[S1] Problem Setup, p.3; Training Strategy, pp.6–7 · 原文第 3 页 ↗

为什么教师评分要用学生 codes,却用教师 decoder?

前者把评分定位在学生当前轨迹上,后者把这些 codes 解释为教师自己的输入 embedding。绕过的是教师 Enc;替换为学生 embedding 或教师自己的 codes 都不是附录所述评分接口。

[S1] Tensor-level path / Why decode, pp.11–12 · 原文第 12 页 ↗

把 latent 交换后掉分,能证明每个槽都是一条逻辑步骤吗?

它支持轨迹带着当前样本有关的信息,并参与答案生成;不能区分这些信息究竟是感知线索、任务状态还是答案倾向。槽序只提供递归深度对应,作者也没有给逐槽语义保证。

[S1] Slot-wise alignment, p.12; Table 7, pp.13–14 · 原文第 13 页 ↗

准备复现:从张量接口到评测的检查顺序

若要复现,先落实以下可检查结果;这是本次阅读提出的实验顺序,不是作者已执行的额外实验:

  1. 固定输入数据与清洗决策文件,复核辅助图是否直接暴露答案,以及域内 held-out / 外部 benchmark 的内容重叠。
  2. 先通过一个 batch 验证连续反馈:槽前 hidden → Enc → Dec → 回填;核实 mask 只去掉直接标签,不切断学生的连续梯度。
  3. 逐项打印教师评分接口,确认使用 detached student codes 经教师 Dec,而不是教师自己的 codes 或学生 embeddings。
  4. 确认 top-k 求和的归一化、mask、长度平均及 teacher stop-gradient;再跑 KL-only / KL+cosine,并补 cosine-only 和 decoder 选择对照。
  5. 锁定 LMMS-Eval task/revision、split 与 greedy 配置,记录多次运行的不确定性;加入原始/置零/噪声/交换 latent 干预及统一延迟测量。

12 · 来源、覆盖与图像署名

  1. Zhu et al. · OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1首次提交与版本日期:2026-07-30。版本化 PDF · 原文 HTML。本文页码全部指 PDF 的 1-based 文件页码;原论文未编号的章节使用其英文标题定位,公式、图、表保持原编号。

阅读与证据复核日期:2026-10-10。覆盖 PDF 全文及补充材料;重要数字按原表精度记录,差值明确标为推导,分析判断另设标记。本文没有复现模型,也没有对相关工作的原论文逐篇精读,相关方法介绍以 OPLD 自己的叙述为范围。

原图 Figure 2 / 3 署名 Zhu 等作者,来源为 2607.28154v1。PDF 带有论文版权声明,arXiv 使用 non-exclusive distribution license;这不构成对第三方重新许可图片的开放授权。本文保留署名用于研究解读引用,PaperArbor 的 MIT 代码许可不覆盖论文原图。两张无损 PNG 为保留细字与连线,分别约 456 / 400 KiB,超过常用压缩目标;图片均内嵌,不依赖远程资源。

证据索引:本页完整离线证据索引(仓库另保留 data/evidence/opld-2607.28154.json)。哈希:969774c6fcdfb554d297ce80ff14ac11a642aa9663989b4336be17c95a93aba0。离线单文件正文、目录、图与公式可读;本页的静态证据与查证搜索也已内嵌;返回知识库需要目录,原文外链需要联网。

证据索引

完整 22 页 arXiv:2607.28154v1:方法、训练数据与过滤、实现、全部实验与消融/干预、定性案例。用户 PDF 与版本化 PDF 的 SHA-256 相同。重要事实、教学推导与分析分别登记;官方代码/权重、评测版本、top-k 归一化及延迟仍未核实,未独立复跑。

展开全部 95 条证据(断网可查)
  1. 原文事实

    正式标题、完整作者、ByteDance、首发及v1日期2026-07-30;PDF共22页;首页作者拼写与元数据存在排版差异。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    arXiv abs/2607.28154v1; PDF metadata and p.1

    打开原始来源 ↗ · 返回对应正文 ↑
  2. 分析判断

    用户提供PDF与版本化arXiv PDF均为SHA-256 969774c6fcdfb554d297ce80ff14ac11a642aa9663989b4336be17c95a93aba0。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Retrieved local and primary PDF SHA-256

    打开原始来源 ↗ · 返回对应正文 ↑
  3. 原文事实

    OPLD包含输入不对称的同底座教师学生、递归latent推理、教师自身latent目标与使用学生codes的教师评分两条监督路径。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Method; Additional Method Details, PDF pp.3–5, 11–12

    打开原始来源 ↗ · 返回对应正文 ↑
  4. 原文事实

    作者将显式视觉轨迹与特征代理监督作为动机,主张用CoT诱导的模型内部轨迹监督latent;图形变换例子依据Figure 8。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Introduction / Related Work, PDF pp.1–3; Figure 8, PDF p.18

    打开原始来源 ↗ · 返回对应正文 ↑
  5. 原文事实

    教师学生均初始化于Qwen2.5-VL-7B-Instruct;同底座、同latent结构,不同信息视图;加入适配器后的总参数量未单列。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Additional Implementation Details, PDF p.10; Table 4, PDF p.11

    打开原始来源 ↗ · 返回对应正文 ↑
  6. 分析判断

    组合可解释为表征与行为校准;缺少cosine-only、教师文字与辅助图单独消融,无法完全拆解两种监督必要性。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Discussion, PDF p.12; Table 2, PDF p.7

    打开原始来源 ↗ · 返回对应正文 ↑
  7. 图形证据

    整体训练与推理原图;crop=(75,50,535,253) PDF points,1150×508 lossless PNG,467417 bytes。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Figure 2, PDF p.4

    打开原始来源 ↗ · 返回对应正文 ↑
  8. 原文事实

    递归code=z_k=Enc(h^L_{p_k-1}),embedding=e_k=Dec(z_k);h/e为H维、z为D维;默认K=8 D=2048。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eqs.6,9–10, PDF p.4; Table 4, PDF p.11

    打开原始来源 ↗ · 返回对应正文 ↑
  9. 原文事实

    原文Enc(h)=LN(W2 GELU(W1 LN(h))),Dec(z)=W4 GELU(W3 LN(z));轻量MLP编码解码模块。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eqs.7–8, PDF p.4; Discussion, PDF pp.11–12

    打开原始来源 ↗ · 返回对应正文 ↑
  10. 说明式 / 推导

    三条前向路径分别展示 student Enc→zS→student Dec→eS;teacher Enc→zT→teacher Dec;教师评分使用 sg(zS)→teacher Dec→教师词概率,绕过 teacher Enc,不直接复用学生 embeddings。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Tensor-level path of the three forward processes, PDF pp.11–12

    打开原始来源 ↗ · 返回对应正文 ↑
  11. 说明式 / 推导

    将原文Eq.11和12合写为统一answer-only CE说明式;只监督答案token,prompt/latent槽直接标签mask。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eqs.11–12, PDF pp.4–5

    打开原始来源 ↗ · 返回对应正文 ↑
  12. 原文事实

    蒸馏三前向:current student greedy rollout;privileged teacher independent latent target;teacher scoring使用sg(student codes)经teacher decoder,不重算teacher encoder、不使用student decoded embeddings;teacher所有目标detach,student包括encoder decoder可训练。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eqs.13–17, PDF p.5; Additional Method Details, PDF pp.11–12; Algorithm 1, PDF p.15

    打开原始来源 ↗ · 返回对应正文 ↑
  13. 图形证据

    蒸馏阶段原图crop=(78,52,535,228) PDF points,1142×440 lossless PNG,409283 bytes;概览图省略scoring的latent接口,附录用于精确解释。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Figure 3, PDF p.6

    打开原始来源 ↗ · 返回对应正文 ↑
  14. 原文事实

    原文cosine loss平均于B K个codes,teacher stop-gradient;共同初始化与结构缓解漂移但不保证坐标等价,槽索引对应递归深度而非严格语义。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eq.15, PDF p.5; Warmup compatibility / Slot-wise alignment, PDF pp.11–12

    打开原始来源 ↗ · 返回对应正文 ↑
  15. 原文事实

    教师pT=p_phi(.|xT,sg(zS),yhat_prefix),学生pS=p_theta(.|xS,zS,yhat_prefix),共享学生codes/答案前缀;teacher decoder处理zS,teacher outputs detached。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eqs.16–17, PDF p.5; Algorithm 1, PDF p.15; Tensor-level path, PDF pp.11–12

    打开原始来源 ↗ · 返回对应正文 ↑
  16. 原文事实

    原文Eq.19 top-k teacher support上的pT(log pT-log pS),按student response token长度平均,topk=128;forward KL非reverse KL。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eqs.18–19, PDF p.5; Table 4, PDF p.11

    打开原始来源 ↗ · 返回对应正文 ↑
  17. 分析判断

    正文截断概率求和与附录top-k DKL简写无法确认重归一化;复现需核实softmax/gather/renormalize,不能默认完整KL数学性质。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eq.19, PDF p.5; Complementary distillation objectives, PDF p.12

    打开原始来源 ↗ · 返回对应正文 ↑
  18. 原文事实

    最终配置L=Ltext+0.05 Llat;warmup CE与distill目标分开;policy gradient/task rewards disabled。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eq.20, PDF p.5; Table 4, PDF p.11; Complementary objectives, PDF p.12

    打开原始来源 ↗ · 返回对应正文 ↑
  19. 原文事实

    Zebra-CoT和Visual-CoT归一schema;GPT-5.4 API过滤直接答案泄漏/完成解法,uncertain KEEP;之后验证格式、图引用与重复ID;精确filter prompt公开。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Data Construction / Data Cleaning, PDF p.9

    打开原始来源 ↗ · 返回对应正文 ↑
  20. 原文事实

    训练集统计,单位samples,最终重复sample IDs=0;样本来源=Zebra-CoT;清洗前(样本)=178,695;清洗后(样本)=129,463

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 3, PDF p.10; Data Statistics, PDF p.9

    打开原始来源 ↗ · 返回对应正文 ↑
  21. 原文事实

    训练集统计,单位samples,最终重复sample IDs=0;样本来源=Visual-CoT;清洗前(样本)=88,257;清洗后(样本)=88,257

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 3, PDF p.10; Data Statistics, PDF p.9

    打开原始来源 ↗ · 返回对应正文 ↑
  22. 原文事实

    训练集统计,单位samples,最终重复sample IDs=0;样本来源=合计;清洗前(样本)=266,952;清洗后(样本)=217,720

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 3, PDF p.10; Data Statistics, PDF p.9

    打开原始来源 ↗ · 返回对应正文 ↑
  23. 原文事实

    删除49,232 samples(18.4%),Zebra-CoT占最终59.5%、Visual-CoT40.5%;未拆分泄漏/格式各自删除数。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 3, PDF p.10

    打开原始来源 ↗ · 返回对应正文 ↑
  24. 原文事实

    平均student images=0.97,teacher=3.08,auxiliary=2.11;zero-student-image samples=6580 (3.0%);student/teacher prompt均长147.05/1219.34 characters,非tokens。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 3, PDF p.10

    打开原始来源 ↗ · 返回对应正文 ↑
  25. 原文事实

    三阶段训练配置;配置=初始化;教师预热=Qwen2.5-VL-7B-Instruct;学生预热=Qwen2.5-VL-7B-Instruct;OPLD 蒸馏=两份独立预热 checkpoint

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 4, PDF p.11; Implementation Details, PDF p.10

    打开原始来源 ↗ · 返回对应正文 ↑
  26. 原文事实

    三阶段训练配置;配置=可训练参数;教师预热=全参数;学生预热=全参数;OPLD 蒸馏=仅学生(含 Enc / Dec)

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 4, PDF p.11; Implementation Details, PDF p.10

    打开原始来源 ↗ · 返回对应正文 ↑
  27. 原文事实

    三阶段训练配置;配置=损失;教师预热=答案 CE;学生预热=答案 CE;OPLD 蒸馏=top-128 forward KL + 0.05 cosine

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 4, PDF p.11; Implementation Details, PDF p.10

    打开原始来源 ↗ · 返回对应正文 ↑
  28. 原文事实

    三阶段训练配置;配置=学习率;教师预热=语言模型/merger 1×10⁻⁵;视觉 2×10⁻⁶;学生预热=语言模型/merger 1×10⁻⁵;视觉 2×10⁻⁶;OPLD 蒸馏=1×10⁻⁶;视觉单独 LR 未列

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 4, PDF p.11; Implementation Details, PDF p.10

    打开原始来源 ↗ · 返回对应正文 ↑
  29. 原文事实

    三阶段训练配置;配置=Epoch / 全局 batch;教师预热=1 / 16;学生预热=1 / 16;OPLD 蒸馏=1 / 未列

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 4, PDF p.11; Implementation Details, PDF p.10

    打开原始来源 ↗ · 返回对应正文 ↑
  30. 原文事实

    三阶段训练配置;配置=weight decay / schedule / warmup ratio;教师预热=0.1 / cosine / 0.03;学生预热=0.1 / cosine / 0.03;OPLD 蒸馏=未列 / 未列 / 未列

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 4, PDF p.11; Implementation Details, PDF p.10

    打开原始来源 ↗ · 返回对应正文 ↑
  31. 原文事实

    三阶段训练配置;配置=latent slots / dimension;教师预热=8 / 2048;学生预热=8 / 2048;OPLD 蒸馏=8 / 2048

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 4, PDF p.11; Implementation Details, PDF p.10

    打开原始来源 ↗ · 返回对应正文 ↑
  32. 原文事实

    三阶段训练配置;配置=最大生成长度;教师预热=512 tokens;学生预热=512 tokens;OPLD 蒸馏=256 tokens

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 4, PDF p.11; Implementation Details, PDF p.10

    打开原始来源 ↗ · 返回对应正文 ↑
  33. 原文事实

    三阶段训练配置;配置=最大 prompt 长度;教师预热=未列;学生预热=未列;OPLD 蒸馏=8192 tokens

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 4, PDF p.11; Implementation Details, PDF p.10

    打开原始来源 ↗ · 返回对应正文 ↑
  34. 原文事实

    三阶段训练配置;配置=精度 / 梯度检查点;教师预热=BF16 / 开启;学生预热=BF16 / 开启;OPLD 蒸馏=BF16 / 开启

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 4, PDF p.11; Implementation Details, PDF p.10

    打开原始来源 ↗ · 返回对应正文 ↑
  35. 原文事实

    warmup per-device batch1/global16,TF32 SDPA Liger non-reentrant checkpointing;image pixel range100352–1317120;正文distill8 NVIDIA B200 GPUs,epoch1 LR1e-6;没有训练GPU时/吞吐/峰值显存/adapter总参数。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Experimental Setup, PDF p.5; Additional Implementation Details, PDF p.10

    打开原始来源 ↗ · 返回对应正文 ↑
  36. 原文事实

    测试student-only original image question→K8 recursive codes via student EncDec→answer;去除teacher和privileged inputs,不需显式CoT/auxiliary visual operations;未报告动态停止或test-time scaling。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Inference, PDF p.12; Recursive Latent Reasoning, PDF p.4

    打开原始来源 ↗ · 返回对应正文 ↑
  37. 分析判断

    缺乏cache实现与wall-clock延迟数据,不可把省去外部视觉操作等同量化加速;部署需正确回填embedding与维护递归因果序。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Recursive Latent Reasoning, PDF p.4; Inference, PDF p.12

    打开原始来源 ↗ · 返回对应正文 ↑
  38. 原文事实

    LMMS-Eval official task configs greedy,主实验7 benchmarks;所有Table1 scores percentages higher better;未逐行列split/sample size/prompt/checkpoint revision和eval commit;不独立复跑。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Experimental Setup, PDF p.5; Implementation Details, PDF p.10; Table 1, PDF p.7

    打开原始来源 ↗ · 返回对应正文 ↑
  39. 原文事实

    Table1作者报告;percent, higher better;LMMS-Eval greedy/official task configs,精确split和revision未逐行列明;列为各任务对应overall/汇总分;模型/方法=Qwen2.5-VL-7B;V⋆=71.20;HR-4K=65.12;HR-8K=58.00;MMStar=59.70;Seed2+=65.31;BLINK=53.60;Hall.=56.57

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 1, PDF p.7

    打开原始来源 ↗ · 返回对应正文 ↑
  40. 原文事实

    Table1作者报告;percent, higher better;LMMS-Eval greedy/official task configs,精确split和revision未逐行列明;列为各任务对应overall/汇总分;模型/方法=Qwen2.5-VL-7B + SFT;V⋆=73.82;HR-4K=68.00;HR-8K=60.75;MMStar=61.36;Seed2+=69.38;BLINK=56.56;Hall.=66.67

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 1, PDF p.7

    打开原始来源 ↗ · 返回对应正文 ↑
  41. 原文事实

    Table1作者报告;percent, higher better;LMMS-Eval greedy/official task configs,精确split和revision未逐行列明;列为各任务对应overall/汇总分;模型/方法=Qwen2.5-VL-7B + 32B OPD;V⋆=73.30;HR-4K=65.25;HR-8K=55.50;MMStar=51.52;Seed2+=67.72;BLINK=39.35;Hall.=38.90

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 1, PDF p.7

    打开原始来源 ↗ · 返回对应正文 ↑
  42. 原文事实

    Table1作者报告;percent, higher better;LMMS-Eval greedy/official task configs,精确split和revision未逐行列明;列为各任务对应overall/汇总分;模型/方法=Monet;V⋆=80.10;HR-4K=67.37;HR-8K=64.37;MMStar=60.33;Seed2+=65.88;BLINK=50.71;Hall.=56.36

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 1, PDF p.7

    打开原始来源 ↗ · 返回对应正文 ↑
  43. 原文事实

    Table1作者报告;percent, higher better;LMMS-Eval greedy/official task configs,精确split和revision未逐行列明;列为各任务对应overall/汇总分;模型/方法=HyLaR;V⋆=83.77;HR-4K=75.00;HR-8K=70.50;MMStar=62.00;Seed2+=70.32;BLINK=57.14;Hall.=63.68

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 1, PDF p.7

    打开原始来源 ↗ · 返回对应正文 ↑
  44. 原文事实

    Table1作者报告;percent, higher better;LMMS-Eval greedy/official task configs,精确split和revision未逐行列明;列为各任务对应overall/汇总分;模型/方法=OPLD(预热后蒸馏学生);V⋆=85.86;HR-4K=73.75;HR-8K=71.37;MMStar=63.86;Seed2+=70.88;BLINK=58.56;Hall.=65.19

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 1, PDF p.7

    打开原始来源 ↗ · 返回对应正文 ↑
  45. 说明式 / 推导

    按同表值相减,OPLD vs Qwen V*=85.86-71.20=14.66pp,HR8K=71.37-58.00=13.37pp;OPLD vs SFT Hall=65.19-66.67=-1.48pp。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 1, PDF p.7

    打开原始来源 ↗ · 返回对应正文 ↑
  46. 原文事实

    例外:HyLaR HR4K overall75.00>OPLD73.75,V*Spatial85.53>81.58;Laser Hall67.72>OPLD65.19;作者表中商用/agent仍有领先,不支持全局SOTA。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 1, PDF p.7

    打开原始来源 ↗ · 返回对应正文 ↑
  47. 原文事实

    Qwen→OPLD HR4K FSP75.75→90.00 FCP54.50→57.50;HR8K FSP63.00→87.75 FCP53.00→55.00;V*Attr73.04→88.70 Spatial68.42→81.58;all percentages higher better official configs greedy,原文未展开FSP/FCP定义。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 1, PDF p.7

    打开原始来源 ↗ · 返回对应正文 ↑
  48. 原文事实

    约5K held-out in-domain samples accuracy teacher privileged72.6%, student warmup original29.4%, OPLD original65.4%;作者报告+36.0pp,gap recovery83.3%,remaining7.2pp;greedy official evaluations;完整split protocol未列。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Figure 5 / Privileged Teacher Reference, PDF p.14

    打开原始来源 ↗ · 返回对应正文 ↑
  49. 原文事实

    同Qwen2.5-VL-7B学生/相同数据训练策略,四项overall percent higher better,原始输入下评测;策略=基础 Qwen;V⋆=71.20;HR-4K=65.12;HR-8K=58.00;MME-RW-Lite=45.75

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Figure 4, PDF p.6; Table 5, PDF p.13

    打开原始来源 ↗ · 返回对应正文 ↑
  50. 原文事实

    同Qwen2.5-VL-7B学生/相同数据训练策略,四项overall percent higher better,原始输入下评测;策略=SFT;V⋆=73.82;HR-4K=68.00;HR-8K=60.75;MME-RW-Lite=46.33

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Figure 4, PDF p.6; Table 5, PDF p.13

    打开原始来源 ↗ · 返回对应正文 ↑
  51. 原文事实

    同Qwen2.5-VL-7B学生/相同数据训练策略,四项overall percent higher better,原始输入下评测;策略=仅学生预热;V⋆=73.82;HR-4K=66.63;HR-8K=58.00;MME-RW-Lite=48.88

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Figure 4, PDF p.6; Table 5, PDF p.13

    打开原始来源 ↗ · 返回对应正文 ↑
  52. 原文事实

    同Qwen2.5-VL-7B学生/相同数据训练策略,四项overall percent higher better,原始输入下评测;策略=教师预热后移除特权输入;V⋆=73.30;HR-4K=64.75;HR-8K=56.38;MME-RW-Lite=43.98

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Figure 4, PDF p.6; Table 5, PDF p.13

    打开原始来源 ↗ · 返回对应正文 ↑
  53. 原文事实

    同Qwen2.5-VL-7B学生/相同数据训练策略,四项overall percent higher better,原始输入下评测;策略=32B 标准 OPD;V⋆=73.30;HR-4K=65.25;HR-8K=55.50;MME-RW-Lite=32.83

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Figure 4, PDF p.6; Table 5, PDF p.13

    打开原始来源 ↗ · 返回对应正文 ↑
  54. 原文事实

    同Qwen2.5-VL-7B学生/相同数据训练策略,四项overall percent higher better,原始输入下评测;策略=完整 OPLD;V⋆=85.86;HR-4K=73.75;HR-8K=71.37;MME-RW-Lite=53.36

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Figure 4, PDF p.6; Table 5, PDF p.13

    打开原始来源 ↗ · 返回对应正文 ↑
  55. 分析判断

    标准OPD同时改变教师规模/初始化/监督等,比较不能隔离某单因子因果;teacher warmup removed privilege是分布迁移检验。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Effect of Training Strategy, PDF pp.6–7; Table 5, PDF p.13

    打开原始来源 ↗ · 返回对应正文 ↑
  56. 原文事实

    latent slot/architecture/loss消融,同Qwen2.5-VL-7B方案,LMMS-Eval greedy official configs,percent higher better;分组/变体=槽数 K=0;V⋆=75.39;HR-4K=65.50;HR-8K=58.13;MME-RW-Lite=50.44;Avg.=62.36

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 2, PDF p.7; Table 6, PDF p.13

    打开原始来源 ↗ · 返回对应正文 ↑
  57. 原文事实

    latent slot/architecture/loss消融,同Qwen2.5-VL-7B方案,LMMS-Eval greedy official configs,percent higher better;分组/变体=槽数 K=4;V⋆=78.53;HR-4K=72.62;HR-8K=71.75;MME-RW-Lite=51.90;Avg.=68.70

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 2, PDF p.7; Table 6, PDF p.13

    打开原始来源 ↗ · 返回对应正文 ↑
  58. 原文事实

    latent slot/architecture/loss消融,同Qwen2.5-VL-7B方案,LMMS-Eval greedy official configs,percent higher better;分组/变体=槽数 K=8;V⋆=85.86;HR-4K=73.75;HR-8K=71.37;MME-RW-Lite=53.36;Avg.=71.09

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 2, PDF p.7; Table 6, PDF p.13

    打开原始来源 ↗ · 返回对应正文 ↑
  59. 原文事实

    latent slot/architecture/loss消融,同Qwen2.5-VL-7B方案,LMMS-Eval greedy official configs,percent higher better;分组/变体=Raw hidden states;V⋆=78.53;HR-4K=71.50;HR-8K=67.00;MME-RW-Lite=48.41;Avg.=66.36

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 2, PDF p.7; Table 6, PDF p.13

    打开原始来源 ↗ · 返回对应正文 ↑
  60. 原文事实

    latent slot/architecture/loss消融,同Qwen2.5-VL-7B方案,LMMS-Eval greedy official configs,percent higher better;分组/变体=Enc–Dec adapter;V⋆=85.86;HR-4K=73.75;HR-8K=71.37;MME-RW-Lite=53.36;Avg.=71.09

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 2, PDF p.7; Table 6, PDF p.13

    打开原始来源 ↗ · 返回对应正文 ↑
  61. 原文事实

    latent slot/architecture/loss消融,同Qwen2.5-VL-7B方案,LMMS-Eval greedy official configs,percent higher better;分组/变体=Reverse KL + PG + cosine;V⋆=74.87;HR-4K=71.37;HR-8K=67.75;MME-RW-Lite=49.92;Avg.=65.98

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 2, PDF p.7; Table 6, PDF p.13

    打开原始来源 ↗ · 返回对应正文 ↑
  62. 原文事实

    latent slot/architecture/loss消融,同Qwen2.5-VL-7B方案,LMMS-Eval greedy official configs,percent higher better;分组/变体=Top-k forward KL only;V⋆=78.53;HR-4K=63.88;HR-8K=58.63;MME-RW-Lite=48.20;Avg.=62.31

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 2, PDF p.7; Table 6, PDF p.13

    打开原始来源 ↗ · 返回对应正文 ↑
  63. 原文事实

    latent slot/architecture/loss消融,同Qwen2.5-VL-7B方案,LMMS-Eval greedy official configs,percent higher better;分组/变体=Top-k forward KL + cosine;V⋆=85.86;HR-4K=73.75;HR-8K=71.37;MME-RW-Lite=53.36;Avg.=71.09

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 2, PDF p.7; Table 6, PDF p.13

    打开原始来源 ↗ · 返回对应正文 ↑
  64. 分析判断

    K4 HR8K71.75高于K8 71.37不支持严格单调;EncDec/raw对照未拆解空间/容量/归一化;RevKL+PG与ForwardKL相比同时改变方向和优化,不隔离KL因果。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Tables 2 / 6, PDF pp.7,13

    打开原始来源 ↗ · 返回对应正文 ↑
  65. 原文事实

    同一训练后OPLD checkpoint,same original input/greedy配置,only latents changed,不训练;four overall benchmarks and mean drop in percentage points;推理期状态=原始 latents;V⋆=85.86;HR-4K=73.75;HR-8K=71.37;MME-RW-Lite=53.36;Avg. Drop(百分点)=—

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 7, PDF p.13; Intervention Analysis, PDF p.14

    打开原始来源 ↗ · 返回对应正文 ↑
  66. 原文事实

    同一训练后OPLD checkpoint,same original input/greedy配置,only latents changed,不训练;four overall benchmarks and mean drop in percentage points;推理期状态=加入随机噪声;V⋆=76.96;HR-4K=64.12;HR-8K=57.50;MME-RW-Lite=48.62;Avg. Drop(百分点)=9.29

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 7, PDF p.13; Intervention Analysis, PDF p.14

    打开原始来源 ↗ · 返回对应正文 ↑
  67. 原文事实

    同一训练后OPLD checkpoint,same original input/greedy配置,only latents changed,不训练;four overall benchmarks and mean drop in percentage points;推理期状态=全部置零;V⋆=76.44;HR-4K=59.62;HR-8K=51.37;MME-RW-Lite=48.51;Avg. Drop(百分点)=12.10

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 7, PDF p.13; Intervention Analysis, PDF p.14

    打开原始来源 ↗ · 返回对应正文 ↑
  68. 原文事实

    同一训练后OPLD checkpoint,same original input/greedy配置,only latents changed,不训练;four overall benchmarks and mean drop in percentage points;推理期状态=跨样本交换轨迹;V⋆=65.45;HR-4K=54.63;HR-8K=48.25;MME-RW-Lite=44.61;Avg. Drop(百分点)=17.85

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 7, PDF p.13; Intervention Analysis, PDF p.14

    打开原始来源 ↗ · 返回对应正文 ↑
  69. 分析判断

    交换轨迹降幅最大支持样本相关信息功能贡献,不证明每槽可解释推理语义或区分感知信息/推理/答案倾向。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 7, PDF p.13; Intervention Analysis, PDF p.14; Slot-wise alignment, PDF p.12

    打开原始来源 ↗ · 返回对应正文 ↑
  70. 原文事实

    定性Tetris案例teacher=A incorrect,warmup student=D incorrect,OPLD=C correct;作者用soft distribution与different scoring trajectory解释,不提供实例概率/latent语义。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Figure 8, PDF p.18; Case Studies discussion, PDF pp.14–15

    打开原始来源 ↗ · 返回对应正文 ↑
  71. 原文事实

    作者承认坐标漂移与槽语义非一一对应;functional utility不建立每维语义;learned latent mapper/OT matching/probing是未来方向。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Discussion, PDF pp.11–12

    打开原始来源 ↗ · 返回对应正文 ↑
  72. 分析判断

    分析:额外观测未必由原图可恢复;过滤无审计误差,complete-scene jigsaw案例清洗保留状态未标明;缺cosine-only/input/decoder对照;无CI/multiseed/跨底座实验和内容级去污染保证;代码权重未核实、超参/评测revision/latency缺口。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Tables 1–4, PDF pp.7,10–11; Discussion, PDF p.12; Figures 9/12, PDF pp.19,22

    打开原始来源 ↗ · 返回对应正文 ↑
  73. 分析判断

    可带走机制为信息不对称教师+student on-policy轨迹+latent interface校准,证据支持功能性贡献但不建立逐槽可解释逻辑。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Method, PDF pp.4–5; Tables 2/7, PDF pp.7,13; Discussion, PDF p.12

    打开原始来源 ↗ · 返回对应正文 ↑
  74. 分析判断

    复现检查列表与追加对照为编辑建议,非作者已执行结果。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Based on implementation gaps in PDF pp.10–12; Tables 2/7, PDF pp.7,13

    打开原始来源 ↗ · 返回对应正文 ↑
  75. 图形证据

    原图作者署名;PDF License=arxiv nonexclusive-distrib/1.0与首页版权声明,MIT代码许可不覆盖paper figures;两张PNG超350KB为保持label legibility。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    PDF metadata / p.1 copyright notice; Figure 2 p.4 / Figure 3 p.6

    打开原始来源 ↗ · 返回对应正文 ↑
  76. 原文事实

    贯穿例来自黄色形状的水平镜像与连续平移;题目指令学生也可见,解题文字与中间图是教师特权。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Figure 8, PDF p.18

    打开原始来源 ↗ · 返回对应正文 ↑
  77. 原文事实

    学生和教师同底座但可见输入不同;教师更丰富信息不代表本方案必须换成更大的模型。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eqs.1–2, PDF p.3; Implementation p.10

    打开原始来源 ↗ · 返回对应正文 ↑
  78. 说明式 / 推导

    教学术语对应:h为最后层状态,z为Enc后的D维code,e为Dec后的H维输入embedding,ŷ为当前学生生成答案;向量不是词或图片。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eqs.4–10, PDF pp.3–4

    打开原始来源 ↗ · 返回对应正文 ↑
  79. 图形证据

    一轮反馈重绘:h→Enc→D维z→Dec→H维e→回填后重新前向;返回箭头指下一轮状态计算,K=8 D=2048,H只用符号。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eqs.6–10, PDF p.4; Table 4, p.11

    打开原始来源 ↗ · 返回对应正文 ↑
  80. 原文事实

    第一个code读assistant prompt末端最后层状态;后续读当前槽之前的位置。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eqs.6,9–10, PDF p.4

    打开原始来源 ↗ · 返回对应正文 ↑
  81. 说明式 / 推导

    Enc建立可训练code接口;低维投影不自动赋予可解释推理语义。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eqs.6–7, PDF p.4; Discussion pp.11–12

    打开原始来源 ↗ · 返回对应正文 ↑
  82. 原文事实

    Dec映回H维embedding并回填,后续code依赖此前反馈;固定K轮后开始回答。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eqs.8–10, PDF p.4

    打开原始来源 ↗ · 返回对应正文 ↑
  83. 原文事实

    学生以原始输入递归生成codes并greedy回答;确定性生成仍为当前student on-policy轨迹。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eq.13, PDF p.5; Student rollout p.11

    打开原始来源 ↗ · 返回对应正文 ↑
  84. 原文事实

    教师用特权输入独立递归产生自己的codes用于cosine,同槽序是递归深度,不是语义保证。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eqs.14–15, PDF p.5; Tensor-level path pp.11–12

    打开原始来源 ↗ · 返回对应正文 ↑
  85. 原文事实

    评分使用学生codes经冻结教师Dec解码,教师Enc旁路;两侧使用相同学生答案前缀,但views、decoder、embeddings和参数不同。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eqs.16–17, PDF p.5; Tensor-level path pp.11–12

    打开原始来源 ↗ · 返回对应正文 ↑
  86. 说明式 / 推导

    离散greedy选择只定义评分路径,不提供连续梯度;连续latent和学生概率路径训练学生,最终无PG或任务reward。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Algorithm 1, PDF p.15; Tensor-level path pp.11–12

    打开原始来源 ↗ · 返回对应正文 ↑
  87. 原文事实

    前两阶段各自全参数预热、只标答案;第三阶段冻结teacher,仅student底座与Enc/Dec更新。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eqs.11–20, PDF pp.4–5; Table 4, p.11

    打开原始来源 ↗ · 返回对应正文 ↑
  88. 分析判断

    过滤控制教师捷径而非新增模型loss;对辅助上下文的不确定判断偏KEEP,重复ID清除不是内容级去污染证明。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Data Cleaning, PDF p.9; Table 3, p.10

    打开原始来源 ↗ · 返回对应正文 ↑
  89. 图形证据

    0–100轴,percent higher better,LMMS-Eval greedy作者报告;Base/SFT/OPLD V⋆71.20/73.82/85.86;HR8K58.00/60.75/71.37;Hall56.57/66.67/65.19;包含OPLD低于SFT的例外。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 1, PDF p.7; Experimental Setup p.5

    打开原始来源 ↗ · 返回对应正文 ↑
  90. 图形证据

    同一checkpoint原始输入/解码仅改latents,不额外训练;四任务平均下降百分点 noise9.29 zero12.10 shuffle17.85,轴0–20;下降非相对百分比。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Table 7, PDF p.13; Intervention pp.13–14

    打开原始来源 ↗ · 返回对应正文 ↑
  91. 说明式 / 推导

    对非零向量,方向越接近则1−cos越小;这项监督校准同深度code的方向,不赋予槽语义。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eq.15, PDF p.5

    打开原始来源 ↗ · 返回对应正文 ↑
  92. 说明式 / 推导

    文本项按教师概率加权候选词,使学生学习其相对偏好;top-k归一化约定仍未知。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eq.19, PDF p.5; Complementary objectives, p.12

    打开原始来源 ↗ · 返回对应正文 ↑
  93. 说明式 / 推导

    loss系数控制两项优化相对权重;当前组合有消融支持,不证明通用最优权重。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Eq.20, PDF p.5; Table 4, p.11; Table 2, p.7

    打开原始来源 ↗ · 返回对应正文 ↑
  94. 图形证据

    原题图和五步中间图分别裁切并列:题图 crop=(154,159,217,265),440×740 PNG 29040 bytes;中间图 crop=(154,488,403,672),1200×886 PNG 68632 bytes。原题图与操作指令学生可见;辅助中间图和 rationale 是教师训练期特权输入,测试学生不接收或生成这些辅助图。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Figure 8, PDF p.18; Problem Setup p.3; Inference p.12

    打开原始来源 ↗ · 返回对应正文 ↑
  95. 原文事实

    整体原图右侧为教师预热、学生预热、蒸馏,绿色 Deploy Student 指向左侧部署路径;推理仅原图与问题、学生 Enc–Dec latent 回路和答案,不含教师或辅助图。

    OPLD: On-Policy Latent Distillation for Multimodal Reasoning · v1
    Figure 2, PDF p.4; Three-Stage OPLD Training pp.4–5

    打开原始来源 ↗ · 返回对应正文 ↑