PAPERARBOR / SERIES
Qwen-VL 系列:从视觉摘要到 Qwen3.5 原生多模态
从报表问题走通 Qwen-VL 到 Qwen3.5:按计算步骤解释视觉预算、位置、跨层融合与混合注意力;包含跨代对照、训练与推理边界,以及可离线搜索的逐项证据。
目录 / 跳转到章节
01 / 导读:视觉信息如何进入语言推理
给模型一张密集的财务报表,再问“哪项收入同比下降,证据在哪一格?”这个任务同时要求看清小字、保留二维位置、理解表格关系,还要用语言完成推理。Qwen-VL 系列的演进,可以沿着这条信息流来读:视觉信息先被怎样采样,再被怎样压缩,最后在语言模型里怎样被使用。
第一代用固定长度的视觉摘要连接图像与语言;Qwen2-VL 让视觉 token 数随图像变化,并为图像和视频保留空间与时间坐标;Qwen2.5-VL 进一步处理高分辨率计算成本与真实时间;Qwen3-VL 把多层视觉特征送进语言模型,并把长上下文、蒸馏和强化学习纳入能力构建。Qwen3.5 则以早期多模态融合与混合注意力主干,把视觉语言理解纳入统一基础模型。下文保留四篇原始报告的精读,并补充 Qwen3.5 的版本固定官方资料,先讲机制,再看证据。
阅读范围覆盖 2023–2026 年的 Qwen-VL → Qwen3.5 主线。前四代依据完整原始论文;Qwen3.5 依据固定 revision 的官方模型卡、发布配置、参考实现和官方发布文。本次未核实到独立的 Qwen3.5 技术报告,发布文仍提到后续报告,因此不将本章称为“第五篇论文全文精读”。不混入 Qwen3.5-Omni 或后续型号。核查日期为 2026-10-10。时间线前四点为 arXiv 论文首发,最后一点为模型首发,两种日期明确分开。
证据约定“论文事实”有原文定位;“说明式”是为解释机制写出的等价或简化表达;“分析判断”是本页的技术评估。跨代主结果用于观察能力变化,不作为单一模块的因果证据。
02 / Paper Overview:比较之前先对齐口径
这条主线都保留视觉编码、模态连接与自回归文本输出,但 Qwen3.5 的语言主干改为混合 token mixer,训练也强调原生多模态早期融合。而“视觉 token”在不同代的生成方式并不相同;同样叫 7B 的发布名,也不等于总模型参数完全相同。下面分别列出连接方式、训练计量和上下文设置。
模型地图:同一个报表问题,变化发生在哪里?
“视觉 token”在这里指送到语言序列中的连续特征向量,不是先把图片识别成文字再送入模型。Merger 连接视觉特征宽度与语言 embedding 宽度;语言模型在视觉条件下生成文本。先比较变化的落点,再展开各代细节。[S1] §2.1–2.2;[S2] §2.1;[S3] §2.1;[S4] §2。
Qwen-VL · 固定摘要入口
- 信息怎么走
- 图像被缩放后编码,学习 query 从视觉特征中取信息,形成固定长度摘要;摘要与问题进入语言模型。
- 改动落点
- 连接器压缩序列,位置感知帮助在压缩时保留空间信息。
- 仍有约束
- 固定输入尺度与固定摘要预算仍可能限制小字;增加语言推理不能还原已丢掉的视觉细节。
[S1] §2.1–2.2;约束中的部署含义为机制分析,非新增实验结论。
Qwen2-VL · 按网格分配视觉预算
- 信息怎么走
- 动态尺寸图像产生可变长度特征;局部 merger 把邻近 patch 变成视觉 token,M-RoPE 给语言侧的视觉位置保留时空坐标。
- 改动落点
- 替换固定全局摘要,保留局部网格结构;输入面积会影响序列长度。
- 仍有约束
- 较多 token 带来编码、prefill 与缓存成本;动态不代表无限像素预算。
[S2] §2.1;约束中的部署含义为机制分析,非新增实验结论。
Qwen2.5-VL · 在视觉编码与时间表示上优化
- 信息怎么走
- 保留动态网格和 merger;ViT 多数层只计算窗口内关系,少量全局层连通远处;时间 ID 与绝对时间对齐。
- 改动落点
- 窗口影响 ViT 内部计算,时间编码影响视频事件关系,二者不等于减少所有语言 token。
- 仍有约束
- 远距传播仍需全局层;视频采样仍可能遗漏短暂事件。
[S3] §2.1–2.1.3;约束中的部署含义为机制分析,非新增实验结论。
Qwen3-VL · 把中间视觉信息送到语言层
- 信息怎么走
- 最终 merger 进入序列;不同深度视觉特征经专用 merger 加到语言层的对应视觉位置。视频另加入文本时间戳。
- 改动落点
- 新增的是跨层特征支路,改变表示内容,而不是把 DeepStack 特征追加为更多序列位置。
- 仍有约束
- 内部消融支持部分文档任务收益,却不能保证所有任务改善。
[S4] §2.2–2.3; Table 12;约束中的部署含义为机制分析,非新增实验结论。
Qwen3.5 · 在统一基础上改变语言计算
- 信息怎么走
- 选定旗舰把最终视觉 token 与文本组成序列;语言主干交替使用递归状态更新和显式注意力,每层配 MoE。
- 改动落点
- 混合的是语言层计算;旗舰不启用前代 DeepStack 中间支路。
- 仍有约束
- 视觉预算与部分 KV cache 仍在,完整训练配方及受控架构消融不足。
[S5] Model Overview; config.json;约束中的部署含义为机制分析,非新增实验结论。
| 维度 | Qwen-VL [S1] | Qwen2-VL [S2] | Qwen2.5-VL [S3] | Qwen3-VL [S4] | Qwen3.5 [S5]–[S8] |
|---|---|---|---|---|---|
| 研究定位 | 中英视觉理解、文字阅读、定位与对话 | 不同分辨率、长宽比与视频的统一理解 | 高效精细感知、文档解析、视频定位与 GUI 操作 | 长上下文、多模态推理和图像辅助工具使用 | 统一原生视觉语言基础模型与 Agent 能力;本节以旗舰为配置样本 |
| 语言主干 | Qwen-7B;Table 1:LLM 7.7B,总计 9.6B | Qwen2;发布名 2B / 7B / 72B;ViT 675M | Qwen2.5;报告列 3B / 7B / 72B | Qwen3;Dense 2B / 4B / 8B / 32B;MoE 30B-A3B / 235B-A22B | 旗舰 397B-A17B;60 层,每组 3 个 Gated DeltaNet + 1 个 Gated Attention;稀疏 MoE |
| 视觉连接器 | 单层 Cross-attention;256 个学习 query | 相邻 2×2 patch 压缩为一个 token | 2×2 特征拼接 + 两层 MLP | MLP merger + 三层中间视觉特征的 DeepStack | 空间 2×2 merger;旗舰 deepstack_visual_indexes=[],不沿用前三层 DeepStack 注入 |
| 图像处理 | 224² → 448² 固定分辨率 | Naive Dynamic Resolution;2D-RoPE | 动态分辨率;ViT 32 层中 4 层全局注意力 | SigLIP-2 初始化;动态分辨率持续训练 | 旗舰 ViT 27 层;patch=16、temporal patch=2;动态网格 |
| 位置表示 | 适配器显式加入二维绝对位置 | 时间 / 高度 / 宽度三分量 M-RoPE | 时间分量与绝对时间对齐 | 交错分配三轴旋转频率;文本时间戳 | 交错 M-RoPE;全注意力层 partial rotary factor=0.25;视频文本时间戳 |
| 训练计量 | 清洗后 1.4B 图文对;不是 1.4T tokens | 预训练累计 1.4T 图像与文本 tokens | 三个阶段 1.5T + 2T + 0.6T | S0 67B;S1 ~1T;S2 ~1T;S3 100B tokens | 官方描述规模扩大与早期图文融合;本次来源没有逐阶段精确 token 总量 |
| 后训练 | 350K 指令样本;SFT | ChatML 多模态指令微调 | 约 2M SFT 样本;SFT + DPO | Instruct / Thinking 分支;SFT、蒸馏与 RL | 规模化文本/多模态/多轮 RL;同 checkpoint 支持 thinking 开关;精确 loss / 课程未公开 |
| 长序列证据 | 多任务阶段 pack 为 2048 | 视频训练 token 上限 16384;有长度外推实验 | 长上下文预训练阶段为 32768 | 原生上下文训练至 262144;外推另行评测 | 旗舰原生 262144 tokens;YaRN 扩至 1010000 属外推配置,另于托管 Plus |
作者与版本:Jinze Bai 等 [S1] v1;Peng Wang 等 [S2] v2;Shuai Bai 等 / Qwen Team [S3] v1;Qwen Team [S4] v2。完整标题、作者与版本日期列于原始来源。
03 / Qwen-VL:用位置感知的视觉摘要连接语言
Motivation:看懂图,不等于读懂图里的字和位置
早期视觉语言模型已经能描述整张图片,但任务一旦转为文字识别、指定区域描述或中英多轮对话,单纯的全局图文相似性不够。Qwen-VL 的选择是保留已有 Qwen 语言能力,增加能够处理细粒度图像的编码器,再通过视觉指令数据把图像理解、OCR、定位和对话放入同一种生成接口。[S1] §1、§5。
Architecture / Method:从 patch 到 256 个视觉 token
输入形态:从像素变为 patch 特征
图像 resize 后切成步长 14 的 patch,送入由 OpenCLIP ViT-bigG 初始化的编码器。提高分辨率可以减少小字在降采样时的损失,但视觉特征序列会变长。[S1] §2.1、§3.1–3.2。
这些向量代表图像局部及其上下文,不是已经读出的字符。对报表而言,缩放会先影响小字是否还可辨;后面的压缩再精巧,也不能恢复被预处理抹掉的信息。后一句为输入机制的分析。[S1] §2.1。
压缩:学习 query 怎样取出视觉摘要
单层 Cross-attention 的 query 来自学习向量,key 来自图像特征。输出固定为 256 个视觉摘要向量,而不是把全部 patch 直接塞进语言模型。适配器对 query-key 加入二维绝对位置编码,使压缩仍能使用空间信息。[S1] §2.1。
每个 query 对视觉 key 计算匹配,再把对应 value 加权汇总。因此输出的序列长度由 query 个数决定,而不是由图像 patch 个数决定。学习的是“怎样取信息”的参数,测试时仍计算同一连接器;它不是按用户问题临时分配的一组自然语言问题。[S1] §2.1;匹配过程的简化见下面说明式。
连接:摘要与问题组成语言输入
视觉向量与文本 token embedding 组合,图像片段用 <img> / </img> 标界。多张图额外用 Picture id: 标明输入顺序。语言模型随后自回归生成答案。[S1] §2.2、§3.3。
关键连接是通道兼容、序列拼接和边界标记。语言侧看到的是视觉向量与文本 embedding 的混合上下文,随后预测回答文本;这与先 OCR 出报表文字再运行纯文本 Qwen 的路径不同。[S1] §2.1–2.2。
输出:定位为什么仍是文本任务
边界框归一化到 [0,1000),以坐标字符串输出,使用 <box> 与 <ref> 区分框和指代内容。因此区域定位不需要单独加入一个检测输出词表。[S1] §2.2。
坐标字符串由同一个生成接口输出,边界标记把位置与指代内容联系起来。训练的 grounding 样本教模型生成对应格式;真正点击或解析边界框属于应用后处理,不能把生成字符串视为已经完成外部操作。[S1] §2.2;外部执行部分为工程分析。
中文解释:每个学习 query 对图像特征计算匹配权重,再把 value 加权求和;输出长度由 query 数决定。Q、K、V 表示投影后的向量,d 是注意力维度。实际适配器还包含论文强调的位置处理,此说明式省略位置与投影细节,不能作为完整复现代码。
说明式,依据 [S1] §2.1 的单层 Cross-attention 描述重写;原文没有这条对应编号公式。
Training:不是冻结一切,只训练连接器
第一阶段冻结 LLM,训练视觉编码器与适配器,输入 224×224 图像,目标为文本 token 的交叉熵。Table 2 从原始约 5B 图文对清洗出 1.4B;§3.1 另外报告实际训练消费约 1.5B 图文样本、500B 图文 tokens。这些是不同计量对象,不能当作相互矛盾的单一“数据量”。公开源包含 LAION、DataComp、COYO、CC 系列等,也有内部数据。[S1] Table 2、§3.1。
第二阶段放开全模型,输入升到 448×448,加入 caption、VQA、grounding、OCR 与纯文本生成等七种任务,并把图文样本拼成长度 2048 的序列。第三阶段用 350K 指令样本得到 Qwen-VL-Chat,冻结视觉编码器、训练 LLM 和适配器;只监督回答与相应特殊 token,不对角色名和用户问题施加回答损失。[S1] Table 3、§3.2–3.3。
读训练流程冻结语言模型不等于语言模型不参与前向计算:目标文本仍经语言模型产生概率,误差信号用于更新允许学习的视觉侧与连接器。到了联合阶段才让语言参数一起适应;SFT 又锁定视觉侧。这是原阶段设置的计算含义,不是新增阶段或新的实验结论。 [S1] §3.1–3.3 / Figure 3。
Inference:从报表问题生成回答与位置
对于开头的报表任务,第一代的工作路径是:统一缩放 → ViT → 256-token 压缩 → ChatML 提问 → 生成答案或框。这一接口统一且视觉前缀长度固定,但细节先受输入分辨率限制,再经过固定长度压缩。分析判断一张信息密度很高的长表与一张简单照片使用相同摘要预算,可能形成信息瓶颈;这是机制层面的推断,并非报告中的定量消融结论。
Experiments:聊天对齐不保证每项涨分
报告 Table 6 给出 Qwen-VL 在 TextVQA 为 63.8、DocVQA 为 65.1;Qwen-VL-Chat 分别为 61.5 与 62.6。指令微调并非在每个任务上都涨分。这说明应该区分基础模型的基准能力与聊天版本的交互能力。该表不构成后续版本的统一复测协议,下面的跨代实验也不会把它强行连成一条可比曲线。
作者在 §6 把视频、更多模态、扩大数据与模型列作后续方向;本报告不支持原生长视频理解。选定 v1 没有把 query 数、输入尺寸、二维位置机制全部控制变量拆开的系统消融,不能编造“256 个 query 是最优”的结论。
04 / Qwen2-VL:让视觉预算随输入变化
Core Insight:别在理解之前把输入细节丢掉
固定 resize 会迫使高长宽比文档或高分辨率图像在统一尺度里压缩。Qwen2-VL 沿用视觉编码器加语言模型的骨架,替换输入与连接机制:保留可变图像尺度,让视觉序列长度随内容载体变化,同时让 LLM 显式得到时间、高度与宽度位置。[S2] §2.1。
Method:动态分辨率、局部压缩与 M-RoPE
输入:保留长宽比与动态网格
原固定绝对位置 embedding 改为 2D-RoPE。不同长宽比图像被编码为不同长度的 patch 序列;推理时将可变长度输入 packing,并控制总长度来管理显存。[S2] §2.1。
输出是可变长度视觉特征;“动态”指尺寸与预算可调整,并不是不经 resize 或免费接受任何大图。回到长报表,保留长宽关系有机会减少统一方形缩放带来的细节损失,但具体采样上限仍决定看到多少。[S2] §2.1;后一句为分析。
连接:局部合并与固定摘要有何不同
相邻 2×2 patch 经 MLP 压缩到一个视觉 token,随后加 <|vision_start|> 和 <|vision_end|>。空间分组不会固定总视觉 token 数,较大图像可以保留较长序列。[S2] §2.1。
Merger 的输入是相邻视觉特征,输出是更短、与语言 embedding 对齐的连续序列。局部压缩保留网格对应关系,空间位置数仍随输入面积变化;不再由一组全局 query 把所有图片压到相同长度。下式只计算静态图像的位置数。[S2] §2.1。
位置:坐标怎样进入语言注意力
文本的时间、高度、宽度 ID 相同,效果等价于一维 RoPE;图像时间 ID 固定,高宽 ID 随网格位置变化;视频时间 ID 随帧递增。混合模态片段的起始编号使用前一片段最大位置 ID 加一。[S2] §2.1、Figure 3。
M-RoPE 的三个位置分量作用于旋转位置表示,不是额外预测三个坐标标签。对报表,这让视觉位置的“哪一行、哪一列”有独立编码;它并不替代读取字符、比较数值或寻找表头的任务。[S2] §2.1 / Figure 3;后半为机制解释。
时间:帧组与视频预算怎样连接
视频采样为 2 FPS,时间深度 2 的 3D 卷积把相邻帧做成 tube;静态图像用重复的两帧表示以保持同一路径。训练通过调节每帧分辨率把每段视频的总 tokens 限制到 16384,避免帧数与分辨率同时无约束增长。[S2] §2.1。
时间分组之后仍有每组的空间 token。增加帧数与提高每帧分辨率都会推高输入预算,因此长视频要一起控制采样、空间网格和总序列长度。视频统一解决表示入口问题,不保证未被采到的瞬时事件能被恢复。[S2] §2.1;预算与遗漏含义为工程分析。
中文解释:patch 步长是 14,2×2 合并后,一个视觉 token 覆盖 28×28 输入像素。H′、W′ 是调整后且网格对齐的尺寸;这里不计边界特殊 token。224×224 图像得到 64 个视觉 token,加两个边界 token 后是论文举例的 66。视频还要考虑时间分组,不能直接拿此图像式计算任意视频。
说明式,依据 [S2] §2.1 的 patch size、2×2 合并及 224×224 示例;[S3] §2.1 显式描述输入高宽调整到 28 的倍数。
Training:视觉条件与文本监督
[S2] §2.2 的三阶段策略为:先训练 ViT,再全参数联合训练,最后冻结 ViT、对 LLM 进行指令微调。第一与第二个预训练阶段分别消费约 600B 和 800B tokens,总计 1.4T,统计包含图像与文本,但监督只施加在文本 token 上。数据来自清洗网页、开放数据与合成数据,覆盖 OCR、交错图文、VQA、视频和视觉知识。模型不是通过重建每个像素来学会回答。
Inference:像素、帧数与序列预算
推理时应将每图的像素预算、视频帧数与全序列长度一起控制。提高图片分辨率会让视觉前缀变长,从而增加 ViT 计算和 LLM prefill/KV cache。M-RoPE 改善的是位置表示与外推能力,不会使可变长度输入的成本消失。复现动态分辨率实验时要记录 min_pixels、max_pixels 与实际 token 均值;只报“原生分辨率”不足以重现实验。
Experiments / Ablation:不是分辨率越大越好
Table 2 中 Qwen2-VL-72B 在 MMMU val 为 64.5、MathVista testmini 为 70.5、DocVQA test 为 96.5。同期表内 Claude-3.5-Sonnet、GPT-4o 的 MMMU 分别为 68.3、69.1。该代在文档感知上很强,但不能用“看得更清楚”直接替代大学级综合推理能力。[S2] Table 2、§3.2。
最有解释力的是 Table 7:在 Qwen2-VL-7B 上,固定 3136 图像 tokens 得到 InfoVQA 77.27、OCRBench 786;动态策略平均 1924 tokens,对应 75.89、866。动态策略没有在每个任务上都赢,但用更少的平均 tokens 获得较稳健的综合表现。Figure 4 还指出把很小图像过度放大可能使 OCRBench 退化。[S2] §3.3.1。
Table 8 的 M-RoPE 消融使用 Qwen2-1.5B + ViT-L 的预训练模型,而非发布的 72B 指令模型。MathVista 从 39.2 到 43.4,NextQA 从 43.9 到 46.0;RealWorldQA 则从 54.5 到 53.7,InfoVQA 从 50.8 到 50.3。正确结论是收益有任务差异,视频位置建模有证据支持,不能声称所有任务单调提升。[S2] §3.3.2、Table 8。
局限作者在导航任务讨论中指出,多图生成的地图信息不完整且非结构化,三维地图与位置建模仍有挑战。[S2] §3.2.7(Visual Agent)。动态分辨率帮助保留信息,却没有解决所有空间推理和知识缺口。
05 / Qwen2.5-VL:把高分辨率与真实时间做实
Motivation:保留更多输入以后,瓶颈转向计算和时间
动态分辨率让文档更清晰,也暴露 ViT 全局注意力的计算成本。视频里,相邻采样帧的序号只告诉模型先后,不能保证相同位置差对应相同秒数。Qwen2.5-VL 沿用局部 merger 和多轴位置编码,重点改造视觉编码器、视频时间表示与训练数据。[S3] Introduction、§2.1。
Method:窗口、空间尺度与绝对时间
视觉编码:窗口内匹配与跨窗口传播
ViT 共 32 层,全注意力 block index 为 {7,15,23,31},其余使用最大 112×112 像素,即 8×8 patch 的窗口。小于窗口的区域不必 padding。全局层仍让远距离区域交换信息,不能把整个 ViT 的复杂度称为纯线性。[S3] Table 1、§2.1.1。
窗口层只让区域内部的 patch 互相计算关系,全局层再允许远处特征交互。对跨列报表,远处关系并没有被永久切断;只是每层都全局配对被改成多数层局部、少数层全局。Merger 后的语言序列预算另算。[S3] §2.1.1 / Table 1。
连接:拼接改变通道,投影改变接口
使用 RMSNorm 与 SwiGLU,配合 2D-RoPE 和从零训练的视觉编码器。图像高宽调整到 28 的倍数,patch stride 为 14,四个相邻 patch 特征拼接后,经两层 MLP 对齐语言 hidden size。[S3] §2.1。
用符号描述,设四个邻近特征各为 d_v 宽,拼接先形成 4d_v 宽,再由 MLP 投到语言宽度 d_l;与此同时位置数减少。这里是 §2.1 的形状解释,不补具体型号尺寸,也不意味着每个拼接位置就是识别出的单个文字。
时间:相同帧序号为什么不等于相同秒数
训练时覆盖不同采样帧率,把 MRoPE 时间 ID 与真实时间对齐。采样率变化以后,位置间隔仍能表达事件间的时间距离。它不是只给模型更多帧,也不是把时间轴的序号简单加大。[S3] §2.1.2–2.1.3。
同一事件在不同采样率下可能落在不同帧号。把时间 ID 绑定真实时间,使位置间隔能承载事件时间距离;动态 FPS 训练让模型在不同采样下学习这种关系。该表示变化不需要另加一个时间预测 head,但具体输出仍取决于任务训练。[S3] §2.1.2–2.1.3。
输出:文档结构与位置怎样联合表达
模型用图像实际尺寸表达边界框、点等空间信息,扩展到结构化文档与 GUI 操作任务。使用时仍须核对处理后图像与原图的坐标映射,不能忽略 resize 后直接点击屏幕。[S3] §2.1.2;最后一句为部署分析。
在文档解析数据中,HTML 结构同时表示段落、表格及位置框等信息;模型学习输出结构化文本。输出坐标与文字是一种接口约定,格式正确、坐标映射正确和内容正确要分别验证,不能用问答分数替代解析验证。[S3] §2.2.1, Document Omni-Parsing Data;验证建议为工程分析。
中文解释:N 是 patch 总数,M 是每个窗口中的 patch 数。全局层建立所有 patch 两两关系;窗口层只建立局部关系,固定窗口时随 N 线性增长。这个说明式仅讨论注意力配对,省略通道维度、投影和 FFN;本代仍保留全局层,LLM 侧也仍要处理完整 token 前缀。
解释性复杂度推导,依据 [S3] §2.1.1 的窗口机制;不是实际推理时延测量。
Training:数据类型随阶段扩展
Table 2 列出 1.5T、2T、0.6T 三阶段,序列长度分别为 8192、8192、32768。第一阶段对齐视觉与语言,以 caption、视觉知识和 OCR 为主;第二阶段全参数训练,加入交错图文、VQA、数学、grounding、视频、Agent 与纯文本;最后增加长视频、长文档和长 Agent 轨迹。报告将动态 packing 用于平衡各 GPU 的语言序列负载。[S3] §2.2.2、Table 2。
后训练先 SFT 再 DPO,两个阶段均冻结 ViT。SFT 约 2M 条目,纯文本与多模态样本各占 50%,但多模态的 token 与计算占比更高。DPO 仅用图文与纯文本偏好数据,不含视频。数据过滤先按领域分类,再用规则与模型处理质量;rejection sampling 保留可验证的高质量回答。偏好优化改善行为对齐,不能凭这个流程断言所有感知任务都单调涨分。[S3] §2.3.1–2.3.4。
读训练流程SFT 学习示范回答,DPO 再利用回答偏好改变生成倾向;二者的输入、监督对象不同。论文的三阶段过滤先区分领域,再过滤与保留可靠回答,不能把“有 2M 数据”直接当成每类能力都充分覆盖。视觉编码器在后训练中冻结,测试时仍运行它。 [S3] §2.3.1–2.3.4。
Inference:视觉编码与语言解码分开计量
推理路径仍然是图像/视频预处理 → ViT → merger → Qwen2.5 自回归解码。部署要分别监测视觉编码、长前缀 prefill 与回答生成。窗口注意力主要降低视觉编码负担,不会自动降低每段视频进入 LLM 的 token 数;动态 FPS 也不是无限帧的免费输入。
Experiments:系统进步与组件证据的区别
Table 3 在同一报告中列出 Qwen2-VL-72B 与 Qwen2.5-VL-72B:MMMU val 64.5 → 70.2,MathVista mini 70.5 → 74.8;Table 5 的 Qwen2.5-VL-72B 在 DocVQA test 为 96.4、TextVQA val 为 83.5。后两个数字不支持“相对前代所有 OCR/VQA 指标都上涨”;本代的文档解析能力也不能仅由问答成绩代表。[S3] Table 3、5。
证据缺口选定报告没有给出窗口注意力、绝对时间与 DPO 三项各自完整的控制变量消融表。因此可以解释它们解决什么约束,却不能为它们分配虚构的百分点贡献。作者发布的数据构建说明有助理解训练范式,但并不提供复现完整 4.1T 训练语料所需的全部数据和配置。
06 / Qwen3-VL:让视觉信息在推理过程中继续被使用
Core Insight:入口对齐之后,还要照顾深层信息与长程位置
把所有视觉表示一次性放在输入端,会让语言模型依赖单层抽象后的信息。Qwen3-VL 引入多层视觉特征注入;同时处理 MRoPE 三轴频率分配、长视频时间 ID 稀疏,以及长上下文和推理后训练。主干仍是视觉编码器、merger 与语言模型,不是新增一套独立检测/视频输出头。[S4] §2。
Method:视觉初始化与三项机制改变
视觉特征:初始化与持续训练分开
使用 SigLIP-2 架构,动态分辨率持续训练,并引入 2D-RoPE 与按输入尺寸插值的绝对位置。默认 SigLIP2-SO-400M,小规模 2B/4B 主干使用 SigLIP2-Large 300M。[S4] §2。
初始化提供已有视觉表征,持续训练适应可变输入网格。最终 merger 仍负责入口特征;不要把换视觉检查点本身与 DeepStack 的跨层注入混成一个组件。[S4] §2 / §3.1。
跨层融合:改变特征内容,保持对应位置
从 ViT 三个不同深度取特征,各自经过专用 merger,直接加到前三个 LLM 层对应的 hidden states。它使用多层表示,但不把这些特征作为更多时间步追加到序列尾部;跨模态融合同时发生在入口和网络内部。[S4] §2.2。
每路中间视觉特征先投影到语言 hidden width,再在对应视觉位置相加。若该层状态有 N 个序列位置、每个 d_l 宽,这条支路改变相应位置的内容,而不变成 N 加一串中间 token。说明式省略 mask 与残差实现;DeepStack 的受控验证见后文消融。[S4] §2.2 / Figure 1。
位置:改变频率分配,不改变三轴含义
原三轴分块分配可能导致各轴占用的频率范围不均衡;交错分配让时间/高/宽都覆盖低频与高频。改变的是频率布局,空间时间三轴这个抽象仍然保留。[S4] §2.1。
时间、高度、宽度仍是位置坐标;改变的是它们占哪些旋转频率。频率交错让各轴覆盖高低频,而不是把视觉 token 排成另一种语义顺序。作者针对长视频位置谱不平衡提出这一设计。[S4] §2.1。
时间:位置表示之外增加可读文本
每个视频 temporal patch 前加入如 <3.0 seconds> 的文本,训练时同时覆盖秒和时分秒格式。作者指出前代绝对时间 ID 在长视频中可能过大且稀疏、需要广泛 FPS 采样。文本时间戳改用语言可读的时间信息,代价是少量额外上下文 tokens。[S4] §2.3。
时间戳先被文本 tokenizer 编码,和帧组视觉 token 一起进入上下文。它把“几秒”提供为可读条件,不是模型事后从帧号算出的测量值;代价是上下文增加。绝对时间信息换了接口,并未消除采样遗漏问题。[S4] §2.3;最后一句为工程分析。
中文解释:在对应视觉 token 位置,把某个 ViT 中间层 v 的投影加到语言层隐藏状态 h 上。l 指被注入的语言层,k(l) 指选用的视觉层;本文没有猜测未经报告披露的精确 ViT 层号。维度由专用 merger 对齐。相加式表达机制,不等于完整实现的执行次序和残差路径。
说明式,依据 [S4] §2.2 / Figure 1 重写。
Training:长上下文与推理是训练出来的
预训练由 S0→S3 四阶段组成。S0 仅训练 merger,67B tokens,长度 8192;S1 全参数 ~1T tokens,长度 8192;S2 全参数 ~1T,长度 32768;S3 全参数 100B,长度 262144。混合纯文本与视觉语言样本,并随阶段引入长文档、长视频、Agent 交互。Introduction 提到平方根归一化的每-token loss 用于平衡文本与多模态贡献,但没有足够完整的实现公式供本页精确复现,不能自动套用任意“按长度开根号”的损失。[S4] Introduction、§3.1、Table 1。
后训练分 Instruct 与 Thinking 两条数据格式:SFT 先 32K 再扩展到 256K;强到弱蒸馏先 off-policy 学习教师回答,再 on-policy 用学生生成序列与教师 logits 做 KL 对齐。蒸馏阶段使用纯文本数据更新语言主干,报告观察到它也改善多模态推理。[S4] §4.1–4.3。
Reasoning RL 使用可规则/代码验证的数学、代码、逻辑、grounding 等任务,约 30K queries;训练每个 query 采样 16 个回答并筛掉过易题目。所用算法是报告明确写出的 SAPO,不能因为同类模型常用 GRPO 就自动替换。General RL 结合规则奖励与模型评判,关注指令遵循、偏好、计数/时钟等错误先验及重复行为。[S4] §4.4。
“Thinking with Images” 则涉及实际工具交互:先在 Qwen2.5-VL-32B 上训练视觉 Agent,再蒸馏并扩展为约 120K 多轮交互数据,训练 Qwen3-VL。它的奖励同时考虑最终答案、反馈理解与工具调用;报告观察到只奖励正确性/推理可能退化为单次工具调用,因此额外约束调用行为。具有这类能力不意味着每个默认推理请求都会主动裁图或搜索,应用仍需接好工具环境。[S4] §4.5;最后一句为部署分析。
读训练流程Off-policy 阶段跟随教师回答,on-policy 阶段让学生先生成,再在这些位置用教师反馈校准。改变的是蒸馏训练路径,测试时通常只保留学生。RL 另从任务反馈优化行为,不能把它等同于教师 token 监督。报告没有完整列出本页可复现的所有损失细节。 [S4] §4.3–4.4。
Inference / Test-Time Scaling 与实验边界
MoE 型号 235B-A22B 表示总参数约 235B、每 token 激活约 22B,并不代表只需存储 22B 权重。Thinking 的生成长度和采样设置必须一起计入时延预算;更长推理可增加计算,但不能从 Thinking 和 Instruct 的分数差推出普适 scaling law。报告 §5.11 对旗舰与中型 Instruct 的纯文本评测使用 temperature 0.7、top-p 0.8、top-k 20、presence penalty 1.5,输出上限 32768 tokens;这组设置不能自动套用到所有多模态或 Thinking 评测。具体任务还要核对附录 B 的协议。
Experiments:推理预算与受控 DeepStack 消融
Table 2 中旗舰 Thinking / Instruct 的 MMMU 为 80.6 / 78.7,MathVista mini 为 85.8 / 84.9,DocVQA test 为 96.5 / 97.1。Thinking 不是每项指标都更高。同一表对工具结果使用 “+” 标记,对来自其他技术报告的值使用 “*” 标记;不能去掉这些标记后做毫无条件的排名。
DeepStack 的受控证据比发布模型横评更能支持机制贡献:Table 12 使用内部 15B-A2B、200B tokens、无后训练的验证集实验。平均分 74.7 → 76.0,InfoVQA 71.9 → 74.2,DocVQA 89.5 → 91.1;TextVQA 80.6 → 80.5。这支持细粒度文档信息利用的收益,但不保证每项任务上涨,更不直接量化 235B 成品上的增益。[S4] §5.12.2。
分析判断本代同时改变视觉主干、融合方式、数据、上下文课程与后训练。它的能力提升是系统性结果。完整训练语料、内部消融模型、工具环境与精确奖励配置不足以仅凭论文全部复现;应把可复用架构机制与不可复现的整套训练预算分开评估。
07 / Qwen3.5:把视觉语言基础与混合注意力合到一起
来源范围Qwen3.5 不带 “-VL” 后缀,但官方将它定位为原生视觉语言模型。此章重点读取 Qwen3.5-397B-A17B 的后训练 checkpoint,配置固定在 Hugging Face revision 8472618112ab。不是 Qwen3.5-Omni,也不把已经重定向为 Qwen3.8 的官方仓库首页当作 Qwen3.5 原始说明。
首发旗舰型号为 397B-A17B;之后官方又发布 122B-A10B、35B-A3B 的 MoE 与 27B、9B、4B、2B、0.8B 的 dense 型号。下面的层数、patch、专家数都对应选定旗舰配置,不能直接套给整个家族。模型卡将 397B 写为总参数量、17B 写为激活量;它没有单独列出视觉编码器参数量,本文也不自行累加或把激活量当作需存储的全部权重。
[S5] Model Overview [S7] News, 2026-02-16 / 02-24 / 03-02连接 Qwen3-VL:保留什么、替换什么、新增什么
| 关系 | 从 Qwen3-VL 到 Qwen3.5 | 能支持的结论 |
|---|---|---|
| 保留 | 视觉编码 → spatial merger → 多模态序列;交错 M-RoPE 与视频时间戳;工具调用需要外部执行环境。 | 仍是图像/视频条件下的自回归文本输出,原生多模态不等于直接生成图像。 |
| 替换 | 旗舰 patch 按本代公开配置核实为 16;语言侧改为 Gated DeltaNet / Gated Attention 混合层。相对 Qwen2/2.5 的 14-pixel patch,本代不能复用 28-pixel/token 公式。 | 视觉预算要按每代 processor 计算,不能凭旧换算或旧 chat template 直接迁移。 |
| 不沿用的路径 | 选定旗舰 deepstack_visual_indexes=[];本次参考实现送入语言主干的是最终 merger 输出。 | 不把 Qwen3-VL 的三路中间视觉特征注入列成 Qwen3.5 默认机制;也不据此断言关闭 DeepStack 导致涨分。 |
| 新增重点 | 早期多模态融合、混合语言计算、稀疏 MoE、MTP 与规模化异步 RL。 | 变化同时涉及架构、预训练和后训练,发布横评无法分解每项贡献。 |
视觉入口:grid 与 merger 仍在,计算预算换了
旗舰的视觉编码器为 27 层、hidden size 1152;patch 的空间尺寸为 16、时间深度为 2,随后把相邻 2×2 空间特征合并,输出宽度 4096 与语言主干对齐。图像/视频 token 与文本 embedding 合入同一因果序列。新 processor 仍记录网格形状,但不能从使用 Qwen3VLProcessor 类名推断所有旧参数都相同。
说明式:旗舰的 patch=16,空间合并倍率=2,所以一个合并后的视觉位置覆盖 32×32 输入像素。H′ / W′ 是 processor 调整后、网格对齐的图像尺寸;不计边界、文本时间戳或其他特殊 token。静态图像的时间分组与视频多帧仍须按 processor 核实,不把此式扩成任意视频的总预算。
依据 [S5] config.json vision_config; preprocessor_config.json 重写,非论文编号公式。
语言侧为什么改成混合注意力
旗舰的 60 个语言层分为 15 组,每组先运行 3 个 Gated DeltaNet 层,再运行 1 个 Gated Attention 层,每层后都接 MoE。前者把历史信息写进递归矩阵状态,增量解码无需为该层保存逐 token 的全部 K/V;后者仍通过显式注意力访问上下文,并在注意力输出上施加 sigmoid gate。两者组合是在历史压缩与显式检索之间取得折中,而不是取消注意力。
[S5] Model Overview Hidden Layout [S8] torch_recurrent_gated_delta_rule / GatedDeltaNet / Attention / DecoderLayer根据参考 kernel 重写的说明式:S 是某个 head 的 key×value 记忆矩阵;q / k / v 是当前 token 的 query、key 和 value,T 表示转置。α=exp(g) 控制历史衰减,β=sigmoid(b) 控制写入强度。先用当前 key 从衰减状态读出预测,再把与实际 value 的残差写回,所以不是把每次 value 简单累加。q / k 按实现归一化,q 还包含维度缩放;这里省略前置因果卷积、多 head / batch 和输出 gated RMSNorm。
依据 [S8] torch_recurrent_gated_delta_rule L425–485; GatedDeltaNet L605–650,不是 Qwen3.5 论文编号公式。其状态是 attention 的压缩记忆,不保证对应人类可解释的推理步骤。
全注意力层继续使用交错 M-RoPE,配置中 partial_rotary_factor=0.25;不要把这种 RoPE 处理自动套给没有执行同一 q/k rotation 路径的 DeltaNet 层。视觉输入在进入语言模型前已经形成 token 序列,位置表示、历史压缩与专家路由分别处理不同问题。
稀疏 MoE 与 MTP:激活预算不等于完整成本
旗舰每个 MoE 层有 512 个 routed experts,每个 token 选 10 个,再加 1 个 shared expert。参考实现先对 router logits 做 softmax,选 top-k 并在选中集合中重归一化,用权重混合专家输出;shared expert 则经输入相关的 sigmoid gate 后相加。其结果仍是与 residual 路径同宽的 hidden state,不是生成离散“专家答案”。
[S5] Model Overview / config.json num_experts and num_experts_per_tok [S8] TopKRouter / SparseMoeBlock官方还说明训练使用 multi-step MTP,发布配置列 mtp_num_hidden_layers=1。它与服务框架的 speculative decoding 支持有关,但不能仅凭字段断言每次部署都启用了 MTP 加速。分析判断减少 full-attention 层比例主要改变语言侧缓存与计算;全部专家的权重存储、视觉编码、remaining KV cache 与实际 kernel / 通信开销仍须单测。本次没有重测速度,也不把官方不同系统之间的吞吐倍率归因于单一模块。
训练:从独立视觉接入到早期多模态融合
发布文强调,预训练早期就混合视觉与文本 token,并扩充 STEM、视觉、视频和推理数据;基础架构沿 Qwen3-Next 的混合注意力与高稀疏 MoE 路线发展。它描述 FP8 训练,并在数值敏感位置保留 BF16,同时为视觉与语言组件采用不同并行策略,减少混合模态的负载不均。这里的“early fusion”是官方训练定位,不意味着不再有 ViT / merger,也不能从模型卡推出每一步都全参数训练。
[S5] Highlights [S6] Pretraining / Infrastructure后训练主要强调 RL 任务与环境的规模和难度:文本、多模态与多轮交互都纳入异步训练—推理解耦框架,配合 router replay、多轮 rollout locking 与故障恢复,控制异步采样引入的陈旧性与数据偏斜。但公开资料没有完整列出阶段 token 数、冻结模块、目标 mask、训练超参、具体 RL loss 和课程;不能把 Qwen3-VL 的 S0–S3 或 SAPO 默认写成 Qwen3.5 配方。
[S6] RL environment scaling / Infrastructure推理:同一 checkpoint 的 thinking 开关与真实工具环境
输入仍按图像/视频 processor 与 chat template 处理,生成仍输出文本。模型卡给出同一 checkpoint 的 thinking / non-thinking 开关;本地兼容 API 示例用 chat_template_kwargs.enable_thinking=False,托管接口的参数位置不同。工具调用还要接上 Qwen-Agent 或其他执行器,模型权重不会自行执行代码或网页操作。
旗舰原生窗口为 262,144 tokens;模型卡通过 YaRN 配置扩到 1,010,000,且提醒 static scaling 可能影响较短输入。Qwen3.5-Plus 的默认 1M 上下文是托管产品配置,不能用它覆盖开源 checkpoint 的原生上限。模型卡推荐 thinking 的 temperature/top-p 为 0.6/0.95,non-thinking 为 0.7/0.8;一般输出长度建议 32,768 tokens,困难基准可到 81,920。它们是使用建议,不是每一条视觉 benchmark 已采用的协议。
[S5] Model Overview; Processing Ultra-Long Texts; Sampling / Best Practices实验证据:与 Qwen3-VL 比较,先保留工具条件
官方模型卡给出与 Qwen3-VL-235B-A22B 的同表比较。它没有逐项完整列出原始 split、推理分支、重测来源、输出或工具预算,本文不从数值相同就补成 Thinking 分支,也不把它拼到前文旧论文的数字曲线上。详细节选与 CI 条件见后面的全系列实验章节。官方公开材料未给足受控架构消融;成绩变化无法单独证明混合注意力、关闭 DeepStack 或 early fusion 各自造成多少收益。
[S5] Benchmark Results / Vision Language and footnotes08 / Training:监督位置比“训练了多少”更关键
前四篇报告的共享基本目标是让视觉信息支持文本生成;Qwen3.5 公开资料强调从预训练早期建立统一多模态基础,但精确监督位置与 loss 配方仍需完整报告或训练实现确认。视觉 token 是条件输入,并不意味着每个视觉 token 都要像词一样被预测。第一代明确用文本交叉熵,并在 SFT 阶段只监督回答;第二代也明确统计图文 tokens、却只监督文本。把训练消费的 token 量当成有监督目标数量,会误读整个数据规模。[S1] §3.1、§3.3;[S2] §2.2。
中文解释:x 包括视觉和用户输入,y 是要预测的文本;S 是真正受监督的位置集合,θ 是模型参数。最小化损失会提高正确目标文本在条件输入下的概率。SFT 的用户问题、角色标记和回答可能采用不同 mask,必须按具体论文/实现核实。此式没有写平均归一化和任务权重。
说明式,依据 [S1] §3.1 的交叉熵目标、§3.3 的回答监督,以及 [S2] §2.2 的文本监督描述。不是 [S4] 未充分展开的平方根归一化损失公式。
| 环节 | 为何存在 | 系列内的具体变化 | 复现要记录 |
|---|---|---|---|
| 初始对齐 | 让视觉表征可被语言主干使用 | [S1] 冻结 LLM、训 ViT+adapter;[S4] S0 只训 merger | 初始化检查点、冻结模块、目标 mask |
| 联合预训练 | 形成细粒度、跨任务视觉语言能力 | caption/OCR 扩展到交错图文、STEM、视频与 Agent | 数据类型和采样权重、图文预算、packing |
| 长上下文课程 | 学习远距离证据利用与时间关系 | [S3] 最后阶段 32K;[S4] 8K→32K→256K | 实际序列分布、帧率、每帧 token 上限 |
| 行为与推理后训练 | 将能力转成可用交互和可验证推理 | SFT → [S3] DPO → [S4] 蒸馏、Reasoning/General RL | teacher、奖励与验证器、推理格式、生成预算 |
分析判断若要在自己的文档任务上复现一个小规模实验,优先固定相同主干与数据,单独比较输入预算、空间 merger 或融合层。否则分数同时受预处理、采样、数据质量和后训练影响,无法知道真正有效的是哪项改变。
Qwen3.5 扩大了异步 RL 与多模态基础训练的系统设计,但公开配置中的 router loss 字段不等于完整训练目标;MTP 参数也不提供完整多步监督与权重。阶段规模、冻结范围和精确奖励属于当前缺口。[S5] Highlights / config.json [S6] Pretraining / Infrastructure
09 / Experiments:用相同任务观察,用受控实验解释
主结果:不同读法,支持不同结论
| 报告 / checkpoint | MMMU ↑ | MathVista mini ↑ | DocVQA test ↑ | 出处 / 边界 |
|---|---|---|---|---|
| Qwen2-VL-72B | 64.5 (val) | 70.5 (testmini) | 96.5 | [S2] Table 2 |
| Qwen2.5-VL-72B | 70.2 (val) | 74.8 (mini) | 96.4 | [S3] Table 3、5 |
| Qwen3-VL-235B-A22B Instruct | 78.7 | 84.9 | 97.1 | [S4] Table 2;规模与协议不同 |
| Qwen3-VL-235B-A22B Thinking | 80.6 | 85.8 | 96.5 | [S4] Table 2;额外推理预算 |
最稳妥的代际比较是 [S3] Table 3 同表中的 Qwen2 与 Qwen2.5;即使如此,它仍是整套系统的比较,不能单独识别窗口注意力或 DPO 的贡献。Qwen3 的表内还明确区分 reasoning 和 non-reasoning、不同预算与来源标记,因此适合观察能力上限和成本选择,而不是“固定参数下提升了多少”。
Qwen3.5 官方同表比较:从论文主线走到原生基础模型
下表仅节选 [S5] Vision Language 的两列。数字与原表打印精度一致,分数越高越好;未自行添加百分比单位,也不把不同报告中 OCRBench 的量纲或协议统一。前代列名是 Qwen3-VL-235B-A22B,模型卡未逐项列其推理分支和 split。工具条件不清楚的指标会保留限制。
| 任务 / 原标签 | Qwen3-VL-235B-A22B | Qwen3.5-397B-A17B | 评测边界 |
|---|---|---|---|
| MMMU | 80.6 | 85.0 | 原表未展开具体 split / branch |
| Mathvista (mini) | 85.8 | 90.3 | 保留 mini 标签,完整提示与采样未逐项公开 |
| OmniDocBench1.5 | 84.5 | 90.8 | 版本 1.5;与 DocVQA 是不同任务 |
| OCRBench | 87.5 | 93.1 | 不与前代报告中的 0–1000 格式直接拼接 |
| VideoMME (w sub.) | 83.8 | 87.5 | 有字幕设置 |
| VideoMME (w/o sub.) | 79.0 | 83.7 | 无字幕设置;不能合并两行 |
| OSWorld-Verified | 38.1 | 62.2 | 交互式 Agent 指标,harness / 工具预算未完整展开 |
工具收益单列,不混成裸模型能力
BabyVision 的官方值是 52.3 / 43.3,V* 是 95.8 / 91.1;两者分别表示开启 / 不开启 Code Interpreter 的结果。MathVision 又对本模型采用固定“逐步推理、最终答案加框”提示,而对其他模型取带框与不带框的更高值。因此工具预算与提示差异必须跟着结果一起记录,不能只取每行最大数宣称统一条件下领先。
[S5] Vision Language footnotes, BabyVision / V* / MathVision分析判断旗舰模型、训练数据与后训练全部变化,且缺少 controlled ablations。可确认官方报告了更强的多项视觉/交互结果,不能用这些差值证明 Gated DeltaNet 或移除 DeepStack 的独立贡献;也不能把部署建议中的长输出上限认作所有评测都实际用了该预算。
消融:平均值背后的任务差异
| 受控实验 | 指标 | 对照 | 改动后 | 能支持的结论 |
|---|---|---|---|---|
| [S2] Table 8 / M-RoPE | NextQA | 43.9 / 1D-RoPE | 46.0 / M-RoPE | 小主干预训练设置下视频问答获益 |
| [S2] Table 8 / M-RoPE | RealWorldQA | 54.5 | 53.7 | 改进不是所有任务都单调成立 |
| [S4] Table 12 / DeepStack | InfoVQA | 71.9 / Baseline | 74.2 / DeepStack | 多层视觉特征改善密集信息理解 |
| [S4] Table 12 / DeepStack | TextVQA | 80.6 | 80.5 | 平均提升不能代替每任务检查 |
长视频实验:检索证据不等于全部理解能力
[S4] §5.12.3 使用 Qwen3-VL-235B-A22B-Instruct,以 1 FPS 均匀采样、动态调节分辨率保持视觉预算。作者报告原生 256K 对应最长 30 分钟设置的 needle 检索准确率 100%;使用 YaRN 外推到约 1M tokens、两小时设置后为 99.5%。这是插入显著证据帧并定位回答的任务。分析判断结果支持长序列信息检索能力,不能独自证明复杂事件因果、短暂动作理解或两小时视频每帧细节都可靠;更不能将外推 1M 与原生训练 256K 写成同一保证。
10 / Inference:把 token、时间和工具成本一起算进去
从系统实现看,这条主线的共同推理骨架是视觉预处理、视觉编码、模态连接、语言 prefill、自回归生成。Qwen3.5 把语言侧的多数 token mixer 改为 state-based DeltaNet,仍保留 full-attention 层与真正的视觉输入预算。新增机制落在不同环节:动态分辨率影响输入和序列长度,窗口注意力影响 ViT,DeepStack 影响融合深度,Thinking 与工具交互影响生成和多轮执行。
- 先固定输入协议。记录 resize、像素限制、帧率、时间戳和图像 token 数;只更换模型名而保留错误预处理,会损害评价。
- 分开测量时延。报告视觉编码、prefill、首 token、整体生成和峰值显存;不能把窗口注意力的理论复杂度换算成没有硬件证据的加速倍数。
- 区分理解与操作。坐标/JSON 输出还需要应用校验、坐标映射和工具执行器。离线理解分数不足以保证长程 Agent 成功率。
- 控制推理预算。在相同输入、同一任务和固定输出 token/工具调用预算下比较 Instruct 与 Thinking;任务收益可能抵不过延迟成本。
以上四项是根据报告机制提出的工程评估建议,不是四篇论文共同报告过的硬件 benchmark。Qwen3.5 的官方发布文给出系统效率描述,但缺少本页能对齐复跑的完整硬件/负载条件;本页没有独立重测吞吐量、显存或部署延迟。
11 / Limitations:哪些结论可以带走,哪些需要再验证
| 约束 | 证据与判断 | 仍待验证的问题 |
|---|---|---|
| 信息保留 | [S1] 固定尺度与固定 256-token 摘要;[S2] 改为动态输入 | 具体任务需要多少视觉 tokens?超小字是否在预处理就丢失? |
| 感知与推理分离 | [S2] MMMU 相对同期闭源基线仍有差距;提高分辨率不总有益 | 瓶颈是读不到、推不出、还是背景知识不足? |
| 效率范围 | [S3] 窗口降低多数视觉注意力层成本,但保留四个全局层 | 在给定硬件上总时延主要来自 ViT、prefill 还是 decode? |
| 因果归因 | [S3] 无完整模块消融;[S4] DeepStack 使用内部模型受控验证 | 在发布模型规模与自己的数据上,单独改机制还能获得多少收益? |
| 长上下文边界 | [S4] needle 检索与原生/外推范围有明确设置 | 复杂长视频推理是否同样稳健?关键动作被采样遗漏时如何处理? |
| Qwen3.5 资料范围 | 模型卡、配置与参考实现可核实;独立技术报告本次未核实到,官方发布文尚提 forthcoming report | 完整训练 loss / 冻结 / RL 课程与评测预算何时可对齐?DeepStack 与混合注意力的独立消融是否可复现? |
| 可复现性 | 公开训练描述包含内部数据、模型生成和评判流程 | 可以复现机制,但是否具备重建完整训练数据和环境的条件? |
对于论文复现,最有价值的做法是选择可控切口:固定数据和语言主干,验证视觉 budget 与 token 计量;再验证连接或位置机制;最后才讨论后训练。对于系统选型,重点是任务证据和成本约束,而不是把时间线的最后一个型号当作所有场景的默认最优。
12 / Takeaways:记住约束如何被逐步改变
信息入口:Qwen-VL 的固定视觉摘要降低连接成本;Qwen2-VL 的动态 token 分配让细节保留更贴近输入规模。
位置与效率:M-RoPE 明确三轴关系;Qwen2.5-VL 把绝对时间和窗口机制加入这条路径;Qwen3-VL 改进频率分配,并用文本时间戳表达视频时间。
信息使用:DeepStack 把视觉中间特征带到语言层内部,长上下文课程与后训练进一步训练模型如何检索、推理和使用工具。
统一基础与计算:Qwen3.5 强调早期多模态融合,并把语言侧计算改成 Gated DeltaNet / Gated Attention / MoE 组合;其旗舰未启用前代 DeepStack 支路。升级不是给每项前代创新继续做加法。[S5] Highlights / config.json [S8] VisionModel / DecoderLayer
评价原则:看报告同表和受控消融,保留 checkpoint、split、训练阶段和推理预算;平均改善不能替代每任务检查。
动态分辨率为什么不是“任何尺寸都免费支持”?
它把不同尺寸转换为不同长度视觉序列。细节保留和成本一起增加,仍受像素、帧数、总上下文与显存预算限制。[S2] §2.1。
窗口注意力能否解决 LLM 长上下文成本?
本代的窗口用于 ViT 大多数层,优化视觉编码阶段。视觉 token 仍进入语言模型,LLM prefill、KV cache 和长回答成本仍需单独管理。[S3] §2.1.1。
DeepStack 是否通过增加序列长度实现?
报告将三个视觉中间层的专用 merger 输出加到前三个语言层的对应隐藏状态。核心是跨层注入,不是将三套特征作为更多序列位置拼接。[S4] §2.2。
Qwen3.5 是 Qwen3-VL 加上全部旧机制吗?
不是。它保留视觉 token 与三轴位置接口,但语言侧改为混合注意力;选定旗舰配置 DeepStack 索引为空。early fusion 是训练主张,不等于没有视觉编码器,也不是每项继承机制都保持原样。[S5] Highlights / config.json
13 / 原始来源与核查记录
[S1]–[S4] 为完整阅读的固定版本 PDF,页码从封面开始计数,日期为论文首次提交。新增 [S5]–[S8] 为 Qwen3.5 的官方公开资料与参考实现,不伪装成第五篇 PDF。时间线最后一点是 2026-02-16 的模型首发,官方云社区发布文日期为 2026-02-17;实现 commit 日期是代码版本日期,不作为模型发布日期。新增内容没有复跑模型。
- [S1] Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities
arXiv 2308.12966v1 · 版本 PDF首次提交 2023-08-24 · 本版本 2023-08-24 · 核查 2026-10-10完整作者名单
Jinze Bai; Shuai Bai; Shusheng Yang; Shijie Wang; Sinan Tan; Peng Wang; Junyang Lin; Chang Zhou; Jingren Zhou
- [S2] Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
arXiv 2409.12191v2 · 版本 PDF首次提交 2024-09-18 · 本版本 2024-10-03 · 核查 2026-10-10完整作者名单
Peng Wang; Shuai Bai; Sinan Tan; Shijie Wang; Zhihao Fan; Jinze Bai; Keqin Chen; Xuejing Liu; Jialin Wang; Wenbin Ge; Yang Fan; Kai Dang; Mengfei Du; Xuancheng Ren; Rui Men; Dayiheng Liu; Chang Zhou; Jingren Zhou; Junyang Lin
- [S3] Qwen2.5-VL Technical Report
arXiv 2502.13923v1 · 版本 PDF首次提交 2025-02-19 · 本版本 2025-02-19 · 核查 2026-10-10完整作者名单
Shuai Bai; Keqin Chen; Xuejing Liu; Jialin Wang; Wenbin Ge; Sibo Song; Kai Dang; Peng Wang; Shijie Wang; Jun Tang; Humen Zhong; Yuanzhi Zhu; Mingkun Yang; Zhaohai Li; Jianqiang Wan; Pengfei Wang; Wei Ding; Zheren Fu; Yiheng Xu; Jiabo Ye; Xi Zhang; Tianbao Xie; Zesen Cheng; Hang Zhang; Zhibo Yang; Haiyang Xu; Junyang Lin
- [S4] Qwen3-VL Technical Report
arXiv 2511.21631v2 · 版本 PDF首次提交 2025-11-26 · 本版本 2025-11-27 · 核查 2026-10-10完整作者名单
Shuai Bai; Yuxuan Cai; Ruizhe Chen; Keqin Chen; Xionghui Chen; Zesen Cheng; Lianghao Deng; Wei Ding; Chang Gao; Chunjiang Ge; Wenbin Ge; Zhifang Guo; Qidong Huang; Jie Huang; Fei Huang; Binyuan Hui; Shutong Jiang; Zhaohai Li; Mingsheng Li; Mei Li; Kaixin Li; Zicheng Lin; Junyang Lin; Xuejing Liu; Jiawei Liu; Chenglong Liu; Yang Liu; Dayiheng Liu; Shixuan Liu; Dunjie Lu; Ruilin Luo; Chenxu Lv; Rui Men; Lingchen Meng; Xuancheng Ren; Xingzhang Ren; Sibo Song; Yuchong Sun; Jun Tang; Jianhong Tu; Jianqiang Wan; Peng Wang; Pengfei Wang; Qiuyue Wang; Yuxuan Wang; Tianbao Xie; Yiheng Xu; Haiyang Xu; Jin Xu; Zhibo Yang; Mingkun Yang; Jianxin Yang; An Yang; Bowen Yu; Fei Zhang; Hang Zhang; Xi Zhang; Bo Zheng; Humen Zhong; Jingren Zhou; Fan Zhou; Jing Zhou; Yuanzhi Zhu; Ke Zhu
- [S5] Qwen3.5-397B-A17B 官方模型卡、配置与 processor
配置 · 图像 processor · 固定版本 / 来源版本:8472618112abcbd45acbcdc58436aff4233c23f7· 文档/代码版本日期 2026-04-24 · 核查 2026-10-10 - [S6] Qwen3.5: Towards Native Multimodal Agents · 官方发布文
固定版本 / 来源版本:snapshot / SHA-256 51008f41f22f456a…· 发布日期 2026-02-17;快照抓取 2026-10-10 · 核查 2026-10-10 - [S7] 官方仓库 Qwen3.5 发布历史(现仓库名 Qwen3.8)
固定版本 / 来源版本:2ea10dc725823bf7c3e21ce8557cbe15245132ae· 文档/代码版本日期 2026-08-17 · 核查 2026-10-10 - [S8] Transformers Qwen3.5-MoE 参考实现
固定版本 / 来源版本:812a950d7037ba93bb624b154030e9068afdce4d· 文档/代码版本日期 2026-10-08 · 核查 2026-10-10
逐项证据清单:本页完整离线证据索引(仓库另保留 data/evidence/qwenvl-series.json)。来源记录保留原四篇 PDF 的 SHA-256,并记录新增模型卡、配置与实现的版本和哈希;它核对本次阅读材料,不代表 arXiv 未来更新后的无版本链接内容。新增视觉 token 换算和 DeltaNet recurrence 都标为说明式,分别由配置与参考 kernel 推导,不伪称未核实技术报告的编号公式。
原论文图版权归作者;arXiv 元数据标注 non-exclusive distribution license,此许可不等于项目 MIT 许可证。本文保留解释方法和实验证据所必需的局部图及明确出处,未获得单独的图形再许可。项目原创代码、排版与解读的 MIT 声明不涵盖这些第三方图;复用图形时请按原始权利条件处理。
证据索引
四篇固定版本技术报告的正文、训练、推理、主实验与消融;Qwen3.5 按固定提交的官方模型卡、配置与参考实现核实。未确认独立技术报告,因此其完整训练配方与受控架构消融仍为证据缺口。机制解释和说明式均与原文事实区分。
展开全部 122 条证据(断网可查)
- 原文事实
Timeline uses first submission date; full identity, authors and version date retained in sources.
Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities · v1
打开原始来源 ↗ · 返回对应正文 ↑
Versioned arXiv metadata: citation_title, citation_author, citation_date, citation_online_date - 原文事实
Timeline uses first submission date; full identity, authors and version date retained in sources.
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution · v2
打开原始来源 ↗ · 返回对应正文 ↑
Versioned arXiv metadata: citation_title, citation_author, citation_date, citation_online_date - 原文事实
Timeline uses first submission date; full identity, authors and version date retained in sources.
Qwen2.5-VL Technical Report · v1
打开原始来源 ↗ · 返回对应正文 ↑
Versioned arXiv metadata: citation_title, citation_author, citation_date, citation_online_date - 原文事实
Timeline uses first submission date; full identity, authors and version date retained in sources.
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
Versioned arXiv metadata: citation_title, citation_author, citation_date, citation_online_date - 原文事实
ViT 1.9B, adapter 0.08B, LLM 7.7B, total 9.6B; cleaned image-text pairs 1.4B; SFT 350K.
Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 1, PDF p3; Section 3.1 / Table 2, p4–5; Section 3.3, p6 - 原文事实
Model release labels 2B/7B/72B, ViT 675M; 600B+800B=1.4T image/text tokens, text-only supervision.
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution · v2
打开原始来源 ↗ · 返回对应正文 ↑
Section 2 / Table 1, PDF p3; Section 2.2, p5–6 - 原文事实
3B/7B/72B family; 4.1T tokens; pretraining stages 1.5T/2T/0.6T, lengths 8192/8192/32768; SFT approximately 2M samples.
Qwen2.5-VL Technical Report · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 1 p4; Table 2 p8; Section 2.3.1 p9 - 原文事实
Dense 2B/4B/8B/32B, MoE 30B-A3B/235B-A22B; 67B/~1T/~1T/100B tokens with 8192/8192/32768/262144 sequence lengths.
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
Section 2 p2–3; Table 1 p4; Section 4.1 p9 - 原文事实
Qwen2.5 report retrospectively states predecessor 1.2T tokens; retain discrepancy with S2 instead of resolving without evidence.
Qwen2.5-VL Technical Report · v1
打开原始来源 ↗ · 返回对应正文 ↑
Introduction p2; Section 2.2.1 p5 - 原文事实
OpenCLIP ViT-bigG, patch stride 14, fixed-length 256 learned query cross-attention adapter with 2D absolute positions; box coordinates normalized to [0,1000).
Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities · v1
打开原始来源 ↗ · 返回对应正文 ↑
Sections 2.1–2.2, PDF p3–4 - 说明式 / 推导
Cross-attention standard QK softmax weighted V explanation; projections and positional treatment omitted, not an original numbered equation.
Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities · v1
打开原始来源 ↗ · 返回对应正文 ↑
Section 2.1, p3 - 图形证据
Three-stage training crop retains frozen/trained modules and data labels.
Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities · v1
打开原始来源 ↗ · 返回对应正文 ↑
Figure 3, PDF p4 - 原文事实
5B original pairs → 1.4B cleaned; consumed about 1.5B samples/500B image-text tokens; phase 1 224x224, frozen LLM, train vision+adapter.
Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities · v1
打开原始来源 ↗ · 返回对应正文 ↑
Section 3.1 / Table 2, p4–5 - 原文事实
Seven multitask types, 448x448, packing length 2048, full-model training; SFT 350K, freeze ViT, optimize language+adapter, answer/special-token supervision.
Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities · v1
打开原始来源 ↗ · 返回对应正文 ↑
Section 3.2 / Table 3, p5–6; Section 3.3, p6–7 - 原文事实
Qwen-VL TextVQA 63.8 / DocVQA 65.1; Qwen-VL-Chat 61.5 / 62.6. Chat is not uniformly higher.
Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 6, PDF p9 - 分析判断
Speech/video and scale are future directions; fixed-budget bottleneck is editorial analysis, not reported quantitative ablation.
Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities · v1
打开原始来源 ↗ · 返回对应正文 ↑
Section 6, PDF p10 - 图形证据
Dynamic resolution with 2D-RoPE replaces absolute positions; 2x2 spatial merging; original architecture crop.
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution · v2
打开原始来源 ↗ · 返回对应正文 ↑
Section 2.1 / Figure 2, PDF p4 - 原文事实
M-RoPE uses temporal/height/width components; text equal IDs, image constant temporal ID, video increasing temporal ID; new segment max ID+1.
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution · v2
打开原始来源 ↗ · 返回对应正文 ↑
Section 2.1 / Figure 3, p4–5 - 原文事实
Video 2 FPS, temporal-depth 2 3D convolution; images treated as two identical frames; training video budget 16384 tokens.
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution · v2
打开原始来源 ↗ · 返回对应正文 ↑
Section 2.1, p5 - 说明式 / 推导
14px patch and 2x2 merge imply visual tokens=(Hprime/28)*(Wprime/28); 224x224 → 64 visual + 2 boundary = 66.
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution · v2
打开原始来源 ↗ · 返回对应正文 ↑
Section 2.1, p4 - 原文事实
Three training stages; first ViT, second all, third frozen ViT/instruction-tuned LLM. Combined 1.4T counts text+vision but supervision text only.
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution · v2
打开原始来源 ↗ · 返回对应正文 ↑
Section 2.2, p5–6 - 原文事实
Qwen2-VL-72B: MMMU val 64.5, MathVista testmini 70.5, DocVQA test 96.5; Claude3.5/GPT4o MMMU 68.3/69.1.
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution · v2
打开原始来源 ↗ · 返回对应正文 ↑
Table 2, PDF p9 - 原文事实
Qwen2-VL-7B fixed 3136 visual tokens: InfoVQA 77.27, OCRBench 786; dynamic average 1924: 75.89, 866. Not all-task dominance.
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution · v2
打开原始来源 ↗ · 返回对应正文 ↑
Table 7 / Section 3.3.1, PDF p14 - 原文事实
Qwen2-1.5B + ViT-L pretraining ablation: MathVista 39.2→43.4; NextQA 43.9→46.0; RealWorldQA 54.5→53.7; InfoVQA 50.8→50.3.
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution · v2
打开原始来源 ↗ · 返回对应正文 ↑
Table 8 / Section 3.3.2, PDF p15 - 原文事实
VLN map information incomplete/unstructured; 3D maps and locations remain a challenge.
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution · v2
打开原始来源 ↗ · 返回对应正文 ↑
Section 3.2.7 Visual Agent, PDF p13 - 图形证据
Original architecture figure shows dynamic FPS, absolute-time alignment, window/full attention. Crop 419490 bytes prioritizes small-label readability.
Qwen2.5-VL Technical Report · v1
打开原始来源 ↗ · 返回对应正文 ↑
Figure 1 / Section 2.1, p3–4 - 原文事实
ViT 32 layers; full attention indexes {7,15,23,31}; maximum 112x112 pixels/8x8 patches per window; RMSNorm and SwiGLU; from-scratch ViT.
Qwen2.5-VL Technical Report · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 1 / Section 2.1.1, PDF p4 - 原文事实
Image sides multiples of 28; stride 14; 2x2 concat/two-layer MLP; actual image-size coordinates; dynamic FPS training and absolute-time-aligned MRoPE.
Qwen2.5-VL Technical Report · v1
打开原始来源 ↗ · 返回对应正文 ↑
Sections 2.1–2.1.3, p3–5 - 说明式 / 推导
Global attention pairing O(N squared), fixed M-patch windows O(N*M); not full network linear complexity or measured latency.
Qwen2.5-VL Technical Report · v1
打开原始来源 ↗ · 返回对应正文 ↑
Section 2.1.1, PDF p4 - 原文事实
Stages 1.5T/2T/0.6T, 8192/8192/32768; progressive data; dynamic LLM packing for GPU load balance.
Qwen2.5-VL Technical Report · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 2 / Section 2.2.2, PDF p8 - 原文事实
SFT approximately 2M entries, 50/50 text versus multimodal sample count; SFT/DPO freeze ViT; DPO image-text and text only; filtering and rejection sampling.
Qwen2.5-VL Technical Report · v1
打开原始来源 ↗ · 返回对应正文 ↑
Sections 2.3.1–2.3.4, PDF p9–10 - 原文事实
72B MMMU val 70.2, MathVista mini 74.8, DocVQA test 96.4, TextVQA val 83.5. No isolated module gain inferred.
Qwen2.5-VL Technical Report · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 3 p11; Table 5 p13 - 图形证据
Original architecture crop; SigLIP2-SO-400M default / Large300M for 2B/4B; interpolation plus 2D-RoPE.
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
Figure 1 / Section 2, PDF p3 - 原文事实
Interleaved axis frequency allocation; three ViT levels use specialized mergers added to first three LLM-layer hidden states.
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
Section 2.1, p3; Section 2.2, p4 - 说明式 / 推导
Hidden-state addition schematic; exact ViT layer indexes and detailed residual execution order not asserted.
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
Section 2.2 / Figure 1, p3–4 - 原文事实
Video temporal patches prefixed with textual timestamps; seconds and HMS formats; predecessor absolute-time ID sparsity and data construction issues.
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
Section 2.3, p4 - 原文事实
Four-stage pretraining (only merger then all), 67B/~1T/~1T/100B, context 8K/8K/32K/256K. Square-root normalized loss is mentioned but no invented precise equation.
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
Introduction p2; Section 3.1 / Table 1 p4–5 - 原文事实
Instruct/Thinking formats; SFT 32K→256K; text-only strong-to-weak off-policy and on-policy teacher/student KL distillation.
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
Sections 4.1–4.3, p9–11 - 原文事实
Reasoning RL approximately 30K queries, 16 responses, SAPO; General RL uses rule/model rewards, targeted behavior correction.
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
Section 4.4, PDF p11–12 - 原文事实
Visual-agent training on Qwen2.5-VL-32B then ~120K multiround interactions for Qwen3-VL; answer/feedback/tool-use rewards.
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
Section 4.5, PDF p12–13 - 原文事实
Flagship/midsize Instruct text evaluation: temperature0.7 top-p0.8 top-k20 presence1.5 max output32768. Not claimed as universal multimodal protocol.
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
Section 5.11, PDF p20 - 原文事实
235B total/22B active; Thinking/Instruct MMMU80.6/78.7 MathVista85.8/84.9 DocVQA96.5/97.1; preserve reasoning mode distinction.
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
Section 2 p2; Table 2 p15 - 原文事实
Internal 15B-A2B,200B tokens,no posttraining validation: AVG74.7→76.0; InfoVQA71.9→74.2; DocVQA89.5→91.1; TextVQA80.6→80.5.
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
Table 12 / Section 5.12.2, PDF p24 - 说明式 / 推导
Conditional text cross-entropy over supervised positions; not a reconstruction objective or Qwen3 loss normalization.
Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities · v1
打开原始来源 ↗ · 返回对应正文 ↑
Section 3.1 p5; Section 3.3 p6–7 - 分析判断
Progressive tasks/long context and behavior alignment summarized; replica evaluation suggestions labeled editorial.
Qwen2.5-VL Technical Report · v1
打开原始来源 ↗ · 返回对应正文 ↑
Sections 2.2–2.3, p5–10 - 原文事实
Benchmark table values copied at source precision with model/split/mode; cross-report numbers are not a uniform rerun or causal attribution.
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution · v2
打开原始来源 ↗ · 返回对应正文 ↑
Table 2 p9 / Tables7–8 p14–15 - 原文事实
Benchmark table values copied at source precision with model/split/mode; cross-report numbers are not a uniform rerun or causal attribution.
Qwen2.5-VL Technical Report · v1
打开原始来源 ↗ · 返回对应正文 ↑
Table 3 p11 / Table5 p13 - 原文事实
Benchmark table values copied at source precision with model/split/mode; cross-report numbers are not a uniform rerun or causal attribution.
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
Table 2 p15 / Table12 p24 - 图形证据
Original needle heatmap; 1FPS, fixed visual token budget; 30min/256K=100% reported; YaRN 1M/~2h=99.5% reported; retrieval scope explicitly limited.
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
Figure 3 / Section 5.12.3, PDF p25 - 分析判断
Deployment pipeline and tool feedback are explanatory synthesis; no fabricated latency/memory numbers.
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
Sections 2 and 4.5, p2–4 and p12–13 - 分析判断
Limitations matrix distinguishes reproducibility and evaluation-scope judgments from original experimental facts.
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
Sections 5.12.2–5.12.3, p24–25 - 原文事实
Qwen3.5-397B-A17B model repository created 2026-02-16; native vision-language checkpoint; source coverage is model card/configuration, not a fifth versioned paper PDF.
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
Model API createdAt; Model Overview; fixed-revision README.md and config.json - 分析判断
发布文仍称technical report upcoming;本次未核实到独立Qwen3.5技术报告,不用Qwen3.5-Omni报告替代。
Qwen3.5: Towards Native Multimodal Agents · snapshot-2026-10-10-51008f41f22f456a
打开原始来源 ↗ · 返回对应正文 ↑
Official release article, before Pretraining - 原文事实
首发397B-A17B于2026-02-16;122B-A10B/35B-A3B/27B于2026-02-24;9B/4B/2B/0.8B于2026-03-02。仓库现名Qwen3.8,本页只取固定commit的Qwen3.5历史。
Qwen3.5 Official Release History in QwenLM Repository · 2ea10dc725823bf7c3e21ce8557cbe15245132ae
打开原始来源 ↗ · 返回对应正文 ↑
README.md, News entries dated 2026-02-16 / 2026-02-24 / 2026-03-02 - 说明式 / 推导
时间线第五点为2026-02-16模型首发而非论文首发,早期多模态融合与GatedDeltaNet/MoE混合结构。
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
Model Overview; Model API createdAt - 原文事实
研究定位:统一原生视觉语言基础模型与 Agent 能力;本节以旗舰为配置样本
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
README.md Model Overview / Highlights; config.json text_config / vision_config; Processing Ultra-Long Texts - 原文事实
语言主干:旗舰 397B-A17B;60 层,每组 3 个 Gated DeltaNet + 1 个 Gated Attention;稀疏 MoE
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
README.md Model Overview / Highlights; config.json text_config / vision_config; Processing Ultra-Long Texts - 原文事实
视觉连接器:空间 2×2 merger;旗舰 deepstack_visual_indexes=[],不沿用前三层 DeepStack 注入
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
README.md Model Overview / Highlights; config.json text_config / vision_config; Processing Ultra-Long Texts - 原文事实
图像处理:旗舰 ViT 27 层;patch=16、temporal patch=2;动态网格
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
README.md Model Overview / Highlights; config.json text_config / vision_config; Processing Ultra-Long Texts - 原文事实
位置表示:交错 M-RoPE;全注意力层 partial rotary factor=0.25;视频文本时间戳
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
README.md Model Overview / Highlights; config.json text_config / vision_config; Processing Ultra-Long Texts - 原文事实
训练计量:官方描述规模扩大与早期图文融合;本次来源没有逐阶段精确 token 总量
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
README.md Model Overview / Highlights; config.json text_config / vision_config; Processing Ultra-Long Texts - 原文事实
后训练:规模化文本/多模态/多轮 RL;同 checkpoint 支持 thinking 开关;精确 loss / 课程未公开
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
README.md Model Overview / Highlights; config.json text_config / vision_config; Processing Ultra-Long Texts - 原文事实
长序列证据:旗舰原生 262144 tokens;YaRN 扩至 1010000 属外推配置,另于托管 Plus
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
README.md Model Overview / Highlights; config.json text_config / vision_config; Processing Ultra-Long Texts - 原文事实
旗舰post-trained checkpoint,模型卡397B total/17B activated;未单列ViT参数量;H4096,60 layers;该配置不代表所有dense/MoE子型号。
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
README.md Model Overview - 原文事实
旗舰patch16 temporal2 spatialmerge2,DeepStack indexes空;语言混合attention。不要把Qwen2/2.5的28px per token公式复用于Qwen3.5。
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
config.json vision_config.deepstack_visual_indexes / patch_size / spatial_merge_size / text_config.layer_types - 原文事实
参考实现视觉最终merger输出进入多模态序列;使用时间戳分割视频;不复制Qwen3-VL三路DeepStack路径。
Qwen3.5-MoE Transformers Reference Implementation · 812a950d7037ba93bb624b154030e9068afdce4d
打开原始来源 ↗ · 返回对应正文 ↑
modeling_qwen3_5_moe.py Qwen3_5MoeVisionModel L1205–1291; get_rope_index L1474–1490 - 原文事实
旗舰ViT27层H1152,patch16/time2,2x2 spatial merge,out_hidden_size4096;processor_class Qwen3VLProcessor但参数需逐配置核实。
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
config.json vision_config.{depth,hidden_size,patch_size,temporal_patch_size,spatial_merge_size,out_hidden_size}; preprocessor_config.json.processor_class - 说明式 / 推导
解释性静态图像网格式N≈(Hprime/32)(Wprime/32),16×2=32;省略特殊tokens,不直接用于任意视频。
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
config.json vision_config.patch_size=16, spatial_merge_size=2; preprocessor_config.json - 说明式 / 推导
示意图使用旗舰60层=15组(3 GatedDeltaNet+1 GatedAttention),每层后MoE,final merger序列输入而非DeepStack支路。
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
Model Overview Hidden Layout; config.json layer_types / vision_config - 原文事实
GatedDeltaNet缓存递归state和卷积state,incremental sequence1使用recurrent kernel,prefill用chunk kernel;Full Attention更新KV并sigmoid(output gate);每层后MoE。
Qwen3.5-MoE Transformers Reference Implementation · 812a950d7037ba93bb624b154030e9068afdce4d
打开原始来源 ↗ · 返回对应正文 ↑
modeling_qwen3_5_moe.py L425–485, L492–650, L737–810, L933–990 - 说明式 / 推导
解释性公式Stilde=alpha*Sprev;delta=beta*(v-Stilde^T k);S=Stilde+k delta^T;o=S^T q;alpha=exp(g), beta=sigmoid(b),省略norm/causal conv/output gating但明确q/k normalized q scaled。
Qwen3.5-MoE Transformers Reference Implementation · 812a950d7037ba93bb624b154030e9068afdce4d
打开原始来源 ↗ · 返回对应正文 ↑
torch_recurrent_gated_delta_rule L425–485; GatedDeltaNet L605–650 - 原文事实
mrope_interleaved=true,mrope_section=[11,11,10],partial_rotary_factor=.25;Full Attention参考实现apply_rotary_pos_emb,不可自动写成所有DeltaNet层同样q/k RoPE。
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
config.json text_config.rope_parameters - 原文事实
旗舰512 routed experts,10 routed+1shared per token,expert intermediate1024;总量397B active17B是型号报告,非全部可驻留于17B权重显存。
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
Model Overview Mixture Of Experts; config.json num_experts / num_experts_per_tok / shared_expert_intermediate_size - 原文事实
softmax→topk→selected-score renormalization;weighted routed sum + sigmoid-gated shared expert输出;hidden维度保持。
Qwen3.5-MoE Transformers Reference Implementation · 812a950d7037ba93bb624b154030e9068afdce4d
打开原始来源 ↗ · 返回对应正文 ↑
TopKRouter L871–887; SparseMoeBlock L890–909 - 原文事实
model card MTP trained multi-steps;config mtp_num_hidden_layers1;不保证全部服务配置自动speculative decode。
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
Model Overview MTP; config.json text_config.mtp_num_hidden_layers - 分析判断
分析:state-cache减少逐tokenKV覆盖范围但full-attention仍保留KV,不消除vision/全部expert存储/通信开销;不独立估算latency。
Qwen3.5-MoE Transformers Reference Implementation · 812a950d7037ba93bb624b154030e9068afdce4d
打开原始来源 ↗ · 返回对应正文 ↑
GatedDeltaNet / Attention / SparseMoeBlock; configuration cross-check - 原文事实
原生early text-vision fusion,视觉/STEM/视频等数据扩大;沿Qwen3-Next hybrid architecture/MTP;heterogeneous vision-language parallelism;native FP8 with BF16 sensitive layers。
Qwen3.5: Towards Native Multimodal Agents · snapshot-2026-10-10-51008f41f22f456a
打开原始来源 ↗ · 返回对应正文 ↑
Pretraining / Infrastructure - 原文事实
官方称扩大RL environments,涵盖text/multimodal/multiturn asynchronous disaggregated train-inference,router replay and multi-turn rollout locking;未给足完整训练loss/冻结课程,不默认继承前代SAPO。
Qwen3.5: Towards Native Multimodal Agents · snapshot-2026-10-10-51008f41f22f456a
打开原始来源 ↗ · 返回对应正文 ↑
RL scaling discussion / Infrastructure - 原文事实
同一checkpoint支持thinking toggle,local chat_template_kwargs.enable_thinking=false;工具需要外部executor;托管API参数路径有区别。
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
README.md Using Qwen3.5 via Chat Completions API, Instruct Mode; Agentic Usage - 原文事实
native262144/extrapolated1010000,Plus default1M独立托管配置;staticYaRN短文本可能退化;thinking temperature.6 top_p.95,nonthinking.7/.8;general output32768/hard benchmark81920建议非全部评测实际设置。
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
Model Overview / Processing Ultra-Long Texts / Using via API / Best Practices - 分析判断
Qwen3-VL列未逐项明确checkpoint branch/split/tool budgets;没有可控architecture ablation支撑各单模块因果解释。
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
Vision Language comparison and footnotes - 分析判断
统一章节加入Qwen3.5 earlyfusion/asyncRL,但明确阶段规模/冻结/目标mask/损失与奖励未充分公开。
Qwen3.5: Towards Native Multimodal Agents · snapshot-2026-10-10-51008f41f22f456a
打开原始来源 ↗ · 返回对应正文 ↑
Pretraining / Infrastructure - 原文事实
Official table Qwen3-VL-235B-A22B=80.6, Qwen3.5-397B-A17B=85.0; MMMU score higher better, original precision; 原表未展开具体 split / branch; Qwen3.5 post-trained released checkpoint, full per-task decoding/tool protocol not provided.
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
README.md Vision Language table, row MMMU - 原文事实
Official table Qwen3-VL-235B-A22B=85.8, Qwen3.5-397B-A17B=90.3; Mathvista (mini) score higher better, original precision; 保留 mini 标签,完整提示与采样未逐项公开; Qwen3.5 post-trained released checkpoint, full per-task decoding/tool protocol not provided.
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
README.md Vision Language table, row Mathvista (mini) - 原文事实
Official table Qwen3-VL-235B-A22B=84.5, Qwen3.5-397B-A17B=90.8; OmniDocBench1.5 score higher better, original precision; 版本 1.5;与 DocVQA 是不同任务; Qwen3.5 post-trained released checkpoint, full per-task decoding/tool protocol not provided.
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
README.md Vision Language table, row OmniDocBench1.5 - 原文事实
Official table Qwen3-VL-235B-A22B=87.5, Qwen3.5-397B-A17B=93.1; OCRBench score higher better, original precision; 不与前代报告中的 0–1000 格式直接拼接; Qwen3.5 post-trained released checkpoint, full per-task decoding/tool protocol not provided.
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
README.md Vision Language table, row OCRBench - 原文事实
Official table Qwen3-VL-235B-A22B=83.8, Qwen3.5-397B-A17B=87.5; VideoMME (w sub.) score higher better, original precision; 有字幕设置; Qwen3.5 post-trained released checkpoint, full per-task decoding/tool protocol not provided.
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
README.md Vision Language table, row VideoMME (w sub.) - 原文事实
Official table Qwen3-VL-235B-A22B=79.0, Qwen3.5-397B-A17B=83.7; VideoMME (w/o sub.) score higher better, original precision; 无字幕设置;不能合并两行; Qwen3.5 post-trained released checkpoint, full per-task decoding/tool protocol not provided.
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
README.md Vision Language table, row VideoMME (w/o sub.) - 原文事实
Official table Qwen3-VL-235B-A22B=38.1, Qwen3.5-397B-A17B=62.2; OSWorld-Verified score higher better, original precision; 交互式 Agent 指标,harness / 工具预算未完整展开; Qwen3.5 post-trained released checkpoint, full per-task decoding/tool protocol not provided.
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
README.md Vision Language table, row OSWorld-Verified - 原文事实
Qwen3.5 BabyVision52.3 CI-enabled/43.3 noCI;V*95.8 CI-enabled/91.1 noCI;MathVision固定step-by-step+boxed final prompt,本模型与对照提示取值规则不同,缺fulltoolbudget。
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
Vision Language rows BabyVision / V*; footnotes - 分析判断
发布模型comparison同时改变参数、数据、pre/posttrain,不提供孤立GatedDeltaNet/DeepStack/earlyfusion因果增益。
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
Vision Language table / footnotes - 分析判断
Qwen3.5 hybrid cache需同时考察recurrent state和remainingfullattentionKV;不能把ViT窗口开销改进与语言主干缓存范围混同。
Qwen3.5-MoE Transformers Reference Implementation · 812a950d7037ba93bb624b154030e9068afdce4d
打开原始来源 ↗ · 返回对应正文 ↑
GatedDeltaNet cache path / Attention KV update - 分析判断
新增Qwen3.5知识边界:没有独立报告核实,不补造trainingrecipe/ablation;mixedsource证据不等于同等论文精读覆盖。
Qwen3.5: Towards Native Multimodal Agents · snapshot-2026-10-10-51008f41f22f456a
打开原始来源 ↗ · 返回对应正文 ↑
Before Pretraining / Infrastructure; model-card coverage cross-check - 分析判断
新增贯穿结论:早期融合和混合计算,与前代接口保留并行;DeepStack未在旗舰默认启用,不是旧机制全数累加。
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
Highlights / Model Overview / config.json - 原文事实
Qwen2-VL patch14 and 2x2 merge produce28px/token; this predecessor fact is distinct from Qwen3.5 flagship patch16 and32px/token.
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution · v2
打开原始来源 ↗ · 返回对应正文 ↑
Section 2.1, PDF p4 - 说明式 / 推导
图像被缩放后编码,学习 query 从视觉特征中取信息,形成固定长度摘要;摘要与问题进入语言模型。 连接器压缩序列,位置感知帮助在压缩时保留空间信息。
Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities · v1
打开原始来源 ↗ · 返回对应正文 ↑
§2.1–2.2 - 说明式 / 推导
动态尺寸图像产生可变长度特征;局部 merger 把邻近 patch 变成视觉 token,M-RoPE 给语言侧的视觉位置保留时空坐标。 替换固定全局摘要,保留局部网格结构;输入面积会影响序列长度。
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution · v2
打开原始来源 ↗ · 返回对应正文 ↑
§2.1 - 说明式 / 推导
保留动态网格和 merger;ViT 多数层只计算窗口内关系,少量全局层连通远处;时间 ID 与绝对时间对齐。 窗口影响 ViT 内部计算,时间编码影响视频事件关系,二者不等于减少所有语言 token。
Qwen2.5-VL Technical Report · v1
打开原始来源 ↗ · 返回对应正文 ↑
§2.1–2.1.3 - 说明式 / 推导
最终 merger 进入序列;不同深度视觉特征经专用 merger 加到语言层的对应视觉位置。视频另加入文本时间戳。 新增的是跨层特征支路,改变表示内容,而不是把 DeepStack 特征追加为更多序列位置。
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
§2.2–2.3; Table 12 - 说明式 / 推导
选定旗舰把最终视觉 token 与文本组成序列;语言主干交替使用递归状态更新和显式注意力,每层配 MoE。 混合的是语言层计算;旗舰不启用前代 DeepStack 中间支路。
Qwen3.5-397B-A17B Official Model Card and Released Configuration · 8472618112abcbd45acbcdc58436aff4233c23f7
打开原始来源 ↗ · 返回对应正文 ↑
Model Overview; config.json - 说明式 / 推导
视觉特征经 merger 对齐语言 embedding 通道,不能等同于先 OCR 后纯文本输入。
Qwen2.5-VL Technical Report · v1
打开原始来源 ↗ · 返回对应正文 ↑
§2.1, MLP-based Vision-Language Merger - 图形证据
输入经 ViT 与位置感知 Cross-attention 压为256连续视觉向量,与文本组合后由语言模型输出文本;图示省略内部投影。
Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities · v1
打开原始来源 ↗ · 返回对应正文 ↑
§2.1–2.2, PDF pages 3–4 - 说明式 / 推导
这些向量代表图像局部及其上下文,不是已经读出的字符。对报表而言,缩放会先影响小字是否还可辨;后面的压缩再精巧,也不能恢复被预处理抹掉的信息。后一句为输入机制的分析。[S1] §2.1。
Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities · v1
打开原始来源 ↗ · 返回对应正文 ↑
§2.1–2.2 - 说明式 / 推导
每个 query 对视觉 key 计算匹配,再把对应 value 加权汇总。因此输出的序列长度由 query 个数决定,而不是由图像 patch 个数决定。学习的是“怎样取信息”的参数,测试时仍计算同一连接器;它不是按用户问题临时分配的一组自然语言问题。[S1] §2.1;匹配过程的简化见下面说明式。
Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities · v1
打开原始来源 ↗ · 返回对应正文 ↑
§2.1–2.2 - 说明式 / 推导
关键连接是通道兼容、序列拼接和边界标记。语言侧看到的是视觉向量与文本 embedding 的混合上下文,随后预测回答文本;这与先 OCR 出报表文字再运行纯文本 Qwen 的路径不同。[S1] §2.1–2.2。
Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities · v1
打开原始来源 ↗ · 返回对应正文 ↑
§2.1–2.2 - 说明式 / 推导
坐标字符串由同一个生成接口输出,边界标记把位置与指代内容联系起来。训练的 grounding 样本教模型生成对应格式;真正点击或解析边界框属于应用后处理,不能把生成字符串视为已经完成外部操作。[S1] §2.2;外部执行部分为工程分析。
Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities · v1
打开原始来源 ↗ · 返回对应正文 ↑
§2.1–2.2 - 说明式 / 推导
输出是可变长度视觉特征;“动态”指尺寸与预算可调整,并不是不经 resize 或免费接受任何大图。回到长报表,保留长宽关系有机会减少统一方形缩放带来的细节损失,但具体采样上限仍决定看到多少。[S2] §2.1;后一句为分析。
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution · v2
打开原始来源 ↗ · 返回对应正文 ↑
§2.1 / Figure 3 - 说明式 / 推导
Merger 的输入是相邻视觉特征,输出是更短、与语言 embedding 对齐的连续序列。局部压缩保留网格对应关系,空间位置数仍随输入面积变化;不再由一组全局 query 把所有图片压到相同长度。下式只计算静态图像的位置数。[S2] §2.1。
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution · v2
打开原始来源 ↗ · 返回对应正文 ↑
§2.1 / Figure 3 - 说明式 / 推导
M-RoPE 的三个位置分量作用于旋转位置表示,不是额外预测三个坐标标签。对报表,这让视觉位置的“哪一行、哪一列”有独立编码;它并不替代读取字符、比较数值或寻找表头的任务。[S2] §2.1 / Figure 3;后半为机制解释。
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution · v2
打开原始来源 ↗ · 返回对应正文 ↑
§2.1 / Figure 3 - 说明式 / 推导
时间分组之后仍有每组的空间 token。增加帧数与提高每帧分辨率都会推高输入预算,因此长视频要一起控制采样、空间网格和总序列长度。视频统一解决表示入口问题,不保证未被采到的瞬时事件能被恢复。[S2] §2.1;预算与遗漏含义为工程分析。
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution · v2
打开原始来源 ↗ · 返回对应正文 ↑
§2.1 / Figure 3 - 说明式 / 推导
窗口层只让区域内部的 patch 互相计算关系,全局层再允许远处特征交互。对跨列报表,远处关系并没有被永久切断;只是每层都全局配对被改成多数层局部、少数层全局。Merger 后的语言序列预算另算。[S3] §2.1.1 / Table 1。
Qwen2.5-VL Technical Report · v1
打开原始来源 ↗ · 返回对应正文 ↑
§2.1–2.1.3; §2.2.1 Document Omni-Parsing Data - 说明式 / 推导
用符号描述,设四个邻近特征各为 d_v 宽,拼接先形成 4d_v 宽,再由 MLP 投到语言宽度 d_l;与此同时位置数减少。这里是 §2.1 的形状解释,不补具体型号尺寸,也不意味着每个拼接位置就是识别出的单个文字。
Qwen2.5-VL Technical Report · v1
打开原始来源 ↗ · 返回对应正文 ↑
§2.1–2.1.3; §2.2.1 Document Omni-Parsing Data - 说明式 / 推导
同一事件在不同采样率下可能落在不同帧号。把时间 ID 绑定真实时间,使位置间隔能承载事件时间距离;动态 FPS 训练让模型在不同采样下学习这种关系。该表示变化不需要另加一个时间预测 head,但具体输出仍取决于任务训练。[S3] §2.1.2–2.1.3。
Qwen2.5-VL Technical Report · v1
打开原始来源 ↗ · 返回对应正文 ↑
§2.1–2.1.3; §2.2.1 Document Omni-Parsing Data - 说明式 / 推导
在文档解析数据中,HTML 结构同时表示段落、表格及位置框等信息;模型学习输出结构化文本。输出坐标与文字是一种接口约定,格式正确、坐标映射正确和内容正确要分别验证,不能用问答分数替代解析验证。[S3] §2.2.1, Document Omni-Parsing Data;验证建议为工程分析。
Qwen2.5-VL Technical Report · v1
打开原始来源 ↗ · 返回对应正文 ↑
§2.1–2.1.3; §2.2.1 Document Omni-Parsing Data - 说明式 / 推导
初始化提供已有视觉表征,持续训练适应可变输入网格。最终 merger 仍负责入口特征;不要把换视觉检查点本身与 DeepStack 的跨层注入混成一个组件。[S4] §2 / §3.1。
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
§2–2.3 / Figure 1 - 说明式 / 推导
每路中间视觉特征先投影到语言 hidden width,再在对应视觉位置相加。若该层状态有 N 个序列位置、每个 d_l 宽,这条支路改变相应位置的内容,而不变成 N 加一串中间 token。说明式省略 mask 与残差实现;DeepStack 的受控验证见后文消融。[S4] §2.2 / Figure 1。
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
§2–2.3 / Figure 1 - 说明式 / 推导
时间、高度、宽度仍是位置坐标;改变的是它们占哪些旋转频率。频率交错让各轴覆盖高低频,而不是把视觉 token 排成另一种语义顺序。作者针对长视频位置谱不平衡提出这一设计。[S4] §2.1。
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
§2–2.3 / Figure 1 - 说明式 / 推导
时间戳先被文本 tokenizer 编码,和帧组视觉 token 一起进入上下文。它把“几秒”提供为可读条件,不是模型事后从帧号算出的测量值;代价是上下文增加。绝对时间信息换了接口,并未消除采样遗漏问题。[S4] §2.3;最后一句为工程分析。
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
§2–2.3 / Figure 1 - 说明式 / 推导
冻结语言模型不等于语言模型不参与前向计算:目标文本仍经语言模型产生概率,误差信号用于更新允许学习的视觉侧与连接器。到了联合阶段才让语言参数一起适应;SFT 又锁定视觉侧。这是原阶段设置的计算含义,不是新增阶段或新的实验结论。
Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities · v1
打开原始来源 ↗ · 返回对应正文 ↑
§3.1–3.3 / Figure 3 - 说明式 / 推导
SFT 学习示范回答,DPO 再利用回答偏好改变生成倾向;二者的输入、监督对象不同。论文的三阶段过滤先区分领域,再过滤与保留可靠回答,不能把“有 2M 数据”直接当成每类能力都充分覆盖。视觉编码器在后训练中冻结,测试时仍运行它。
Qwen2.5-VL Technical Report · v1
打开原始来源 ↗ · 返回对应正文 ↑
§2.3.1–2.3.4 - 说明式 / 推导
Off-policy 阶段跟随教师回答,on-policy 阶段让学生先生成,再在这些位置用教师反馈校准。改变的是蒸馏训练路径,测试时通常只保留学生。RL 另从任务反馈优化行为,不能把它等同于教师 token 监督。报告没有完整列出本页可复现的所有损失细节。
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
§4.3–4.4 - 图形证据
受控内部15B-A2B/200B tokens/无后训练,AVG74.7→76.0,InfoVQA71.9→74.2,DocVQA89.5→91.1,TextVQA80.6→80.5;图从0起并包含负例。
Qwen3-VL Technical Report · v2
打开原始来源 ↗ · 返回对应正文 ↑
Table 12, PDF page 24