---
title: Beyond Language Modeling: An Exploration of Multimodal Pretraining (ICML 2026 Spotlight)
tags: 
author: [品川政太朗](https://docswell.com/user/sei_shinagawa)
site: [Docswell](https://www.docswell.com/)
thumbnail: https://bcdn.docswell.com/page/GEWGQ3P2J2.jpg?width=480
description: 2026年8月30-31日最先端NLP勉強会の発表資料です。 Beyond Language Modeling: An Exploration of Multimodal Pretraining (ICML 2026 Spotlight) について紹介するための資料です。現状は仮スライドで、当日までに差し替え予定です
published: August 20, 26
canonical: https://docswell.com/s/sei_shinagawa/K1Q7N4-Beyond_Language_Modeling_An_Exploration_of_Multimodal_Pretraining
---
# Page. 1

![Page Image](https://bcdn.docswell.com/page/GEWGQ3P2J2.jpg)

本スライドの中身はほぼClaudeで作成しました。
当日までの雰囲気掴む用としてご覧ください。
当日は差し替えたスライドで紹介します
2026.08.30-31
最先端NLP勉強会
Beyond Language Modeling:
An Exploration of Multimodal Pretraining
Shengbang Tong, David Fan, John Nguyen, Ellis Brown, ほか（Meta FAIR / New York University）
ICML 2026
Accept (Spotlight) | 査読: Strong Accept, Accept, Accept
紹介者：品川 政太朗（SB Intuitions / 奈良先端大）


# Page. 2

![Page Image](https://bcdn.docswell.com/page/47ZLWVK4J3.jpg)

[経歴]
• 2020年 奈良先端科学技術大学院大学 博士（工学）
• 2020年 同大学 助教
• 2024年 同大学 客員助教 / SB Intuitions株式会社 入社
[専門]
• Vision and Language
• 対話システム
品川 政太朗
Seitaro Shinagawa
SB Intuitio ns/
奈 良 先 端 科 学 技 術大 学 院 大 学
[書籍]
• コンピュータビジョン最前線2021Winter
ニュウモン Vision and Language（共立出版）
• コンピュータビジョン最前線2023 Summer
フカヨミCLIP（共立出版）
• Vision Transformer入門 7章8章（技術評論社）


# Page. 3

![Page Image](https://bcdn.docswell.com/page/YJ6WG5QGJV.jpg)

本日の流れ
1
論文の位置づけと問題設定
なぜ from-scratch でやる必要があったのか
2
実験の枠組み
Transfusion + RAE、何を測っているか
3
5つの知見と、その信頼度
各知見のあとに、査読で出た論点を必ず置きます
4
まとめ
何が言えて、何がまだ言えないか


# Page. 4

![Page Image](https://bcdn.docswell.com/page/GJ5MVYRXJ4.jpg)

論文概要：SOTA モデルの提案ではなく、設計空間の解剖
書誌情報
TL;DR
Beyond Language Modeling: An Exploration of Multimodal
Pretraining
Elucidating the design space of unified multimodal models including
visual representation, data, world modeling, architecture, and scaling
(dense + MoE).
著者 Shengbang Tong, David Fan, John Nguyen ほか計18名
AC のコメント：“strong empirical study and meaningful conclusion”
Meta FAIR / NYU（Yann LeCun, Saining Xie,
Luke Zettlemoyer, Jakob Verbeek ら）
採否 ICML 2026 Accept (Spotlight)
査読 3 件は Strong Accept / Accept / Accept
一言でいうと
「新しい unified multimodal model を提案した」のではなく、テキストと画像を1つのモデルで最初から一緒に事前学習すると
き何が本当に効くのかを、from-scratch の統制実験で分解した研究
5つの軸で分解する
Visual Representation
Data
World Model
Architecture
Scaling
どんな視覚表現が最適か
データを混ぜると何が起きるか
世界モデル能力の出どころ
容量をどう割り当てるか
modality で法則は違うのか


# Page. 5

![Page Image](https://bcdn.docswell.com/page/9E293GDQ7R.jpg)

背景：なぜ from-scratch で学習し直す必要があったのか
既存の主流
本研究
強力な pretrained LLM から出発して視覚を後付けする
すべて from-scratch。言語事前学習の影響をゼロにする
・BAGEL（Emerging Properties in Unified Multimodal Pretraining）
・text / video / image-text / action-conditioned video を最初から混ぜる
・Janus / Emu・Emu2 / DreamLLM / NExT-GPT
・表現・データ・アーキテクチャ・スケーリングを1つの枠組みで比較
→ multimodal pretraining 自体の効果と、もともと持っていた言語能
力を切り分けられない
→ 交絡なしに「何が効いたか」を帰属できる
検証したい通説：modality competition
「画像を混ぜると、その分だけ言語能力が食われる」 — 本当にそうなのか。そうならば、原因は データ か 表現 か アーキテ
クチャ か。
本論文の答え
Vision と Language は本質的には競合していない。うまく設計すればむしろ相乗効果があり、問題になる modality tax は主としてデ
ータ分布と容量配分の設計に由来する。
※ 本発表では BAGEL は「pretrained LLM 出発・MoT 的な設計」の代表として 2 回だけ参照します（背景とアーキテクチャの節）


# Page. 6

![Page Image](https://bcdn.docswell.com/page/D7Y41V2YEM.jpg)

研究の全体像
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Figure 1
中心的な問い
Vision と Language を最初から一緒に学習したとき、本当に modality competition は起こるのか？ 起こるなら、原因はデータなのか
、表現なのか、アーキテクチャなのか？
得られた4つの主要な知見（＋スケーリング則）
知見1
RAE が最適な統一視覚表現
知見2
視覚と言語は相補的で相乗効果があ
る
知見3
世界モデル能力が自然に立ち上がる
知見4
MoE が効率的なスケールと専門分化
を生む


# Page. 7

![Page Image](https://bcdn.docswell.com/page/VENY2M8RJ8.jpg)

実験の枠組み：Transfusion 型で1つの Transformer に2つの目的関数
モデル
学習データ
・decoder-only Transformer 1本。text は autoregressive な next-token prediction、image /
video は連続 latent への flow matching
・損失は L = λ_LM · L_LM + λ_flow · L_flow
（既定値 λ_LM = 1, λ_flow = 3）
visual token は「語彙」ではない
・画像は frozen vision encoder で 256 visual tokens（16×16 grid）の連続値に。既定は
SigLIP 2 So400M
・hidden state から text 位置は vocabulary head、vision 位置は continuous linear head へ分
岐。後者が flow matching を予測
・NExT-GPT 型の「signal token を出して外部の画像生成器を条件付ける」方式とは性質が違
い、画像の latent をこの Transformer 自身が生成する
モダリティの切り替え
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Table 2
主な評価指標
言語 DCLM validation PPL、in-house “Notes” PPL（OOD 評価
）
・画像 / 動画フレームは &lt;BOI&gt; I₁…I₂₅₆ &lt;EOI&gt; で囲む（学習時・推論時とも）
画像生成 CC12M の diffusion loss、DPGBench、GenEval、
COCO FID
・attention は text=causal / 同一画像内=bidirectional / frame 間=causal のhybrid 構造
視覚理解 VQA（finetuning 後の平均精度）
推論時：T → I → T を一続きの系列として実行できる
text を AR 生成 → &lt;BOI&gt; を生成 → text 生成を停止 → noise latent を挿入
→ 25-step Euler で flow matching
→ &lt;EOI&gt; を追加 → text の AR 生成を再開
※ 画像生成中は visual token を1個ずつ AR 生成するのではなく、フレーム全体の latent block を flow で更新し
ている
世界モデル Navigation World Model の ATE / RPE（zero-shot
CEM planning）
※ 言語能力を PPL 中心で測っている点は、後で査読の論点になり
ます


# Page. 8

![Page Image](https://bcdn.docswell.com/page/Y79P1NKZE3.jpg)

知見1：意味的な視覚表現ひとつで、理解も生成もまかなえる
知見 1
従来 understanding は SigLIP / CLIP、generation は VAE latent という
dual representation（BAGEL・Janus が典型）
本論文 SD-VAE / FLUX.1 VAE / SigLIP 2 / DINOv2-L / WebSSL-L / raw
pixels を同一条件で比較
結果 SigLIP 2 の latent をそのまま生成にも使う RAE (Representation
Autoencoder) 構成が DPGBench・GenEval・VQA のすべてで最良。しか
も text PPL は text-only とほぼ同等
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Figure 2
何が変わるのか
従来：
x → z_semantic（理解） / z_VAE（生成）
本論文：
x → z_semantic → 理解・生成の両方
の2系統
→ understanding と generation で visual representation を分けな
くてよい可能性
※ SigLIP の意味特徴は本来再構成用ではないが、RAE decoder を学習すれば latent
→ pixels を実現できる（補足参照）
図の読み方
・左2枚（PPL ↓）：どの視覚表現でも text-only 破線とほぼ同じ高さ
・右3枚（生成・VQA ↑）：SigLIP 2（青）が一貫して最も高い
・SD-VAE / FLUX.1（赤系）は生成でも VQA でも semantic encoder に劣る
・raw pixels は生成では劣るが VQA の差は小さい（十分な計算量があれば有望
と著者はコメント）


# Page. 9

![Page Image](https://bcdn.docswell.com/page/G78D4K2Y7D.jpg)

検討1：この比較はどこまで信じてよいか
査読での論点
Q. 生成評価が GenEval / DPGBench 中心。両者には既知の bias があり
、絶対性能も SOTA から遠い（Reviewer 9ReQ）
Q. 生成・VQA では SigLIP が圧勝なのに、language PPL だけは raw
pixel が最も良いのはなぜか（Reviewer 9ReQ）
A. rebuttal で qualitative な生成例を追加。Dense &lt; MoT &lt; MoE という
metric の傾向は visual quality の傾向とも一致する、と回答
A. raw pixel は外部 vision encoder 由来の bias を持たず end-to-end に学習
されるため、language modeling に干渉しにくいのでは、という仮説
→ それでも「弱い performance regime で成立した設計則が、大規模 SOTA
model でも成立する保証はない」という問題は残る
→ 著者自身も PPL 差は小さいとして強くは主張していない。機序は未解明
のまま
読み方の目安
「RAE（semantic latent）は VAE より良い」という相対比較は、同一条件で6種類を並べているぶんかなり強い。一方で、この論文の数
値を絶対水準の議論に使うことはできない。


# Page. 10

![Page Image](https://bcdn.docswell.com/page/L7LM6Z29JR.jpg)

知見2：言語を壊しているのは「視覚」ではなく「キャプションの分布」
知見 2
設定 520B text + 520B multimodal token で、Text only / + raw Video / +
MetaCLIP / + Video + MetaCLIP + Action を比較
結果1 Text + Video は Text-only とほぼ同じ。DCLM PPL ではむしろわずか
に良い
結果2
き
悪化するのは Text + MetaCLIP、つまり image-text ペアを混ぜたと
解釈 視覚そのものが言語を壊しているのではなく、image-text データに付随
する caption text の distribution shift が問題ではないか
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Figure 3
caption 埋め込みと DCLM の cosine distance
図の読み方（PPL は左が良い）
MetaCLIP
0.196
・Text 520B（青）と + Video 520B（緑）はほぼ同じ位置
Shutterstock (SSTK)
0.215
・+ MetaCLIP（橙）だけが明確に右（悪い方向）へ動く
MetaCLIP Recaption
0.286
→ raw video は言語モデリングと両立する。「視覚を入れると必ず言語が落
ちる」わけではない
DCLM から遠い分布のキャプションほど PPL が悪化するという対応


# Page. 11

![Page Image](https://bcdn.docswell.com/page/4EMY5V8VEW.jpg)

検討2：PPL で言語能力を語ってよいのか／因果は示されたのか
査読での論点
Q. 言語能力の評価が PPL 中心。「PPL が同じだから言語能力も落ちてい
ない」と本当に言えるのか（KJGE / 9ReQ）
Q. 「caption の distribution shift が原因」という因果は示されたのか（
Reviewer P1j7）
A. 332 の multimodal pretrained model × 14 の言語ベンチマークで、DCLM
PPL と平均 zero-shot accuracy の Spearman 相関 ρ = −0.8468（HellaSwag
−0.9204 / ARC-C −0.7033）
・cosine distance と DCLM PPL の関係はそれほどきれいではない
さらに downstream の直接比較も追加：
Text-only 61.6 / Text + Video 61.7 / Text + MetaCLIP 59.7
Full multimodal 61.4
/
→ 9ReQ は「model 集団全体で相関しても、論文中の特定 configuration 間
のpairwise 結論を保証しない」と再指摘。著者は最終的に6タスクの直接評
価を追加した
・MetaCLIP 単独・SSTK 単独よりも MetaCLIP(I2T) + SSTK(T2I) の方が良い
、という結果は単純な「距離が近いほど良い」説明と整合しにくい
A. I2T には DCLM に近い caption 分布を持つ MetaCLIP を、T2I には
optimization がより滑らかな SSTK を割り当てることで両者の利点を得てい
る、と説明
→ 補強はされたが、厳密な因果関係の証明ではない
読み方の目安
安全に言えるのは「raw video を追加しても、pretraining PPL および複数の zero-shot NLP task では大きな language degradation は見ら
れない」まで。「すべての言語能力に modality competition は存在しない」と一般化するのは強すぎる。


# Page. 12

![Page Image](https://bcdn.docswell.com/page/PER9325WJ9.jpg)

知見3：モダリティ間には正の転移がある — 専門データより一般データ
知見 3
設定
VQA でも同じことが起きる
text token と vision token を {0, 25, 50, 75, 100}B で組み合わせる
結果 vision budget を固定したまま text token を増やすほど、diffusion
loss も GenEval も改善する（＝ 言語の学習が画像生成を助ける）
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Figure 7
20B の VQA データに 80B を足す（平均 VQA 精度）
VQA 20B のみ 34.6 → + Video 80B 36.1 → + Image/Text 80B 36.9 →
+ Text 80B 37.9 （VQA 100B は 35.7）
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Figure 6
著者の解釈 GenEval などは複雑な text prompt に条件づけられるため、言語能力
が高いモデルほど prompt を理解でき、text-image alignment も向上する
→ 20B の task データ + 80B の general データ &gt; 100B の task データ
※ 520B+520B 規模でも multimodal pretraining 後の VQA finetuning が優位（SigLIP 2: 40.3
vs 33.9）


# Page. 13

![Page Image](https://bcdn.docswell.com/page/P7XQ4DKVEX.jpg)

知見4：世界モデル能力は「一般動画」から立ち上がる
知見 4
設定 navigation を State_t + Action → State_{t+1} という next visual state
prediction として扱う（NWM: Navigation World Model）
工夫 Action を専用 embedding にせず dx=…, dy=…, dyaw=… という普通の
text token として与える。action 専用の adapter も architecture 変更も追加し
ていない
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Figure 8
ATE（小さいほど良い）
NWM 50B 1.974 → NWM 100B 1.669
video 1.448 → + Raw Video 1.410
→ + Text 1.657 → + Action
→ 50B NWM + 50B の一般動画 &gt; 100B の NWM 専用データ
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Figure 28
評価
SCAND / RECON の egocentric navigation データ。zero-shot CEM planning（
N=120 サンプル、8ステップ地平）で ATE（絶対軌跡誤差）と RPE を測る
さらに総量 200B token を固定して NWM の比率を変えると、in-domain
NWM がわずか 1% 程度で性能がほぼ飽和する（Figure 9）
→ world modeling 能力の大部分は navigation データではなく general video
pretraining で獲得されている、というのが著者の主張


# Page. 14

![Page Image](https://bcdn.docswell.com/page/37K9ZX557D.jpg)

検討3：機序の説明と、評価されていない領域
査読での論点
Q. なぜ text が vision を助けるのか、機序が説明されていない（
Reviewer P1j7）
Q. world model と言いながら、標準的な video generation / prediction
benchmark での評価がない（Reviewer KJGE）
実験的には「text を増やす → GenEval 向上」は明確。しかし説明は「言語能力
が上がる → prompt を理解する → alignment が良くなる」という仮説どまり
切り分けられていない候補：
A. NWM も latent 空間で future frame を rollout し、planning では LPIPS を
使うので visual prediction の品質が直接効く。video prediction の中間評価
として妥当、と回答
prompt encoder としての言語特徴の改善／shared attention 表現自体の改善／
visual diffusion の方向が意味情報を獲得／expert routing 経由の転移
→ 説明としては妥当だが、一般的な video generation 能力まで実証したわ
けではない
→ “interesting observation but not a mechanistic explanation”
Q. interleaved data を一切扱っていない（Reviewer KJGE）
Q. 別パラダイムとの比較が弱い（KJGE / P1j7）
扱っているのは T→T / I→I / I→T / T→I / I+T→I のみ。document や multiimage conversation のような本格的な interleaved sequence はない（著者も
Limitations に “our work excludes interleaved data” と明記）
DreamLLM / Emu・Emu2 / NExT-GPT のように、MLLM の semantic state か
ら別の画像生成器を条件づけるパラダイムとの比較が薄い
→ 「modality competition は大きな問題ではない」という結論を、long
interleaved multimodal sequence にそのまま適用はできない
A. 本研究は semantic latent 自体を native に生成するので design paradigm
が違う、と回答
→ 「強い unimodal model を用意して後から十分に alignment する」方式
との全面比較は未実施。open question のまま


# Page. 15

![Page Image](https://bcdn.docswell.com/page/LJ3WD5K1J5.jpg)

アーキテクチャ：容量の割り当てを固定分割から learned routing へ
ステップ1：FFN だけ分ける
設計の積み上げ
Self-Attention は共有したまま、FFN だけ text 用と vision 用に分ける
PPL ↓ / DPG ↑
PPL 15.93 → 15.13、DPG 0.45 → 0.47。各 token は片方の FFN しか通らないので
、total parameter は増えるが active FLOPs はほぼ増えない
Transfusion 15.93 / 0.45
+ mod-specific FFN 15.13 /
0.47
→ modality competition の一部は、text と vision に同じ FFN 容量を無理に共有
させていたことに由来する
+ SigLIP 2 15.06 / 0.57
+ MoT 14.74 / 0.58
+ MoE 12.49 / 0.63
ステップ2：分割を router に任せる（MoE）
+ x-pred
固定的な FFN_text / FFN_vision という分割をやめ、多数の expert から router
が data-driven に top-k を選ぶ
推奨構成
SigLIP 2 (RAE)
+ MoE + x-pred
BAGEL とは矛盾しないのか（Reviewer 9ReQ）
「この論文では MoE &gt; MoT だが、BAGEL では逆では？」という質問。
著者の回答：BAGEL が MoE と呼ぶものは Qwen block の FFN をmodality ご
とに複製する方式で、本論文の分類では modality-specific FFN に近い。定
義を揃えると
modality-specific FFN
&lt;
MoT
&lt;
—
learned-routing MoE
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 —
Figure 26
/ 0.65


# Page. 16

![Page Image](https://bcdn.docswell.com/page/8JDKPD3KEG.jpg)

MoE の中身：粒度・疎性・専門分化
① 粒度（granularity）
② 疎性（sparsity）
③ 専門分化（specialization）
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Figure 20
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Figure 21
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Figure 22
13.5B total / 1.5B active で G = 1, 4, 16, 32, 64 を比
較。G を上げるほど 1 expert を小さくし、同時に
使う expert 数を増やす
active expert を 16 に固定したまま、total expert
数を 32 → 64 → 128 → 256 → 512 → 1008 と増や
す
router には「これは text expert にしなさい」とい
う教師を与えていない。それでも学習後は Text /
Vision / Multimodal expert に自然に分かれる
G=1 は 16 個の巨大 expert から top-1、G=64 は
1024 個の小 expert から top-64
active parameter はほぼ 1.5B のままだが、total は
1.5B → 51.46B まで増える
G = 16 付近まで大きく改善。ただし Vision は G
≈ 4 で飽和、Language は G ≈ 16 まで改善し続け
る
language PPL も vision generation も一貫して改
善。RAE / SigLIP 2 は expert を増やすほど vision
loss も改善し続けるが、VAE / FLUX は途中で飽和
する
層が深くなるにつれて early layer は Text expert 多
め、later layer で Vision / Multimodal が増える（
separate first, integrate later）
一方 visual generation 時と visual
understanding 時の expert 使用は非常に近く、
全層で r ≥ 0.90
③ の含意：Text と Vision では expert が分かれるが、Vision の understanding と generation ではほぼ同じ expert を使う。「表現を分けなくてよい」という知見1と整合してい
る


# Page. 17

![Page Image](https://bcdn.docswell.com/page/VEPKNX4378.jpg)

知見5：Vision と Language ではスケーリング則が違う
知見 5
IsoFLOP 解析で、compute-optimal な model size と data size を N_opt ∝ C^a
、D_opt ∝ C^b として推定する
Dense モデル
a：parameter
b：data
Language
0.47
0.53
Vision
0.37
0.63
Language はほぼ Chinchilla 型の N : D ≒ 1 : 1。Vision は D_opt ∝ C^0.63 で、かな
り data-hungry
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Figure 12
著者の解釈
Language = parameter-hungry /
MoE モデル
a：parameter
b：data
Language
0.41
0.59
Vision
0.36
0.64
data exponent の差が 0.63 − 0.53 = 0.10
減する
→
0.64 − 0.59 = 0.05 に半
Vision = data-hungry
MoE によって Language 側をより data-hungry な scaling regime に移動でき
、Vision との scaling mismatch を緩和できる
→ MoE は「parameter 効率が良いから強い」のではなく、modality 間で異
なる compute-optimal scaling を調停する手段だという位置づけ。ここが
本論文の独自性の高い部分


# Page. 18

![Page Image](https://bcdn.docswell.com/page/27VVKLXN7Q.jpg)

まとめ：何が言えて、何がまだ言えないか
かなり強く支持されている
✓ semantic な visual latent を understanding と generation で共有でき
まだ一般化できない
× 「modality competition は完全に解決した」という主張
る
✓ raw video を混ぜても language pretraining は大きくは壊れない
× caption distribution shift が language degradation の唯一または主要
な因果要因であること
✓ heterogeneous な general data が VQA・navigation world modeling
× 一般的な video generation / world modeling への拡張
を助ける
✓ modality-specific な容量割り当てと learned-routing MoE は、shared
dense FFN より有効
✓ Vision と Language の compute-optimal scaling には差がある
× interleaved multimodal data（document、multi-image 対話）への
適用
× 数十B〜数百B級の SOTA unified model でも同じ設計則が成立するか


# Page. 19

![Page Image](https://bcdn.docswell.com/page/5JGLQXV57L.jpg)

Take home message
1
unified multimodal pretraining の議論の解像度を上げた
「モダリティを混ぜると干渉する／しない」という粗い議論から、「representation・data distribution・capacity allocation を分けて考えよう」という段階
に進めた
2
discrete AR text と continuous flow vision を1つのモデルで共存させた
RAE + BOI/EOI により、意味的な視覚 latent を1本の系列の中で T → I → T として扱えることを大規模に示した
3
ラベルなし動画を「事前学習データ」として見る視点
unlabeled video を video generation 用データではなく foundation-model pretraining data として扱う。NWM 専用データを増やすより一般動画の方が効い
た結果は、今後の VLM 事前学習に示唆的
議論したいこと
本論文は interleaved data を意図的に除外している。だからこそ、同一 token budget・同一 architecture のまま interleaved data だけ
を足すという軸は、この論文をベースライン設計として使える非常に自然な次の研究課題になる。


# Page. 20

![Page Image](https://bcdn.docswell.com/page/47QYK86LEP.jpg)

補足資料


# Page. 21

![Page Image](https://bcdn.docswell.com/page/KE4WP245J1.jpg)

補足1：モダリティの切り替えと attention 構造
系列のつくり方
画像・動画フレームは &lt;BOI&gt; I₁, I₂, …, I₂₅₆ &lt;EOI&gt; で囲む。学習時にも同
じ記号を使い、動画の場合は各フレームを個別に BOI / EOI で囲む
attention mask の hybrid 構造
text
通常の causal
同一画像内
推論時の手順
1. text を autoregressive に生成する
2. &lt;BOI&gt; を生成した時点で text 生成を停止
frame 間
bidirectional
causal
※ Appendix C。最近の any-to-any モデルを理解するうえでも参考になる部分
3. noise latent を挿入
4. 25-step Euler で flow matching を回す（画像フレーム全体の latent block
をまとめて更新）
navigation は行動もテキストで与える
5. &lt;EOI&gt; を追加
6. text の autoregressive 生成を再開
→ 構造的に T → I → T を一続きの sequence として実行できる。画像生成
中は「次の visual token を1個ずつ AR 生成」しているのではない点が重
要
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Figure 28


# Page. 22

![Page Image](https://bcdn.docswell.com/page/L71Y9M42JG.jpg)

補足2：なぜ SigLIP latent から画像を戻せるのか（RAE）
SigLIP などの semantic feature は本来、画像再構成のための表現ではない
。しかし RAE (Representation Autoencoder) の decoder を学習しておけ
ば SigLIP latent → pixels を実現できる
層が深くなるほどのトレードオフ
ImageNet accuracy
PSNR
12.8% → 86.3%
29.6 dB → 20.9 dB
→ 深い特徴ほど pixel fidelity は下がり、semantic information は上がる。
Figure 16 では、初期層は碁盤や猫の細部まで忠実に再構成される一方、後
段では意味内容は保たれるが細部が滑らかになる
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Figure 17
損失の設計と予測ターゲット
損失は L = λ_LM · L_LM + λ_flow · L_flow。既定は λ_LM = 1、λ_flow = 3
予測ターゲットは visual representation に依存する。RAE (SigLIP 2) では x-pred が v-pred を一貫して上回り（DPG 0.63 → 0.65）、言語への影響も
小さい。一方 VAE (FLUX.1) では x-pred にすると granularity を上げたときに text perplexity が跳ね上がる
→ 低次元表現では x-pred は不安定になりやすく、高次元表現では恩恵がある


# Page. 23

![Page Image](https://bcdn.docswell.com/page/G7WGQ3X2E2.jpg)

補足3：3名の査読者の評価・指摘・回答
Reviewer KJGE
Reviewer 9ReQ
評価 unified multimodal pretraining という重要でタ
イムリーな問題。from-scratch かつ統制された設定で
representation / data / architecture / MoE / scaling を
切り分けている。future unified multimodal models の
reference paper になり得る
評価 pretrained initialization の confound を避けた
from-scratch study。4軸の体系的比較。world
modeling の emergence。MoE が language の
parameter-hungry 性と vision の data-hungry 性の違
いを緩和するという分析
指摘 データ品質と distribution shift の分析が浅い／
評価が proxy 寄り／interleaved data 未対応／typo・
writing／standard video generation benchmark がない
／DreamLLM・Emu・NExT-GPT との比較が弱い
指摘 text 能力を主に perplexity で評価している／
GenEval・DPGBench のbias と絶対性能／qualitative 比
較の不足／raw pixel が text PPL で最良な理由が不明／
BAGEL と逆の結論に見える
回答 Qwen3-Embedding-8B による t-SNE、DCLM と
の cosine distance、caption length を追加。image 側
にも bias はあるが text 側の shift の方が大きいと説明
。interleaved は future work と認めた
回答 332 model × 14 benchmark で ρ = −0.8468。
qualitative 例を追加。BAGEL の「MoE」は本論文の
modality-specific FFN に近いと整理
Reviewer P1j7
評価 （上2名と同様に実証研究としての価値を評価
）
指摘 text → vision の転移の mechanism が説明され
ていない／cosine distance と DCLM PPL の関係が単純
ではない／diffusion language models のように
objective 自体を統一する方向も検討に値する
回答 VQA では強い text prior が質問理解と回答生成
を助け、T2I では複雑な prompt の理解が alignment を
助ける可能性を説明。LLaVA 型 baseline との比較を提
示。diffusion-style language modeling は有望な方向と
認めた
最終判定：Strong Accept + Accept + Accept → Spotlight。AC は “strong empirical study and meaningful conclusion” を採択理由に挙げている


# Page. 24

![Page Image](https://bcdn.docswell.com/page/4JZLWV64E3.jpg)

補足4：データの内訳と、その他の実験結果
Dense モデルの scaling law
学習データ
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Table 2
I/T データソースの相補性
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Figure 10
expert の共有設計（Table 1）
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Figure 5
Tong et al., &quot;Beyond Language Modeling&quot;, ICML 2026 — Table 1
MetaCLIP を understanding に、Shutterstock を generation に割り当てると両者の
長所を取れる。データは capability ごとに独立に選べる可能性がある
256 expert / 16 active で、No Shared・Global Shared・Per-Modality Shared を比
較。per-modality の shared expert が全指標で最良で、モダリティごとに必要な容
量が違うことを示唆


