>100 Views
August 20, 26
スライド概要
2026年8月30-31日最先端NLP勉強会の発表資料です。
Beyond Language Modeling: An Exploration of Multimodal Pretraining (ICML 2026 Spotlight) について紹介するための資料です。現状は仮スライドで、当日までに差し替え予定です
某生成AI企業でVLMの開発や研究をしています。奈良先端大で客員助教をしています。 まとめたスライドをこちらで公開します。
本スライドの中身はほぼClaudeで作成しました。 当日までの雰囲気掴む用としてご覧ください。 当日は差し替えたスライドで紹介します 2026.08.30-31 最先端NLP勉強会 Beyond Language Modeling: An Exploration of Multimodal Pretraining Shengbang Tong, David Fan, John Nguyen, Ellis Brown, ほか(Meta FAIR / New York University) ICML 2026 Accept (Spotlight) | 査読: Strong Accept, Accept, Accept 紹介者:品川 政太朗(SB Intuitions / 奈良先端大)
[経歴] • 2020年 奈良先端科学技術大学院大学 博士(工学) • 2020年 同大学 助教 • 2024年 同大学 客員助教 / SB Intuitions株式会社 入社 [専門] • Vision and Language • 対話システム 品川 政太朗 Seitaro Shinagawa SB Intuitio ns/ 奈 良 先 端 科 学 技 術大 学 院 大 学 [書籍] • コンピュータビジョン最前線2021Winter ニュウモン Vision and Language(共立出版) • コンピュータビジョン最前線2023 Summer フカヨミCLIP(共立出版) • Vision Transformer入門 7章8章(技術評論社)
本日の流れ 1 論文の位置づけと問題設定 なぜ from-scratch でやる必要があったのか 2 実験の枠組み Transfusion + RAE、何を測っているか 3 5つの知見と、その信頼度 各知見のあとに、査読で出た論点を必ず置きます 4 まとめ 何が言えて、何がまだ言えないか
論文概要:SOTA モデルの提案ではなく、設計空間の解剖 書誌情報 TL;DR Beyond Language Modeling: An Exploration of Multimodal Pretraining Elucidating the design space of unified multimodal models including visual representation, data, world modeling, architecture, and scaling (dense + MoE). 著者 Shengbang Tong, David Fan, John Nguyen ほか計18名 AC のコメント:“strong empirical study and meaningful conclusion” Meta FAIR / NYU(Yann LeCun, Saining Xie, Luke Zettlemoyer, Jakob Verbeek ら) 採否 ICML 2026 Accept (Spotlight) 査読 3 件は Strong Accept / Accept / Accept 一言でいうと 「新しい unified multimodal model を提案した」のではなく、テキストと画像を1つのモデルで最初から一緒に事前学習すると き何が本当に効くのかを、from-scratch の統制実験で分解した研究 5つの軸で分解する Visual Representation Data World Model Architecture Scaling どんな視覚表現が最適か データを混ぜると何が起きるか 世界モデル能力の出どころ 容量をどう割り当てるか modality で法則は違うのか
背景:なぜ from-scratch で学習し直す必要があったのか 既存の主流 本研究 強力な pretrained LLM から出発して視覚を後付けする すべて from-scratch。言語事前学習の影響をゼロにする ・BAGEL(Emerging Properties in Unified Multimodal Pretraining) ・text / video / image-text / action-conditioned video を最初から混ぜる ・Janus / Emu・Emu2 / DreamLLM / NExT-GPT ・表現・データ・アーキテクチャ・スケーリングを1つの枠組みで比較 → multimodal pretraining 自体の効果と、もともと持っていた言語能 力を切り分けられない → 交絡なしに「何が効いたか」を帰属できる 検証したい通説:modality competition 「画像を混ぜると、その分だけ言語能力が食われる」 — 本当にそうなのか。そうならば、原因は データ か 表現 か アーキテ クチャ か。 本論文の答え Vision と Language は本質的には競合していない。うまく設計すればむしろ相乗効果があり、問題になる modality tax は主としてデ ータ分布と容量配分の設計に由来する。 ※ 本発表では BAGEL は「pretrained LLM 出発・MoT 的な設計」の代表として 2 回だけ参照します(背景とアーキテクチャの節)
研究の全体像 Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 1 中心的な問い Vision と Language を最初から一緒に学習したとき、本当に modality competition は起こるのか? 起こるなら、原因はデータなのか 、表現なのか、アーキテクチャなのか? 得られた4つの主要な知見(+スケーリング則) 知見1 RAE が最適な統一視覚表現 知見2 視覚と言語は相補的で相乗効果があ る 知見3 世界モデル能力が自然に立ち上がる 知見4 MoE が効率的なスケールと専門分化 を生む
実験の枠組み:Transfusion 型で1つの Transformer に2つの目的関数 モデル 学習データ ・decoder-only Transformer 1本。text は autoregressive な next-token prediction、image / video は連続 latent への flow matching ・損失は L = λ_LM · L_LM + λ_flow · L_flow (既定値 λ_LM = 1, λ_flow = 3) visual token は「語彙」ではない ・画像は frozen vision encoder で 256 visual tokens(16×16 grid)の連続値に。既定は SigLIP 2 So400M ・hidden state から text 位置は vocabulary head、vision 位置は continuous linear head へ分 岐。後者が flow matching を予測 ・NExT-GPT 型の「signal token を出して外部の画像生成器を条件付ける」方式とは性質が違 い、画像の latent をこの Transformer 自身が生成する モダリティの切り替え Tong et al., "Beyond Language Modeling", ICML 2026 — Table 2 主な評価指標 言語 DCLM validation PPL、in-house “Notes” PPL(OOD 評価 ) ・画像 / 動画フレームは <BOI> I₁…I₂₅₆ <EOI> で囲む(学習時・推論時とも) 画像生成 CC12M の diffusion loss、DPGBench、GenEval、 COCO FID ・attention は text=causal / 同一画像内=bidirectional / frame 間=causal のhybrid 構造 視覚理解 VQA(finetuning 後の平均精度) 推論時:T → I → T を一続きの系列として実行できる text を AR 生成 → <BOI> を生成 → text 生成を停止 → noise latent を挿入 → 25-step Euler で flow matching → <EOI> を追加 → text の AR 生成を再開 ※ 画像生成中は visual token を1個ずつ AR 生成するのではなく、フレーム全体の latent block を flow で更新し ている 世界モデル Navigation World Model の ATE / RPE(zero-shot CEM planning) ※ 言語能力を PPL 中心で測っている点は、後で査読の論点になり ます
知見1:意味的な視覚表現ひとつで、理解も生成もまかなえる 知見 1 従来 understanding は SigLIP / CLIP、generation は VAE latent という dual representation(BAGEL・Janus が典型) 本論文 SD-VAE / FLUX.1 VAE / SigLIP 2 / DINOv2-L / WebSSL-L / raw pixels を同一条件で比較 結果 SigLIP 2 の latent をそのまま生成にも使う RAE (Representation Autoencoder) 構成が DPGBench・GenEval・VQA のすべてで最良。しか も text PPL は text-only とほぼ同等 Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 2 何が変わるのか 従来: x → z_semantic(理解) / z_VAE(生成) 本論文: x → z_semantic → 理解・生成の両方 の2系統 → understanding と generation で visual representation を分けな くてよい可能性 ※ SigLIP の意味特徴は本来再構成用ではないが、RAE decoder を学習すれば latent → pixels を実現できる(補足参照) 図の読み方 ・左2枚(PPL ↓):どの視覚表現でも text-only 破線とほぼ同じ高さ ・右3枚(生成・VQA ↑):SigLIP 2(青)が一貫して最も高い ・SD-VAE / FLUX.1(赤系)は生成でも VQA でも semantic encoder に劣る ・raw pixels は生成では劣るが VQA の差は小さい(十分な計算量があれば有望 と著者はコメント)
検討1:この比較はどこまで信じてよいか 査読での論点 Q. 生成評価が GenEval / DPGBench 中心。両者には既知の bias があり 、絶対性能も SOTA から遠い(Reviewer 9ReQ) Q. 生成・VQA では SigLIP が圧勝なのに、language PPL だけは raw pixel が最も良いのはなぜか(Reviewer 9ReQ) A. rebuttal で qualitative な生成例を追加。Dense < MoT < MoE という metric の傾向は visual quality の傾向とも一致する、と回答 A. raw pixel は外部 vision encoder 由来の bias を持たず end-to-end に学習 されるため、language modeling に干渉しにくいのでは、という仮説 → それでも「弱い performance regime で成立した設計則が、大規模 SOTA model でも成立する保証はない」という問題は残る → 著者自身も PPL 差は小さいとして強くは主張していない。機序は未解明 のまま 読み方の目安 「RAE(semantic latent)は VAE より良い」という相対比較は、同一条件で6種類を並べているぶんかなり強い。一方で、この論文の数 値を絶対水準の議論に使うことはできない。
知見2:言語を壊しているのは「視覚」ではなく「キャプションの分布」 知見 2 設定 520B text + 520B multimodal token で、Text only / + raw Video / + MetaCLIP / + Video + MetaCLIP + Action を比較 結果1 Text + Video は Text-only とほぼ同じ。DCLM PPL ではむしろわずか に良い 結果2 き 悪化するのは Text + MetaCLIP、つまり image-text ペアを混ぜたと 解釈 視覚そのものが言語を壊しているのではなく、image-text データに付随 する caption text の distribution shift が問題ではないか Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 3 caption 埋め込みと DCLM の cosine distance 図の読み方(PPL は左が良い) MetaCLIP 0.196 ・Text 520B(青)と + Video 520B(緑)はほぼ同じ位置 Shutterstock (SSTK) 0.215 ・+ MetaCLIP(橙)だけが明確に右(悪い方向)へ動く MetaCLIP Recaption 0.286 → raw video は言語モデリングと両立する。「視覚を入れると必ず言語が落 ちる」わけではない DCLM から遠い分布のキャプションほど PPL が悪化するという対応
検討2:PPL で言語能力を語ってよいのか/因果は示されたのか 査読での論点 Q. 言語能力の評価が PPL 中心。「PPL が同じだから言語能力も落ちてい ない」と本当に言えるのか(KJGE / 9ReQ) Q. 「caption の distribution shift が原因」という因果は示されたのか( Reviewer P1j7) A. 332 の multimodal pretrained model × 14 の言語ベンチマークで、DCLM PPL と平均 zero-shot accuracy の Spearman 相関 ρ = −0.8468(HellaSwag −0.9204 / ARC-C −0.7033) ・cosine distance と DCLM PPL の関係はそれほどきれいではない さらに downstream の直接比較も追加: Text-only 61.6 / Text + Video 61.7 / Text + MetaCLIP 59.7 Full multimodal 61.4 / → 9ReQ は「model 集団全体で相関しても、論文中の特定 configuration 間 のpairwise 結論を保証しない」と再指摘。著者は最終的に6タスクの直接評 価を追加した ・MetaCLIP 単独・SSTK 単独よりも MetaCLIP(I2T) + SSTK(T2I) の方が良い 、という結果は単純な「距離が近いほど良い」説明と整合しにくい A. I2T には DCLM に近い caption 分布を持つ MetaCLIP を、T2I には optimization がより滑らかな SSTK を割り当てることで両者の利点を得てい る、と説明 → 補強はされたが、厳密な因果関係の証明ではない 読み方の目安 安全に言えるのは「raw video を追加しても、pretraining PPL および複数の zero-shot NLP task では大きな language degradation は見ら れない」まで。「すべての言語能力に modality competition は存在しない」と一般化するのは強すぎる。
知見3:モダリティ間には正の転移がある — 専門データより一般データ
知見 3
設定
VQA でも同じことが起きる
text token と vision token を {0, 25, 50, 75, 100}B で組み合わせる
結果 vision budget を固定したまま text token を増やすほど、diffusion
loss も GenEval も改善する(= 言語の学習が画像生成を助ける)
Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 7
20B の VQA データに 80B を足す(平均 VQA 精度)
VQA 20B のみ 34.6 → + Video 80B 36.1 → + Image/Text 80B 36.9 →
+ Text 80B 37.9 (VQA 100B は 35.7)
Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 6
著者の解釈 GenEval などは複雑な text prompt に条件づけられるため、言語能力
が高いモデルほど prompt を理解でき、text-image alignment も向上する
→ 20B の task データ + 80B の general データ > 100B の task データ
※ 520B+520B 規模でも multimodal pretraining 後の VQA finetuning が優位(SigLIP 2: 40.3
vs 33.9)
知見4:世界モデル能力は「一般動画」から立ち上がる
知見 4
設定 navigation を State_t + Action → State_{t+1} という next visual state
prediction として扱う(NWM: Navigation World Model)
工夫 Action を専用 embedding にせず dx=…, dy=…, dyaw=… という普通の
text token として与える。action 専用の adapter も architecture 変更も追加し
ていない
Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 8
ATE(小さいほど良い)
NWM 50B 1.974 → NWM 100B 1.669
video 1.448 → + Raw Video 1.410
→ + Text 1.657 → + Action
→ 50B NWM + 50B の一般動画 > 100B の NWM 専用データ
Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 28
評価
SCAND / RECON の egocentric navigation データ。zero-shot CEM planning(
N=120 サンプル、8ステップ地平)で ATE(絶対軌跡誤差)と RPE を測る
さらに総量 200B token を固定して NWM の比率を変えると、in-domain
NWM がわずか 1% 程度で性能がほぼ飽和する(Figure 9)
→ world modeling 能力の大部分は navigation データではなく general video
pretraining で獲得されている、というのが著者の主張
検討3:機序の説明と、評価されていない領域 査読での論点 Q. なぜ text が vision を助けるのか、機序が説明されていない( Reviewer P1j7) Q. world model と言いながら、標準的な video generation / prediction benchmark での評価がない(Reviewer KJGE) 実験的には「text を増やす → GenEval 向上」は明確。しかし説明は「言語能力 が上がる → prompt を理解する → alignment が良くなる」という仮説どまり 切り分けられていない候補: A. NWM も latent 空間で future frame を rollout し、planning では LPIPS を 使うので visual prediction の品質が直接効く。video prediction の中間評価 として妥当、と回答 prompt encoder としての言語特徴の改善/shared attention 表現自体の改善/ visual diffusion の方向が意味情報を獲得/expert routing 経由の転移 → 説明としては妥当だが、一般的な video generation 能力まで実証したわ けではない → “interesting observation but not a mechanistic explanation” Q. interleaved data を一切扱っていない(Reviewer KJGE) Q. 別パラダイムとの比較が弱い(KJGE / P1j7) 扱っているのは T→T / I→I / I→T / T→I / I+T→I のみ。document や multiimage conversation のような本格的な interleaved sequence はない(著者も Limitations に “our work excludes interleaved data” と明記) DreamLLM / Emu・Emu2 / NExT-GPT のように、MLLM の semantic state か ら別の画像生成器を条件づけるパラダイムとの比較が薄い → 「modality competition は大きな問題ではない」という結論を、long interleaved multimodal sequence にそのまま適用はできない A. 本研究は semantic latent 自体を native に生成するので design paradigm が違う、と回答 → 「強い unimodal model を用意して後から十分に alignment する」方式 との全面比較は未実施。open question のまま
アーキテクチャ:容量の割り当てを固定分割から learned routing へ ステップ1:FFN だけ分ける 設計の積み上げ Self-Attention は共有したまま、FFN だけ text 用と vision 用に分ける PPL ↓ / DPG ↑ PPL 15.93 → 15.13、DPG 0.45 → 0.47。各 token は片方の FFN しか通らないので 、total parameter は増えるが active FLOPs はほぼ増えない Transfusion 15.93 / 0.45 + mod-specific FFN 15.13 / 0.47 → modality competition の一部は、text と vision に同じ FFN 容量を無理に共有 させていたことに由来する + SigLIP 2 15.06 / 0.57 + MoT 14.74 / 0.58 + MoE 12.49 / 0.63 ステップ2:分割を router に任せる(MoE) + x-pred 固定的な FFN_text / FFN_vision という分割をやめ、多数の expert から router が data-driven に top-k を選ぶ 推奨構成 SigLIP 2 (RAE) + MoE + x-pred BAGEL とは矛盾しないのか(Reviewer 9ReQ) 「この論文では MoE > MoT だが、BAGEL では逆では?」という質問。 著者の回答:BAGEL が MoE と呼ぶものは Qwen block の FFN をmodality ご とに複製する方式で、本論文の分類では modality-specific FFN に近い。定 義を揃えると modality-specific FFN < MoT < — learned-routing MoE Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 26 / 0.65
MoE の中身:粒度・疎性・専門分化 ① 粒度(granularity) ② 疎性(sparsity) ③ 専門分化(specialization) Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 20 Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 21 Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 22 13.5B total / 1.5B active で G = 1, 4, 16, 32, 64 を比 較。G を上げるほど 1 expert を小さくし、同時に 使う expert 数を増やす active expert を 16 に固定したまま、total expert 数を 32 → 64 → 128 → 256 → 512 → 1008 と増や す router には「これは text expert にしなさい」とい う教師を与えていない。それでも学習後は Text / Vision / Multimodal expert に自然に分かれる G=1 は 16 個の巨大 expert から top-1、G=64 は 1024 個の小 expert から top-64 active parameter はほぼ 1.5B のままだが、total は 1.5B → 51.46B まで増える G = 16 付近まで大きく改善。ただし Vision は G ≈ 4 で飽和、Language は G ≈ 16 まで改善し続け る language PPL も vision generation も一貫して改 善。RAE / SigLIP 2 は expert を増やすほど vision loss も改善し続けるが、VAE / FLUX は途中で飽和 する 層が深くなるにつれて early layer は Text expert 多 め、later layer で Vision / Multimodal が増える( separate first, integrate later) 一方 visual generation 時と visual understanding 時の expert 使用は非常に近く、 全層で r ≥ 0.90 ③ の含意:Text と Vision では expert が分かれるが、Vision の understanding と generation ではほぼ同じ expert を使う。「表現を分けなくてよい」という知見1と整合してい る
知見5:Vision と Language ではスケーリング則が違う 知見 5 IsoFLOP 解析で、compute-optimal な model size と data size を N_opt ∝ C^a 、D_opt ∝ C^b として推定する Dense モデル a:parameter b:data Language 0.47 0.53 Vision 0.37 0.63 Language はほぼ Chinchilla 型の N : D ≒ 1 : 1。Vision は D_opt ∝ C^0.63 で、かな り data-hungry Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 12 著者の解釈 Language = parameter-hungry / MoE モデル a:parameter b:data Language 0.41 0.59 Vision 0.36 0.64 data exponent の差が 0.63 − 0.53 = 0.10 減する → 0.64 − 0.59 = 0.05 に半 Vision = data-hungry MoE によって Language 側をより data-hungry な scaling regime に移動でき 、Vision との scaling mismatch を緩和できる → MoE は「parameter 効率が良いから強い」のではなく、modality 間で異 なる compute-optimal scaling を調停する手段だという位置づけ。ここが 本論文の独自性の高い部分
まとめ:何が言えて、何がまだ言えないか かなり強く支持されている ✓ semantic な visual latent を understanding と generation で共有でき まだ一般化できない × 「modality competition は完全に解決した」という主張 る ✓ raw video を混ぜても language pretraining は大きくは壊れない × caption distribution shift が language degradation の唯一または主要 な因果要因であること ✓ heterogeneous な general data が VQA・navigation world modeling × 一般的な video generation / world modeling への拡張 を助ける ✓ modality-specific な容量割り当てと learned-routing MoE は、shared dense FFN より有効 ✓ Vision と Language の compute-optimal scaling には差がある × interleaved multimodal data(document、multi-image 対話)への 適用 × 数十B〜数百B級の SOTA unified model でも同じ設計則が成立するか
Take home message 1 unified multimodal pretraining の議論の解像度を上げた 「モダリティを混ぜると干渉する/しない」という粗い議論から、「representation・data distribution・capacity allocation を分けて考えよう」という段階 に進めた 2 discrete AR text と continuous flow vision を1つのモデルで共存させた RAE + BOI/EOI により、意味的な視覚 latent を1本の系列の中で T → I → T として扱えることを大規模に示した 3 ラベルなし動画を「事前学習データ」として見る視点 unlabeled video を video generation 用データではなく foundation-model pretraining data として扱う。NWM 専用データを増やすより一般動画の方が効い た結果は、今後の VLM 事前学習に示唆的 議論したいこと 本論文は interleaved data を意図的に除外している。だからこそ、同一 token budget・同一 architecture のまま interleaved data だけ を足すという軸は、この論文をベースライン設計として使える非常に自然な次の研究課題になる。
補足資料
補足1:モダリティの切り替えと attention 構造 系列のつくり方 画像・動画フレームは <BOI> I₁, I₂, …, I₂₅₆ <EOI> で囲む。学習時にも同 じ記号を使い、動画の場合は各フレームを個別に BOI / EOI で囲む attention mask の hybrid 構造 text 通常の causal 同一画像内 推論時の手順 1. text を autoregressive に生成する 2. <BOI> を生成した時点で text 生成を停止 frame 間 bidirectional causal ※ Appendix C。最近の any-to-any モデルを理解するうえでも参考になる部分 3. noise latent を挿入 4. 25-step Euler で flow matching を回す(画像フレーム全体の latent block をまとめて更新) navigation は行動もテキストで与える 5. <EOI> を追加 6. text の autoregressive 生成を再開 → 構造的に T → I → T を一続きの sequence として実行できる。画像生成 中は「次の visual token を1個ずつ AR 生成」しているのではない点が重 要 Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 28
補足2:なぜ SigLIP latent から画像を戻せるのか(RAE) SigLIP などの semantic feature は本来、画像再構成のための表現ではない 。しかし RAE (Representation Autoencoder) の decoder を学習しておけ ば SigLIP latent → pixels を実現できる 層が深くなるほどのトレードオフ ImageNet accuracy PSNR 12.8% → 86.3% 29.6 dB → 20.9 dB → 深い特徴ほど pixel fidelity は下がり、semantic information は上がる。 Figure 16 では、初期層は碁盤や猫の細部まで忠実に再構成される一方、後 段では意味内容は保たれるが細部が滑らかになる Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 17 損失の設計と予測ターゲット 損失は L = λ_LM · L_LM + λ_flow · L_flow。既定は λ_LM = 1、λ_flow = 3 予測ターゲットは visual representation に依存する。RAE (SigLIP 2) では x-pred が v-pred を一貫して上回り(DPG 0.63 → 0.65)、言語への影響も 小さい。一方 VAE (FLUX.1) では x-pred にすると granularity を上げたときに text perplexity が跳ね上がる → 低次元表現では x-pred は不安定になりやすく、高次元表現では恩恵がある
補足3:3名の査読者の評価・指摘・回答 Reviewer KJGE Reviewer 9ReQ 評価 unified multimodal pretraining という重要でタ イムリーな問題。from-scratch かつ統制された設定で representation / data / architecture / MoE / scaling を 切り分けている。future unified multimodal models の reference paper になり得る 評価 pretrained initialization の confound を避けた from-scratch study。4軸の体系的比較。world modeling の emergence。MoE が language の parameter-hungry 性と vision の data-hungry 性の違 いを緩和するという分析 指摘 データ品質と distribution shift の分析が浅い/ 評価が proxy 寄り/interleaved data 未対応/typo・ writing/standard video generation benchmark がない /DreamLLM・Emu・NExT-GPT との比較が弱い 指摘 text 能力を主に perplexity で評価している/ GenEval・DPGBench のbias と絶対性能/qualitative 比 較の不足/raw pixel が text PPL で最良な理由が不明/ BAGEL と逆の結論に見える 回答 Qwen3-Embedding-8B による t-SNE、DCLM と の cosine distance、caption length を追加。image 側 にも bias はあるが text 側の shift の方が大きいと説明 。interleaved は future work と認めた 回答 332 model × 14 benchmark で ρ = −0.8468。 qualitative 例を追加。BAGEL の「MoE」は本論文の modality-specific FFN に近いと整理 Reviewer P1j7 評価 (上2名と同様に実証研究としての価値を評価 ) 指摘 text → vision の転移の mechanism が説明され ていない/cosine distance と DCLM PPL の関係が単純 ではない/diffusion language models のように objective 自体を統一する方向も検討に値する 回答 VQA では強い text prior が質問理解と回答生成 を助け、T2I では複雑な prompt の理解が alignment を 助ける可能性を説明。LLaVA 型 baseline との比較を提 示。diffusion-style language modeling は有望な方向と 認めた 最終判定:Strong Accept + Accept + Accept → Spotlight。AC は “strong empirical study and meaningful conclusion” を採択理由に挙げている
補足4:データの内訳と、その他の実験結果 Dense モデルの scaling law 学習データ Tong et al., "Beyond Language Modeling", ICML 2026 — Table 2 I/T データソースの相補性 Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 10 expert の共有設計(Table 1) Tong et al., "Beyond Language Modeling", ICML 2026 — Figure 5 Tong et al., "Beyond Language Modeling", ICML 2026 — Table 1 MetaCLIP を understanding に、Shutterstock を generation に割り当てると両者の 長所を取れる。データは capability ごとに独立に選べる可能性がある 256 expert / 16 active で、No Shared・Global Shared・Per-Modality Shared を比 較。per-modality の shared expert が全指標で最良で、モダリティごとに必要な容 量が違うことを示唆