【Paper&Hacks vol.101】VLA最新論文について紹介

>100 Views

October 05, 26

スライド概要

profile-image

東京大学松尾・研究室が運営する「松尾研LLMコミュニティ」でのイベント資料などを公開します。 ◾️ 松尾研LLMコミュニティとは 松尾研LLMコミュニティは、「大規模言語モデルについて知って学べるオンライン空間」として、東京大学松尾・岩澤研究室が運営するコミュニティです。 現在、学生を中心とした10,000名以上が、原則無償で参加しています。 また、本コミュニティでは様々なイベント等を定期的に開催しております。 是非下記のリンクより参加申し込みをお待ちしております。 ◾️ 松尾研LLMコミュニティの各種リンク ・今後のイベント開催情報/参加申込;https://tr.ee/7d_W4DsImD ・松尾研LLMコミュニティ参加フォーム;https://tr.ee/RyDfuRzS55 ・過去イベントアーカイブ;https://tr.ee/wqdbFJJZ25

シェア

またはPlayer版

埋め込む »CMSなどでJSが使えない場合

ダウンロード

関連スライド

各ページのテキスト
2.

VLA最新論文について紹介 異業種データサイエンス研究会メンバー 西前 和隆 2026/10/6

3.

本日のアジェンダ 01 VLAの基礎 02 VLAの問題点 03 論文1: CLAP(Closed-Loop Alignment with Pressure for Precise Suction Manipulation) 04 論文2:SEES(CoDistill-GRPO: A Co-Distillation Recipe for Efficient Group Relative Policy 04 Optimization ) 定義·系譜·アーキテクチャ·行動表現·学習パイプライン·評価 長期タスク·データ·接触知覚·閉ループ性·精度·汎化·安全·評価 真空圧で吸着状態を観測し、精密な積み付けを実現するVLA 蒸留失敗からボトルネックを特定し、シミュレーションRLで自己進化 05 まとめ 論文ごとの貢献・問題点への回答・統合メッセージ

4.

01.VLAの基礎 視覚と言語の理解をロボットの行動生成に直結させる、 Vision-Language-Action モデルの全体像を押さえる

5.

01.VLAの基礎 (VLAとは:観測と言語指示から行動を直接出力するポリシー) 画像・言語・ロボット状態 → kステップ分の行動 a_t:t+k ~ 2024 π_θ( · | o_t , l , q_t ) o_t:画像観測/ : l 言語指示/ q_t:固有受容(関節角・グリッパ状態)/出力:kステップ分の行動 事前学習VLMを転用 Web規模の画像・テキストで 得た意味理解をロボット制御 に持ち込む End-to-End 知覚・計画・制御を一つのネ ットワークで学習する 汎用性を志向 複数タスク・複数ロボット (embodiment)を1つのモデル で扱う 従来のモジュール型(認識 → 計画 → 制御)との違い:VLMの事前学習知識をそのまま行動生成に使う

6.

01.VLAの基礎 (主要モデルの系譜(2022–2026)) RT-2で「VLA」が提唱され、π0以降は連続行動の生成モデルが主流に 2022.12 2023.07 2024.05 2024.06 RT-1 RT-2 Octo OpenVLA 大規模実機デモで学 習したTransformerポ リシー VLMを行動トークン で共同微調整。 「VLA」を提唱 OXEで学習した拡散ヘ ッドの汎用ポリシー 7B・オープン重み。 離散行動トークン 2024.10 2025.03 2025.04 2026.05 π0 GR00T N1 π0.5 RLDX-1 VLM+flow matching の action expert ヒューマノイド向け。 VLM+拡散 Transformerの二重系 高レベル推論と低レ ベル行動の統合 器用な手の操作を重 視(SEESで使用)

7.

01.VLAの基礎 (標準的な構成:VLMバックボーン+行動ヘッド) 画像パッチ・言語トークン・固有受容を統合し、行動チャンクを出力 視覚エンコーダ SigLIP / DINOv2 入力の融 合 言語指示 トークナイズ VLMバックボーン 数B規模のLLM 画像パッチと言語トークンを同一系列に並べ、 固有受容状態は別トークンや行動ヘッドへ注 入する 行動ヘッド トークン / 拡散 / flow 出力の形 式 行動チャンク a_t … a_t+k 行動の表現方法(離散か連続か)が、推論速 度・精度・学習安定性を大きく左右する 後半との関係:CLAPは「固有受容の入力」を、SEESは「行動ヘッド周りのLoRA」を改変する

8.

01.VLAの基礎 (行動をどう表すか:3つの方式) 行動表現の違いは推論速度・精度、さらにはRLの実装にも影響する 方式 代表例 仕組み 長所/短所 離散トークン RT-2, OpenVLA 各次元を256ビンに量子化し語 彙として出力 VLMをそのまま使える/逐次生 成が遅く精度が粗い 圧縮トークン FAST 行動系列をDCT変換+BPEで圧縮 してトークン化 高頻度制御に強い/復号の誤差 に注意 連続生成 π0, Octo, GR00T 拡散・flow matchingの行動エキス パートで連続値を生成 滑らかで多峰性を表現/反復サ ンプリングの計算 SEESはflow系ポリシーのPPOで、最終行動ではなくデノイジング遷移の尤度を用いる

9.

01.VLAの基礎 (行動チャンク:まとめて予測し、開ループで実行する) CLAPへの伏線:実行窓の間は「目をつぶっている」 観測 o_t 推論を1回実行 k個の行動を予測 a_t … a_t+k 利 点 推論回数が減り高頻度制御が可能。時間的に一 貫した滑らかな動作になり、模倣学習の複合誤 差も抑えられる(ACT, π0 など) kステップ実行 この間は観測を見な い 次の推論 o_t+k から 代償 実行窓の間は観測を使わない。想定外の事象 (把持失敗・接触変化)に即座に反応できない

10.

01.VLAの基礎 (学習は多段:VLM事前学習から強化学習まで) 模倣学習だけではデモの質と量が上限 → RLでデモを超える改善を狙う ① VLM事前学習 Web画像・テキスト ②ロボット事前学習 多様なデモの大規模 混合 ③ タスクSFT 対象ロボット・タス ク ④ RL微調整 シミュレーション等 でオンラインRL • ①②で汎用性を、③で対象環境への適合を得るのが基本形。パラメータ効率のためLoRAも よく使われる • ④は2025年以降に急増:SimpleVLA-RL、 RLinf などの枠組みが登場(SEESはRLinf上に実装) • SEESは④を「どのタスクを・どの報酬で・いつ訓練するか」まで自動化したものと位置づけ られる

11.

01.VLAの基礎 (データ:テレオペレーションによるデモが中心) Web言語データと比べて桁違いに小さく、集めやすいタスクに偏る 100万+ Open X-Embodiment:22種のロボットから の軌跡を集約した共有データセット 収集コスト 1デモごとに人手のテレオペが必要。多段 の長いタスクほど高価になる 7.6万 DROID:多様な実環境で収集されたフラン カアームの軌跡 分布の偏り 安価に集めやすい短い単段タスクに偏りや すい(SEESが指摘する問題)

12.

01.VLAの基礎 (評価:シミュレーションのベンチマークと実機試験) 主な指標は成功率(%)。精密操作では配置誤差(mm)も用いる ベンチマーク 内容 本日の論文 LIBERO Object / Spatial / Goal / Long の4スイート × 各10タス ク SEES RoboCasa365 キッチン環境。atomic 65タスク+複合300タスク SEES SIMPLER など 実機ポリシーをシミュレーションで再現評価 — 実機試験 タスクごとに試行を重ねて成功率・誤差を測る CLAP(Unitree Z1) SEESはシミュレーションのみ、CLAPは実機のみで評価 — 結果を読む際の前提として重要

13.

01.VLAの基礎 (階層型VLA:計画するVLMと、動かすポリシーを分ける) 「遅い推論系(System 2)+速い制御系(System 1) 」の二重構造 長期の指示 「まな板を洗って」 VLMプランナ System 2:サブタス クに分解 行動ポリシー System 1:高速に実 行 ロボット • GR00T N1、 Figure の Helix、π0.5 などが二重構造を採用 • 長期タスクを atomic なサブタスクの列として扱うことで、失敗の位置を特定しやすくな る • SEESはこの分解を前提に、どのサブタスクが失敗の原因かを数える仕組みを作る

14.

02.VLAの問題点 短期·単段のタスクではよく動く一方、実用の現場で壁に なる課題を整理する

15.

02.VLAの問題点 (主な問題点の地図) SEESは「学習の側」、 CLAPは「実行の側」の問題を攻める ① 長期タスク 段数が増えると 成功率が急落 ⑤ 精度 mm単位の配置で 誤差が累積 ② データ 高コストで単段 タスクに偏る ⑥ 汎化 新しい物体・環境 で崩れる • 知覚の欠落接 触・力・内部状 態が見えない ⑦ 計算と安全 推論遅延、失敗の 検知と回復 ④ 開ループ実行 チャンク実行中 に反応できない ⑧ 評価 sim-real差、試行数 の少なさ オレンジ=SEESが扱う問題 / 青=CLAPが扱う問題 / グレー=本日の2論文では主題外

16.

02.VLAの問題点 ( ① 長期タスク:各段の失敗率が掛け算で効く) 段数に対して成功率は指数的に低下する • 例:成功率90%の段を5つつなぐと全体は 0.9^5 ≈ 59%、10段なら ≈ 35% • 前段の小さなずれが後段の初期状態を分布外 に押し出す(複合誤差) • どの段が原因で失敗したのか、外から見ても 分かりにくい 関連する論文:SEES 1つの弱いatomicスキルが多数 の複合タスクを壊す、という観 察から出発する

17.

02.VLAの問題点 ( ② データ:集めやすいタスクに偏り、運用後に足しにくい) 人手による診断とデモ追加のループは配備後に回らない • デモは人手のテレオペが前提で、多段タスク ほど収集が高価 • その結果、学習データは単段の短いマニピュ レーションに偏る • 弱点を直すには専門家がボトルネックを診断 し、追加デモを集める必要がある • 製品として配備した後では、この人手のループ は現実的でない 関連する論文:SEES 追加の専門家デモなしで、失敗 から自動的に改善する仕組み を提案

18.

02.VLAの問題点 ( ③ 知覚の欠落:カメラだけでは見えない状態がある) 指令値は入っていても、実際に起きたことは観測されていない • 接触状態・把持力・吸着の成否は画像に映り にくい • 決定的な瞬間に、グリッパ自体が対象物を遮 蔽する • 多くのVLAは固有受容として「指令値」を入れ ており、実際に起きたことを観測していない 関連する論文:CLAP 真空ラインの圧力を測り、 吸着状態を観測可能にする

19.

02.VLAの問題点 ( ④ 開ループ実行:チャンク実行中は失敗に気づけない) チャンク長の固定的なトレードオフ • kステップの実行窓の間、ポリシーは新しい観 測を使わない • 把持が外れた・ずれたまま、残りの行動を最 後まで実行してしまう • 窓を短くすれば反応性は上がるが、推論コス トと動作の一貫性が犠牲になる 関連する論文:CLAP 圧力信号をトリガに実行窓 を打ち切り、新しい観測か ら再推論する

20.

02.VLAの問題点 ( ⑤ 精度:誤差が層をまたいで受け継がれる) 吸着ではメカニカルな位置合わせ(セルフアライン)が効かない • 積み付け・パレタイズでは、下の層の誤差が そのまま上の層の土台になる • 平らな吸着パッドには、ずれた姿勢を正しい 位置へ導く形状的な手がかりがない • 成功率だけでなく、配置誤差(mm)での評価 が必要になる 関連する論文:CLAP 4ブロック積みの成功試行で 平均配置誤差 15.92 mm を報 告

21.

02.VLAの問題点 ( ⑥ 汎化:学習分布の外で性能が崩れる) 本日の主題ではないが、SEESの結果を読む背景として 新しい物体・配置 見たことのない形状・色・ 配置で成功率が低下する 新しい環境 照明・背景・カメラ位置の 変化に弱い 新しいembodiment ロボットの形状や行動空間 が変わると転移が難しい SEESは、進化に使っていない Composite-Unseen タスクでの改善も報告

22.

02.VLAの問題点 ( ⑦ 推論コストと、失敗の検知・回復) 下段は発表者の解 釈 推論コスト・リアルタイム性 数B規模のモデルを制御周期内で動かす必 要がある。量子化・小型化・チャンク化・ 非同期推論などの工夫が続く 安全性と失敗回復 失敗を自分で検知できないと危険な状態の まま動作が続く。検知後の回復行動も学習 データにほとんど含まれない CLAPの「中断された把持の後の構成」をカバーするデモ、SEESの終了ヘッドと失敗帰属は、 いずれも失敗検知・回復の一形態とみなせる

23.

02.VLAの問題点 ( ⑧ 評価:シミュレーションと実機の差、試行数の少なさ) 数字を見る前に「どの環境で何回試したか」を確認する • シミュレーションの成功が実機に移るとは限らない(sim-to-real gap) • 実機評価は試行が数十回程度になりがちで、数ポイントの差は統計的に揺れる • ベンチマーク間で設定がそろっておらず、手法の横比較が難しい CLAP(論文1) 実機のみ(Unitree Z1)で評価 SEES(論文2) シミュレーションのみ。実機は未検証と著 者も明記

24.

03.論文1 CLAP:Closed-Loop Alignment with Pressure 真空圧で吸着状態を観測し、精密な積み付けを実現するVLA [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation

25.

03.論文1:CLAP(論文1:基本情報) 出典:論文本文(arXiv v1 PDF)。以降の数値は Table I・II および本文による 項目 内容 タイトル CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation 著者 Yixian Zou, Chongyang Xu, Yuling Xin, Ziliang Feng, Fanman Meng, Shuaicheng Liu(電子科技大学・四川大学) 投稿 arXiv:2609.32767(cs.RO)、2026年9月26日、8ページ・図6点 ベース π0.5 を全パラメータ微調整。実機 Unitree Z1 のみで評価(計1,560試行) 公開予定 コードと学習済み重みを公開予定と記載 [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation

26.

03.論文1:CLAP(課題設定:積み付け・パレタイズは誤差を許さない) ある層に残った誤差は、そのまま次の層に受け継がれる 1層目 わずかな位置ずれ 誤差の継承 ある層に残った配置誤差は、 そのまま次の層に受け継が れる 2層目 ずれた土台の上に置く 補正の手がかりがない 平らなパッドには、ずれた 姿勢を正しい位置へ導く 形状的な特徴がない [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation 3層目以降 誤差が蓄積・継承 なぜ吸着か 密な配置では挟む隙間がな い。Z1標準グリッパの開口 80mmのブ は約50mmで、 ロックをつかめない

27.

03.論文1:CLAP(吸着はVLAに取り込まれているが、空白がある) 「既存研究は吸着で何を拾えるかを示した。本研究は正確に置けるかを問う」 既存研究 VacuumVLA:吸着を二値フ ラグとして扱う。GVLA: 交換可能なグリッパ種別の 1つとして扱う 触覚VLAとの違い TacVLA・OmniVTLA などは 指や手首で接触の力学を測 る。吸着の失敗は「シール がない」ことで、真空圧 が直接示す [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation 報告されていないこと 計測した真空信号に条件づ けたポリシー、またその信 号で実行中の行動を中止す るポリシー

28.

03.論文1:CLAP(なぜ視覚では足りないか:カップと対象面が互いを隠す) 視覚で判断できない情報を、別のセンサで補う OCCLUSION 吸着の瞬間 吸着が成立したか否かは、 カメラからはほぼ判別でき ない 帰 結 ベースラインの状態欄には吸引の「指令」 吸着カップが、保持すべき面そのものを覆 い隠す が入るので、掴み損ねても「吸着中」と読 める [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation

29.

03.論文1:CLAP(中心アイデア:吸着状態を「観測できる」ようにする) 1つの圧力信号を、入力・融合・実行制御の3か所で使う 真空ラインのY字継手の行き止まり側に、数ドルのMEMS圧力センサを付けて静圧を測る ① 入力を変える 読み取った吸着状態を、固 有受容の「吸着コマンド」 と置き換える ② 特徴を混ぜる 圧力をクエリにして、視覚 トークンへのクロスアテン ションで融合する [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation ③ 実行を止める 吸引中に「保持なし」が続 いたら実行窓を打ち切り、 再推論させる

30.

03.論文1:CLAP( CLAPの全体構成:バックボーンは π0.5) 圧力は入力・融合・実行制御の3か所で使う 言語指示 カメラ ×2 第三者視点・手首(D435) 状態 s_t (7次元) 6関節+吸着状態 圧力 v_t MEMS真空センサ マルチモーダル融合 圧力をクエリに視覚トークンへ8ヘッドの クロスアテンション、ゲート付き残差で加算 π0.5 行動チャンク 50ステップを予測し 先頭25(0.83秒)を実行 VLM:PaliGemma 2B 行動エキスパート:Gemma 300M (flow matching) 閉ループ化:吸引中に「保持なし」が4ステップ続く → 残りを破棄 → 新しい観測から再推論 学習は公開済み π0.5 チェックポイントから全パラメータを微調整(出典:Fig. 2、Sec. III-B・IV-A) [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation

31.

03.論文1:CLAP(仕組み①:指令値ではなく、実測値をポリシーに入れる) 視覚は「何をしようとしているか」を、圧力は「うまくいったか」を知る s_t = (q_t, u_t), u_t = 指令 → 1 − h_t 7次元:q_t は6関節角/ベースラインは u_t に指令値、CLAPは 1 − h_t(h_t:シール成立なら1。保持=0の規約に合わせる) 従来:吸着コマンド CLAP:実測した吸着状態 収集時に置き換える 掴み損ねても状態は「吸引 中」のまま。持っていない ブロックを持っていると告 げられる ラインが実際にどうなったか を読む。指令と実態のずれを ポリシーが観測できる 学習時と配備時で意味が同じ になり、状態の次元も増えな い [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation

32.

03.論文1:CLAP(仕組み②:圧力のデコードと、クロスアテンションによる 融合) 単純に連結すると数百の視覚トークンの中の1入力に埋もれる(連結は −10.00pt) デコード(Arduino・閾値2つ) 状態 センサ電圧 sealed(保持) v < 0.01 V leaking(漏れ) 0.01 ≤ v < 0.22 V open(開放) v ≥ 0.22 V ポリシーには二値 h_t=[sealed] を渡す。閾値 はタスク間で再調整していない(ポンプやカッ プを変えると変わる) 融合(クロスアテンション) p_t = W_p u_t + b_p ĝ_t = MHA(Q=p_t, K=V_t, V=V_t) Ṽ_t = V_t + α ĝ_t , α₀ = 0 8ヘッド。圧力がどの画像パッチを要約するか を選び、全視覚トークンに加える。α=0 から始め るので、学習初期は元の π0.5 と同じ計算 [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation

33.

03.論文1:CLAP(仕組み③:吸着の失敗で、開ループの実行窓を打ち切る) 中止が決めるのはタイミングだけ。回復動作は新しく推論したチャンクが決める 50ステップを予測 先頭25を実行(0.83秒) 吸引中に保持なし 4ステップ連続(0.13秒) その場で中止 残りの行動は破棄 再推論 新しい観測から 1つの仕組みで2つの失敗 N=4は物理から決定 回復は学習で 掴み損ねたまま運ぶ失敗と、 搬送中にシールが外れる失 敗の両方を拾う 成立するシールは1〜2ステ ップで成立。それを待ち切り、 チャンク全体は待たない長さ 中止後の動きはスクリプトで はなく、新しく推論したチャ ンクが生成する [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation

34.

03.論文1:CLAP(データ①:完成状態から分解し、時間を逆にたどる) 最も正確な姿勢が、精度が必要なデモの最後に来る 完成形を手で組む 最終姿勢を直接置く 実機で分解を記録 テレオペで取り外す 関節系列を反転 オフライン・シミュ不要 組み立てのデモ 正確な姿勢が最後に 2日 → 半日 14.6秒 → 0.5秒 P2のデモ収集時間(順方向 → 逆方向、同じエピ ソード数) 置く直前に位置合わせで迷う時間の中央値(1 個目。2個目は順方向26.4秒) 変換は q̃ _t = q_(T−t)。次の関節目標を絶対値で読むので符号の手修正は不要。吸着チャネルは把持と解放 が互いの逆なのでそのまま使う [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation

35.

03.論文1:CLAP(データ②:狙いを絞ったフェーズデモは学習フレームの 8.3%) 192本の短い区間(全エピソードの約1/4の長さ) 8.3% 192本の区間デモが学習フレーム全体 に占める割合 構成:タスクごとに64区間 ピック16+配置48。半分はカップを上面の中心に、半分は 縁まで外して付け、運搬中の傾きの補正を学ばせる 中止後の状態をカバー ピックは「カップが空でブロックが机上」から始まる。 掴み損ねた後と同じ状況なので、回復が学習済みになる フル軌道は常に逆順。机から拾う区間は順方向、積む区間はすべて逆順で記録(区間ごとに 方向を選ぶ) [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation

36.

03.論文1:CLAP(実験設定:実機 Unitree Z1・3タスク・各設定20試行) すべてのベースラインは同じデータ・同じ評価基準 項目 内容 ハード Unitree Z1+吸着ハンド、RealSense D435×2 (第三者視点・手首) タスク P1:1個をパッドへ/ P2:2段積み/ P4:2段×2列の2×2(ブロック80mm角) 条件 単色・多色 ×単一タスク・マルチタスク(1チェックポイント)。位置と向きは机上 全域でランダム 成功基準 1層目がはみ出さず5秒立ち、重なるべき角の最大距離が P2 20mm・P4 40mm以内 比較対象 ACT、Diffusion Policy、DP3、X-VLA、π0、π0.5 試行数 各設定20試行、表I・IIで計1,560試行 データ・学習 567軌道(逆順375+区間192)、196分、146,774フレーム。π0.5から全パラメータ、3 万ステップ [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation

37.

03.論文1:CLAP(結果:マルチタスクで平均成功率 96.67%(単色・多色とも) 成功率(%) 、 P1〜P4は単色。出典:Table I 手法(マルチタスク) P1 P2 P4 平均(単色) 平均(多色) X-VLA 80 85 75 80.00 86.67 π0 50 45 20 38.33 58.33 π0.5 75 75 60 70.00 80.00 CLAP 100 100 90 96.67 96.67 +16.67pt / +10.00pt 最強ベースライン X-VLA との差(単色 / 多色) 差は「到達」ではなく「仕上げ」 タスク特化型(ACT・DP・DP3)はP2・P4で0%。単 一タスクでもCLAPが最高(90.00% / 81.67%) [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation

38.

03.論文1:CLAP(精度:4ブロック積み(P4)で平均誤差 15.92 mm) マルチタスク・単色、成功試行の平均(出典:Table I) 配置誤差(mm、小さいほど良い) 20 測り方 18.74 17.78 15.92 15 10.72 10.47 10 8.42 5 0 X-VLA 重なるべき角の組の最大距離をノギスで計 測。完成した積みが角を隠すため画像では 測れない π0.5 P2 CLAP ばらつきも小さい 単一タスクP4の標準偏差:CLAP 3.35mm、 π0.5 10.12mm。ばらつきは次の段を載せた ときの崩れに直結 P4 [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation

39.

03.論文1:CLAP(アブレーション:4つの要素を外すと 5.00〜13.33pt 低下) マルチタスク・単色。出典:Table II(「圧力フィードバックなし」は中止機能も欠く) 設定 P1 P2 P4 平均 Δ 誤差P4 CLAP(フル) 100 100 90 96.67 0.00 15.92 実行中の中止なし 100 90 85 91.67 −5.00 18.48 融合を連結に変更 90 90 80 86.67 −10.00 17.78 圧力フィードバックなし 95 85 75 85.00 −11.67 18.04 フェーズデモなし 90 85 75 83.33 −13.33 20.35 全部なし(π0.5) 75 75 60 70.00 −26.67 18.74 低下は加算的でない(合計40.00 vs 全部なし26.67)。Fisher正確検定で有意:フェーズデモなし p=0.03、 π0.5 p<0.001(連結は p=0.09) [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation

40.

03.論文1:CLAP( CLAPの貢献を3行で) 結果:実機で平均成功率 96.67%、4ブロック積みで誤差 15.92 mm 1 観測:数ドルの圧力センサで、視覚では遮蔽される吸着状態を観測可能にした 2 制御:実測値を固有受容に入れ、クロスアテンションで視覚と融合し、失敗時 は実行窓を打ち切って再推論 3 データ:分解の逆再生と8.3%のフェーズデモで、精密配置と立て直しのデモを効 率よく作った [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation

41.

03.論文1:CLAP(論文1:強みと、著者が認める限界) 「ループが見るのは接触であって、進捗ではない」 強み(発表者の見解) 安価なセンサ1つで入力・融合・実行制御の3か 所を改善する簡潔な設計。1,560試行と検定まで 付けた実機評価 著者が認める限界 P4で遮蔽が強いと完了と誤認して早く止まる。 補正動作が置いたブロックを崩すことがある。 閾値は回路に依存。逆再生そのものの効果は未 分離 研究的な問い 力覚・触覚など他の内部状態でも「指令値を実測値に置き換え、イベントで実行窓を切る」は一般化で きるか [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation

42.

04.論文2 SEES:A Self-Evolving Embodied System via 失敗からボトルネックを見つけ、追加デモなしで自己進化 するVLA [2] SEES:A Self-Evolving Embodied System via

43.

04.論文2:SEES (論文2:基本情報) 出典:論文本文(arXiv v1 PDF)。以降の数値は Table 1〜7 および付録による 項目 内容 タイトル SEES: A Self-Evolving Embodied System via Failure-Guided VLA Policy Adaptation 著者 Ziwen Li, Hanlue Zhang, Zhenyang Ren, Tianyu Huang(筆頭4名は同等貢献) ほか計12名 所属 MBZUAI、シドニー大、オックスフォード大、AI2 Robotics、ウォータール ー大、メルボルン大 投稿 arXiv:2609.32698 (cs.RO)、2026年9月26日、本文10ページ+付録 評価 RoboCasa365・LIBERO(いずれもシミュレーション) 、バックボーン GR00T N1.5 / RLDX-1 [2] SEES:A Self-Evolving Embodied System via

44.

04.論文2:SEES (問題設定:短期タスクは得意、長期タスクは苦手) 1つの弱いスキルを直せば、多くのタスクが同時に良くなる 観察 原因の一つ VLAは多様な短期タスクで汎化 するが、多段の長期タスクで は信頼性が低い 多段のデモは高コストで、既 存データは短期の操作に偏っ ている 鍵となる洞察 少数の共有されたatomicスキル の弱さが、多くの長期タスク の失敗を引き起こす 問い:ロボットは、追加の専門家デモなしで、自らボトルネックを特定し改善できるか? [2] SEES:A Self-Evolving Embodied System via

45.

04.論文2:SEES (人が診断しデモを足す方式から、自動で回る方式へ) 訓練対象を失敗統計から選び、関連スキルで1つのアダプタを共有する 従来(人手による改善) SEES ボトルネックの特 定 改善のデータ 専門家が失敗を見て診断 atomic段ごとの失敗を自動集計 追加の専門家デモを収集 シミュレーションで状態を復元 し オンラインRL 報酬・成功判定 — LLMが成功判定関数を生成 配備後の運用 家庭に配備した商用ロボットで は非現実的 実行と進化のループを繰り返す RLinf-VLA・SimpleVLA-RL は「与えられたタスクと報酬」でRL。CORAL などはタスクごとに別 アダプタ。SEESは訓練対象を失敗統計から選び、アダプタを共有する [2] SEES:A Self-Evolving Embodied System via

46.

04.論文2:SEES ( SEESの全体像:実行と進化の2つのループ) 改善したアダプタだけを登録し、次の実行ラウンドへ戻る(RoboCasa365 では3ラウンド) EXECUTION(実行) 長期指示を分解 family方策で実行 VLMプランナ atomicタスクごと ボトルネック特定 終了ヘッドと失敗統計 EVOLUTION(進化) 状態を復元 過去に遭遇した状態 成功判定を生成 [2] SEES:A Self-Evolving Embodied System via LLM オンラインRL family adapterを更新 検証・登録 改善時のみ採用

47.

04.論文2:SEES (構成要素①:タスク分解とfamilyへのルーティング) 各タスクは自分の指示を持ちつつ、アダプタはfamilyで共有する 長期指示+初期画像 左・右・手首カメラ 凍結VLMプランナ Gemma 4 31B IT 63/64 プランナの計画が正解と完全一致 (98.44%、32タスク ×2初期状態) [2] SEES:A Self-Evolving Embodied System via 言語エージェント 11のfamilyに振り分け family方策 最新の登録アダプタで実行 11のskill family 開ける・閉める・家電操作・水栓・つかむ・容器に置く・ 面に置く・差し込む・並べる・注ぐ/すすぐ・ナビゲーシ ョン。アダプタがないfamilyはベースVLAで実行

48.

04.論文2:SEES (構成要素②:familyごとのLoRAアダプタ(行動ヘッドに付 ける) ) RoboCasa365:r=64・α=128 / LIBERO:r=8・α=8 W_f = W_0 + (α / r) · B_f · A_f W_0:凍結した重み/ A_f, B_f:family f のランク r の学習可能な因子/ α:スケール 忘却を防ぐ 視覚・言語のバックボーンと 他familyのアダプタは凍結し、 更新は当該アダプタのみ 正の転移 同じfamilyのタスクが1つのア ダプタを共有し、RLしていな いタスクにも効く [2] SEES:A Self-Evolving Embodied System via 一緒に保存 LoRAに加え、family固有の価値 ヘッド・終了ヘッドもチェッ クポイントに含める

49.

04.論文2:SEES (構成要素③:終了ヘッドでatomicタスクの完了を予測) 著者注:この監査は複合タスク成功率の向上までは示さない 仕組み 役割 行動トークン特徴に小さなヘッド(LayerNorm+ 512次元GELU)を付けヘッドだけ学習。確率0.95 以上が3ステップ続いたら完了とし、チャンクの 残りを捨てて次へ 完了したサブタスクを止める/失敗をどの段か に帰属させる/次のatomicタスクへ引き継ぐ 判定方法(100ロールアウト・243試 行) Macro-F1 誤成 功 時刻誤差 失敗帰属の正解 率 終了ヘッド(SEES) 94.0 3.3 10.8 92.0 VLM(Qwen3-VL-32B) 59.9 17.7 112.6 45.0 出典:Table 5(%、時刻誤差は制御ステップ) [2] SEES:A Self-Evolving Embodied System via

50.

04.論文2:SEES (ボトルネックの特定:最初に止まった段に失敗を数える) 1複合タスクにつき毎ラウンド1つ選び、予算を一番の原因に集中する b_c = argmax_(i ∈ A_c) F_(c,i) F_(c,i):複合タスク c の失敗のうち段 i に帰属したもの。継続を妨げた最初の段に割り当て、下流の段は数えない 例:Store_Leftovers_In_Bowl の失敗の帰属(Fig. 3) place_the_drumstick_in_bowl 46.8% navigate_to_fridge_with_bowl pick_up_bowl この1回の進化で 42.6% 10.6% [2] SEES:A Self-Evolving Embodied System via (+16pt) 対象段 56% → 72% 兄弟タスク 60.4% → 61.2% 複合タスク全体 6% → 10%

51.

04.論文2:SEES ( RLタスクの構築:状態を復元し、LLMに成功判定を書かせる) 報酬は初めて成功した時点だけ1。報酬整形や学習した報酬モデルは使わない 状態の復元 ボトルネック直前のシミュレータ状態と、家電 の状態やタイマーも復元。前段の再生は不要。 成功・失敗どちらの試行の状態も使う LLMによる成功判定 GPT-5.6-Sol が指示・物体の識別子・状態取得API の文書から Python 関数 C_i(s) を生成。3ステップ 連続で真なら成功 公式判定との一致(Atomic-Seen 900ロールア ウト) フレー ム バラン ス 再現 率 エピソード LLM生成の成功判定 97.8 98.2 96.4 95.9 18タスク中13でエピソード単位の判定が完全一致(Table 6、 %) [2] SEES:A Self-Evolving Embodied System via

52.

04.論文2:SEES (オンラインRL:PPOでアダプタを更新し、改善時のみ登録) RoboCasa365 では全ラウンドで改善するチェックポイントが見つかった PPO(RLinf上) family単位のサンプリング チェックポイント選択 flow系はデノイジング遷移の尤 度を使う。32並列環境・2GPU、 familyごと40ステップ、クリップ 0.2、 γ=0.99 今回と過去のボトルネックを プールに入れる。重みは有効 な初期状態の数で決め、選ば れてからのラウンドごとに半 減。毎回新しく収集 10・20・30・40ステップ目と 更新前を、各ボトルネック5状 態 ×5回で検証。改善が最大で 正のものだけ登録 Composite-Unseen は適応にもチェックポイント選択にも使わない(純粋な評価用) [2] SEES:A Self-Evolving Embodied System via

53.

04.論文2:SEES (実験設定:2つのバックボーン × 2つのベンチマーク) LIBEROは分解・終了ヘッドを使わず、適応の仕組みだけを予算を絞って検証 RoboCasa365 LIBERO 評価タスク Atomic 18 / Composite-Seen 16 / Composite- Object・Spatial・Goal・Long 各10タスク (1スイート=1 family) Unseen 16 バックボーン GR00T N1.5、RLDX-1(Human300でSFT:65 atomic+235複合、各100デモ) GR00T N1.5 (RLinf公開のスイート別SFT チェックポイント) 進化の予算 複合タスクごと50ロールアウト、familyごと 40 PPOステップ、3ラウンド 3ラウンド合計 80〜96 PPOステップ、1ラ ウンド最大3タスク追加 評価 RoboCasa365 原論文と同じ設定 未使用の15初期状態 ×5シード=タス クあたり75試行 [2] SEES:A Self-Evolving Embodied System via

54.

04.論文2:SEES (結果①:RoboCasa365 —複合タスクはラウンドごとに改善) 成功率(%)。出典:Table 1 Composite-Seen 25 23 21 19 17 15 13 11 9 7 20.4 19.9 20.4 21.8 17.6 10.2 9.5 5 ベース 実行のみ 10.4 1R GR00T N1.5 11.3 2R RLDX-1 13.1 3R 設定 Atomic Seen Unseen GR00T ベース 47.2 10.2 3.5 GR00T 3R後 55.7 13.1 6.1 RLDX-1 ベース 66.4 20.4 6.0 RLDX-1 3R後 70.3 21.8 7.1 「実行のみ」で一時低下する理由 分解したサブタスクの多くが事前学習データに 単独では存在しない ベース比:GR00T +8.5 / +2.9 / +2.6 pt、RLDX-1 +3.9 / +1.4 / +1.1 pt。参考:π0.5 は 39.6 / 7.1 / 1.2 (RoboCasa365原論文の値) [2] SEES:A Self-Evolving Embodied System via

55.

04.論文2:SEES (結果②:LIBERO — RLしていない兄弟タスクも向上) 成功率(%)。出典:Table 2。兄弟タスク=PPOに一度も参加していないタスク スイート 全体(前 → 後) ボトルネック(前 → 後) 兄弟タスク(前 → 後) Object 66.13 → 86.00 59.24 → 82.86 82.22 → 93.33 Spatial 41.33 → 50.53 40.44 → 49.78 49.33 → 57.33 Goal 43.73 → 59.47 39.11 → 56.15 85.33 → 89.33 Long 61.20 → 65.60 58.22 → 62.96 88.00 → 89.33 4スイート平均 53.10 → 65.40 — — 全体の改善:Object +19.87 / Spatial +9.20 / Goal +15.74 / Long +4.40 pt、平均 +12.3 pt。Objectでは10タスクす べてが向上し、未選択の3タスクも +5.33〜+20.00pt (Table 7) [2] SEES:A Self-Evolving Embodied System via

56.

04.論文2:SEES (アブレーション①:familyで共有するか、atomicごとに分ける か) 関連する pick-and-place 5タスク(ボトルネック3・兄弟2)、アダプタあたり40ステップ atomic専用 成功率(%) ボトルネック +8.0pt だが、兄弟タス クは平均 −3.0pt(転移なし) 90 85 80.0 80 74.0 75 76.4 75.0 72.0 70.7 70 65 71.2 67.6 62.7 family共有 60 ボトルネック +11.3pt、兄弟 +5.0pt、 全体 +8.8pt 55 50 ボトルネック RL前 兄弟タスクatomic 専用LoRA 全体 family共有LoRA 出典:Table 3。差分はRL前からの値で、表から計算 [2] SEES:A Self-Evolving Embodied System via

57.

04.論文2:SEES (アブレーション②:何を訓練するかの選び方で結果は大 きく変わる) ScrubCuttingBoard、未使用の50シーン、2ラウンド・各40 PPOステップの同一予算(出典:Table 4) 80 70 64% 60 50 40 28% 30 20 34% 18% 10 0 選び方 1R目 2R目 成功率 ベース方策 — — 18%(9/50) ランダム Release Navigate 28%(14/50) 成功率最高 の段 Pick up Release 34%(17/50) ボトルネッ ク Scrub Navigate 64%(32/50) SEESのボトルネックは更新後に Scrub から Navigate へ移った。1つの複合タスク・50試行での比較のため、 一般化には注意 [2] SEES:A Self-Evolving Embodied System via

58.

04.論文2:SEES (限界と今後:実世界への展開が最大の課題) 左は本文に書かれている制約、右は著者が示す今後の方向 本文に書かれている制約 • 進化には状態を再現できる対話的シミ ュレータが必要 • 全評価がシミュレーション。実機で一 連のループを回す評価は今後 • 分解を入れた直後は Composite-Seen が 一時的に低下 • 終了ヘッドの監査は、複合タスク成功 率の向上までは示さない [2] SEES:A Self-Evolving Embodied System via 著者が示す今後の方向 • 実画像から環境を再構成する手法 (URDFormer、ACDC、 SplatSim など) でシミュレータを作る • ボトルネックに関係する物体と相互作 用だけ再構成すれば足りる • バックボーンは凍結なので、候補アダ プタを実機で事前確認してから再利用 できる

59.

04.論文2:SEES (論文2:強みと注意点(発表者の見解) ) 仕組みの完成度は高いが、実用レベルの絶対性能には距離がある 強み どこを・どの報酬で・いつ訓練するかまで 自動化し、 2つのバックボーンで一貫して 改善。終了ヘッド・成功判定・選択方法・ アダプタ共有をそれぞれ対照実験で検証 注意点 複合タスクの絶対成功率は依然低い RLDX-1 21.8%) 。Unseen (GR00T 13.1%、 の改善は1〜3pt程度。LLMの成功判定は18 タスク中5タスクでエピソード判定が公式 と一部ずれる 研究的な問い 実機の失敗ログから、どこまで忠実なRL環境を自動で作れるか。成功判定の誤りがRLにど う影響するか [2] SEES:A Self-Evolving Embodied System via

60.

05.まとめ 2論文の位置づけやまとめ

61.

05.まとめ (論文1まとめ:CLAP の貢献) Closed-Loop Alignment with Pressure for Precise Suction Manipulation 1 吸着状態を観測できるようにした1 数ドルのMEMS圧力センサを真空ラインに付け、カメラでは遮蔽される成否を読む 2 指令値を実測値に置き換え、視覚と融合2 固有受容の吸着欄に実測値、圧力をクエリにしたクロスアテンション 3 失敗で実行窓を打ち切る閉ループ 3 「保持なし」4ステップで中止し、新しい観測から再推論 4 逆再生デモと8.3%の区間デモ 4 精度の要る場面を正確に、中止後の状態もカバー 5 実機で平均96.67%、 4ブロック積みで15.92mm 4つのアブレーションはいずれも 5.00〜13.33pt 低下 [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation

62.

05.まとめ (論文2まとめ:SEES の貢献) A Self-Evolving Embodied System via Failure-Guided VLA Policy Adaptation 1 失敗の統計でボトルネックを自動で特定 終了ヘッドで段を区切り、最初に止まった段に失敗を帰属(帰属正解率92.0%) 2 RLタスクを自動で構築2 直前の状態を復元し、LLMが成功判定を生成(公式判定と95.9%一致) 3 familyで共有するLoRAで転移 PPOに参加していない兄弟タスクも全LIBEROスイートで向上 4 2つのバックボーンで改善 GR00T N1.5・RLDX-1 とも3ラウンドで向上、Composite-Unseen も改善 5 訓練対象の選び方が効く ボトルネック選択で64%、ランダム28%・得意な段34% [2] SEES:A Self-Evolving Embodied System via

63.

05.まとめ ( 2本の論文はVLAの問題点にどう答えるか) Part 2 で挙げた問題点との対応 問題点 CLAP(論文1) SEES(論文2) ①長期タスク — 失敗の多いatomicスキルを特定して集中的に改 善 ②データ 逆再生と少量(8.3%)のフェーズデモで収集を 効率化 追加の専門家デモなしにシミュレーションRLで 改善 ③知覚の欠落 真空圧で吸着状態を観測可能にする — ④開ループ実行 圧力イベントで実行窓を打ち切り再推論 終了ヘッドでサブタスクの切り替えを判断 ⑤精度 4ブロック積みで平均誤差15.92 mm — ⑥汎化 — 進化に使っていない Composite-Unseen も改善 ⑧評価 実機のみ(Unitree Z1) シミュレーションのみ、実機は今後 ⑦計算と安全はどちらも主題外。CLAPは制御ループの中で、SEESは学習ループの中で、失敗を検知して次に 生かす [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation [2] SEES:A Self-Evolving Embodied System via

64.

05.まとめ (統合メッセージ:2論文から見える VLA の次の課題) [VLA の次の課題は「失敗を見て、直す」こと。制御ループでも学習ループでも] 論文1から 観測を1つ足すだけで閉ループになる。カメラに見えない接触の成否を、安価なセン サで直接読み、その場で動きを止めて考え直す。 論文2から 失敗の統計が、限られた訓練予算の使い道を教えてくれる。弱いスキルを選んで鍛 え、関連スキルにも効かせる。 統合して 0.13秒の制御ループと、ラウンド単位の学習ループ。両方で失敗を観測し戻す設計 が、実用のVLAに必要になる(発表者の見解)。 [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation [2] SEES:A Self-Evolving Embodied System via

65.

ご清聴ありがとうございました

66.

Reference [1]CLAP: Closed-Loop Alignment with Pressure for Precise Suction Manipulation [2] SEES:A Self-Evolving Embodied System via 1 03 04