---
title: 松尾研LLMコミュニティLLMATCH S4成果発表会_小野塚_荘一
tags:  #llmatch  
author: [松尾研LLMコミュニティ](https://docswell.com/user/matsuo-lab_llm)
site: [Docswell](https://www.docswell.com/)
thumbnail: https://bcdn.docswell.com/page/VENYPZZ3J8.jpg?width=480
description: ■ 2026/9/16(金)開催 LLMATCH [Season4] 成果発表会 2026年4月にスタートしたSeason4では、約6ヶ月にわたり58名の学生がLLMの研究開発に挑戦し、最先端の技術に取り組んできました。2026/9/16(金)にオンラインにて、 &quot;LLMATCH [Season4]&quot; の成果発表会を行いました。  ▼発表内容：発表者(3名) 1. GNN評価のための引用ネットワークにおける視覚的類似性と構造的集約：小野塚　荘一さん（WI-IAT 2026 採択者） 2. BabyLMにおける再帰的Transformerの可能性とマルチモーダル学習の壁：堀田 大智さん（EMNLP 2026 Workshop（BabyLM） 採択者） 3.Graph RAGにおける研究成果の報告：清 恵人さん (AACL-IJCNLP 2026 採択)  ▼アーカイブ動画はこちら https://youtu.be/G1-Z9ljJtwc  ---- ■ LLMATCHとは 「LLMATCH」という名称は、&quot;Large Language Model Advanced Training &amp; Challenging Hub&quot; に由来し、学生の皆さんが持つLLM（大規模言語モデル）に関するアイデアを、研究として発展させることを目的としたプログラムです。 本プログラムでは、東京大学 松尾・岩澤研究室の研究員が、最大1年を目安に、参加者一人ひとりの関心やスキルに応じて、次のキャリアや挑戦につながる支援を行っています。 また、研究メンバーの活動を支える「アシスタント」ポジションも設けており、学生・社会人を問わず、コミュニティの一員として研究の進行をサポートしてくださる方を広く募集しています。  ■ LLMATCH仮応募について LLMATCHにご関心のある方や、次期プログラムへの参加を検討されている方向けに、2027年4月スタート予定のSeason6に向けた「仮登録」の受付を開始しております。 正式な募集開始時に優先的にご案内をお送りいたしますので、ぜひお気軽にご登録ください。  ▼ 仮登録フォームはこちら https://forms.gle/qKvLoobRdip5pzKi9
published: October 01, 26
canonical: https://docswell.com/s/matsuo-lab_llm/ZGN4WM-LLMATCHS4-onozukasoichi
---
# Page. 1

![Page Image](https://bcdn.docswell.com/page/VENYPZZ3J8.jpg)



# Page. 2

![Page Image](https://bcdn.docswell.com/page/Y79P3ZZPE3.jpg)

Web Intelligence and Intelligent Agent Technology (WI-IAT) 2026 ショートペーパー
審査官引用ネットワークにおける視覚的類似と
構造集約
Visual Similarity and Structural Aggregation in Examiner-Citation Networks for
GNN Evaluation
米国の意匠特許に審査官が付ける引用で、
GNN の前提を検証する
小野塚 荘一 (立教大学) 小橋 洋平 (東京大学) 大西 立顕 (立教大学) 松尾 豊 (東京大学)


# Page. 3

![Page Image](https://bcdn.docswell.com/page/G78DM11X7D.jpg)

対象：
⽶国の意匠特許
審査官が設定する
先⾏意匠の引⽤
論⽂の主張：
構造的集約は、
予測精度を下げる。
問い 1
意匠特許は、
何によって引⽤されるのか
問い 2
引⽤の構造は、
画像やテキストの
特徴量を超えるのか
•
•
意匠特許の図面の例
米国意匠特許 48,160。出典: ウィキペディア「意匠特許」（パブリックドメイン）


# Page. 4

![Page Image](https://bcdn.docswell.com/page/L7LM3QQNJR.jpg)

データ ̶ IMPACT データセットと、そこから作る共引用グラフ
元データ
引用
IMPACT: 意匠特許の公開データセット
審査官引用は USPTO API から取得
米国の意匠特許 2007‒2022 年
図面 3,609,805 枚
IMPACT の識別子で問い合わせる
公開メタデータは 434,497 件
ページ画像 3,030,160 枚
両方がこの母集団にあるペアだけ残す
クラス・メタデータ付き
435,101
対象の意匠公報数（2007‒2022）
共引用ペア
引用する特許
一緒に引用された 2 件を結ぶ辺
同一クラスが 89.6 %（385,617 ペア）
430,570
審査官引用ペア数
ターゲット:
3,496,959
共引用ペア数
この共引用グラフの最大連結成分。被引用
211,393 件のうち 203,488 件（96.3 %）、引用する特許
49,563 件、22.6 % がクラスをまたぐ。
H. H. Shomee, Z. Wang, S. Medya, and S. N. Ravi, “IMPACT: A Large-scale Integrated Multimodal Patent Analysis and Creation Dataset for Design Patents,” 2024.


# Page. 5

![Page Image](https://bcdn.docswell.com/page/4EMYD11QEW.jpg)

同じ企業から似たデザインが集中している
2


# Page. 6

![Page Image](https://bcdn.docswell.com/page/PER94LLKJ9.jpg)

引用は、既存の引用数(次数k)に強く依存する
• 大多数の意匠特許は次数が小さく、
一部の特許だけが数百件の
引用に関わっている
CCDF:complementary cumulative
distribution function
相補累積分布関数
次数が ! k 以上の特許が、
全体の何割あるか


# Page. 7

![Page Image](https://bcdn.docswell.com/page/P7XQ2WW5EX.jpg)

Graph Neural Network(GNN)による実験
[視覚的特徴]
[企業情報]
[製品カテゴリ情報]
既に⾮常に強⼒なシグナル
これら強⼒な特徴量が存在する上で、
GNNによるグラフ構造の集約 (Aggregation) は
本当に予測⼒を向上させるのか︖
Task Definition
• Task:審査官が引⽤した特許の集まりから1件を隠し、その特許を当てる
• Goal:同じ意匠分類の約1万件の候補の中で、隠した特許を上位に順位付けする(引⽤された特許を1件ずつ隠して繰り返す)
• Metric:平均逆順位(MRR)。正解が⼊った順位の逆数の平均


# Page. 8

![Page Image](https://bcdn.docswell.com/page/37K9MVVR7D.jpg)

⽅法: グラフ縮約 (Graph Contraction)
Uncontracted / 縮約前
Contracted / 縮約後
Group Node
(Company A)
Company A
Variant 1
Company X
Company A
Variant 1
Company A
Variant 2
Company X
Company A
Variant 2
Company A
Variant 3
Company A
Variant 3
問題点: GNNが同⼀企業のほぼ同⼀の
バリエーションを繰り返し集約してしまう。
解決策: 同⼀企業の閉じた三⾓形を1つのグループ
ノードに結合 (グラフ全体の 26.18% の特許を統合)。
GNNが「構造」ではなく単なる「類似データのコピー」を
学習するのを防ぐ厳密な制約。


# Page. 9

![Page Image](https://bcdn.docswell.com/page/LJ3WYMMGJ5.jpg)

学習とテスト
4
処理の中身は同じ。違うのは候補の集め方だけ
学習
候補 101 件
手がかり
引用する
特許
隠す
1件
被引用集合
表現を作る
アンカー ＋ 近傍 最大 K 本
MRR = 順位の逆数の平均
1 位なら 1、10 位なら 0.1
softmax → 損失 → 更新
テスト
候補は隠した 1 件と負例 100 件
負例は更新のたびに引き直す
順位 → テスト MRR
隠した 1 件の順位を数える
表現は 1 度だけ作る
同一クラス候補プール
中央値 10,496 件


# Page. 10

![Page Image](https://bcdn.docswell.com/page/8JDK566NEG.jpg)

特徴量条件の⽐較マトリックス
次元数
コンポーネント
Multimodal
Text
Image (The Champion)
289-d
289-d
2,048-d
画像block (128-d)
会社名block (128-d)
製品クラスblock(33-d)
画像blockは0を設定
会社名block (128-d)
製品クラスblock(33-d)
画像埋め込み全体を使⽤
画像、テキスト埋め込みモデル
Qwen3-VL-Embedding-2B


# Page. 11

![Page Image](https://bcdn.docswell.com/page/VEPKGYYN78.jpg)

結果 ̶ 近傍を読むと下がる。最も高いのは K = 0
5
画像条件:
全点で K = 0 を下回る
集約:
K = 0 を超えた点は無い
縮約:
K = 0 で 3 条件とも上
凡例: Image = 画像、Multimodal = マルチ、Text = テキスト、contracted = 縮約あり
結論:
この設定では、構造集約は特徴量の連結を超えなかった。
条件の間: 画像 ＞ マルチ


# Page. 12

![Page Image](https://bcdn.docswell.com/page/27VV6GGY7Q.jpg)

⼈が作った引⽤のネットワークでは、構造の集約より特徴が効いた。
分かったこと
①
審査官の引⽤は、視覚的に似ている
⾮接続ペアより⾼い AUC 0.893 / 0.759
②
似ているのは、企業の中に集中している
同⼀企業・同⼀製品の三⾓形で 0.916
③
引⽤は、すでに引⽤された意匠に積み上がる
引⽤が多いほど次も引かれる 偏り無し 1 に対し 1.445
④
近傍を集約しても、上がらない
最も⾼いのは K = 0 画像条件で 0.0753
応用への示唆 ̶ 先行意匠の検索
候補は絞り込める
10,496 件から中央値 94 位
最終判断は人が行う
1 位に来るのは 2.29 %
今後の研究の方向性
特徴の側を伸ばす
画像だけで最も高かった
基準は K = 0 に置く
集約の利得はここと比べる


# Page. 13

![Page Image](https://bcdn.docswell.com/page/5JGLN88W7L.jpg)

制約 ̶ この結果が言える範囲
データと測り方
図面
企業名
引用する特許
特許ごとに 1 枚だけ
正規化は近似である
記録からしか分からない
透視図、無ければ正面図
誤記・略称・親子会社は併合しない
審査の書類は見ていない
目視の照合は D18 の 150 ペア
縮約は残る誤りを引き継ぐ
被引用数はクラス内だけ
予算
集約の範囲
条件の間
事前登録から削った
1-hop の 1 段だけ
単因子の比較ではない
シード 5 → 3、探索 30 → 12 試行
モデルは 1 種類のみ
K &gt; 0 ではエッジ属性も違う
エポック上限 100 → 40
深い探索は試していない
探索はセルごとで共有しない
結果を見る前に決めた
K = 1 は画像条件で未実行
外部手法とは比べていない
手続きとモデル


