---
title: 2026文化祭 公開用スライド
tags: 
author: [洛星中学・高校ロボット研究部(RRSC)@公式](https://docswell.com/user/Rakusei_Robot)
site: [Docswell](https://www.docswell.com/)
thumbnail: https://bcdn.docswell.com/page/LE1Y5DL47G.jpg?width=480
description: 2026文化祭 公開用スライド by 洛星中学・高校ロボット研究部(RRSC)@公式
published: September 27, 26
canonical: https://docswell.com/s/Rakusei_Robot/5PR39Q-2026-09-27-112317
---
# Page. 1

![Page Image](https://bcdn.docswell.com/page/LE1Y5DL47G.jpg)

ロボ研 広報キャラクター！
音声ガイドでは私たちがご案内します！
乃木須 創愛（のぎす そあ）
17才(高校2年)
モノづくりが大好きな研究部員。
勿論推しの工具は「ノギス」
大きなポケットにはノギスは勿論、いろんな道具が入っていると
か....
衣笠 明星（きぬがさ あかり）
15才(中学3年)
最近モノづくりに興味を持ち始めた中学生。
乃木須とは先輩-後輩の関係である。
ロボットに関する知識はまだ普通の一般人と同等。
実はブレザーの色は洛星のシャツの色と同じ。


# Page. 2

![Page Image](https://bcdn.docswell.com/page/GEWG5YVZJ2.jpg)

1. はじめに


# Page. 3

![Page Image](https://bcdn.docswell.com/page/47ZLNX4LJ3.jpg)

00
AI
音声ガイド
01
Artificial intelligence(人工知能)
目覚ましいAIの発展
近頃、「AI」（＝人工知能）にまつわる話題は尽きることが無
い。
ChatGPTやGeminiに代表される大規模言語モデルを初めと
し、AIはもはや、人々が生活で欠かすことのできないインフラに
なりつつある。
本年度弊部の展示「AI」は、AIが発展してきた経緯、歴史、そ
の仕組みを来場者の皆様に分かりやすく伝えることを目的とし
ている。
さらに、こうした現状を踏まえ、AIが今後どのように発展してい
くのか予測も立てていく。
現在隆盛を誇るAI(後述するLLMに分類される)の数々。
左からChatGPT, Gemini, Grok, Claude
AIの定義
そもそもAIとは一体何を意味する言葉なのだろう？
実は、「AIの定義」とはとても曖昧なものである。
日本の各省庁の文書でも、「AIには未だ確立された定義は
存在しない」とお決まりのように書かれている。
定義が明確でないため、1997年、チェスのAIとして開発された
「Deep blue」もただの総当たり探索(*後述）であり、AIとするには適切
でない、という指摘も出ている。
このように「AI(人工知能)」の定義、ひいては「知性」そのものの定義
もとても曖昧である。
計算機科学者「ラリー・テスラー(Lally Tesler)」は皮肉の効いた次の
言葉を遺している。
“Intelligence is whatever machine haven’t done yet.”
(知性とは、機械がまだ成し遂げていないことだ）
↑Deep Blueに使われたコンピュータの一部
↑ Lally Tesler


# Page. 4

![Page Image](https://bcdn.docswell.com/page/YJ6W843MJV.jpg)

2. AIの歴史


# Page. 5

![Page Image](https://bcdn.docswell.com/page/GJ5M9QLQJ4.jpg)

01
AIのはじまり
音声ガイド
「思考」を外部化する！
02
コンピューターの成立
人類は、水車、風車、あるいは牛、馬などを用いて運動を外部
化してきた。 しかし「思考」、考えることだけは長らく人類だけの専
売特許であった。 あるいは人類はそれで困っていなかったのかも
しれない。考えている暇があれば、その代わりに汗水垂らして働
いたほうが効率がいい。
ただし、人類は人類以外に出来る肉体労働を次々と外部化して
いった。ついに「思考」そのものがボトルネックとなり、人類の進歩
の足を引っ張る段階になってしまったのだ。
ここに思考を外部化するモチベーションが発生し、後に「コン
ピュータ」の成立に至るのである。
解析機関の一部（2.4メートルある）
解析機関の構造
(設計全体では 5m超、5tになるとも
言われている
発展の歴史：機械式計算機～解析機関
1623年、ドイツの学者シッカートにより、天文学の計算向けに
「Calculating Clock(計算時計)」と呼ばれる機械式計算機が作られ
た。これは歯車など機械的な部品のみによって作られている。この
時代にこれが作れるようになったのは、精密な工業技術を必要とす
る「時計」技術の発展によるところが大きい。
シッカートにより作られた機械式計算機
19世紀、天文学や航海などのために、大量の数表が必要になっ
ていた。イギリスの数学者バベッジはこうした作業のための「階差機
関」というものを作っていた。しかし、特定の計算に特化した機械で
はなく、「機械に計算手順を与えることができるのでは」という発想に
至る。ここにプログラミングの始まりがある。バベッジはパンチカード
を用いて計算内容を指示することのできる「解析機関」を設計した。
ただ、その巨大さや費用に需要が追いつかず、資金を集めることが
できなかったため、完全な完成には至らなかった。
上図参照：解析機関


# Page. 6

![Page Image](https://bcdn.docswell.com/page/LE3WYVLZE5.jpg)

02
古典的アルゴリズムと第一次 AIブーム
音声ガイド
原初のAI
03
アルゴリズムとは？
解析機関が考案されてから約100年後、20世紀半ば。第二次世界大
戦の最中、軍事的に膨大な計算需要が発生し、電子計算機の開発が加
速した。それと同時に、電子計算機(=コンピュータ)で動かすプログラム、
ないしはアルゴリズムについての研究が盛んになった。「アルゴリズム」と
は、問題を解決したりするための明確な手順書のことである。
古代ギリシャのユークリッドの互除法から、昨今のLLMまで全てはアル
ゴリズムと言える。こうした明確な手順書はコンピュータに与える指示とし
て非常に有用であったのだ。
右は叩いて被ってジャンケンポンのアルゴリズム風に記述したもので
ある。ぜひご一読あれ。
第一次AIブーム
1956年のダートマス会議で「Artificial Intelligence（人工知能）」とい
う言葉が初めて掲げられた。機械によって知能を実現することが一つ
の研究分野としてまとめられたこの出来事は、当時のAI分野の発展
を象徴している。
第一次AIブームでは、推論や探索を使って問題を解く研究が盛ん
になった。ルールや条件があらかじめ明確で、人間が全ての場合を
想定できるパズルなどの問題には強い一方、現実世界の扱う情報や
例外が膨大な問題には対応できなかった。
研究用に単純化されたこうした課題は「toy problem」とも呼ばれ
た。限られた問題での成功を、そのまま人間のような幅広い知能へ広
げることは難しいと分かり、1970年代にはAIへの期待や研究投資が
縮小。第一次AIブームは終息していった。
↑叩いて被ってじゃんけんポンのアルゴリズムを示す図。
フローチャートと呼ばれる形式に従っている。
当時の会話AI「ELIZA」のチャット例（実際
は英語だった）
ELIZAは事前に決めら
れたルールに従って
応答を返していた。
「彼氏」という
単語に反応
→


# Page. 7

![Page Image](https://bcdn.docswell.com/page/8EDK58N47G.jpg)

03
コラム：古典的アルゴリズム
音声ガイド
今日もゴリゴリ現役！
03
探索アルゴリズム
第一次AIブームを支えた中心的な技術が探索アルゴリズムだ。これ
は、あり得る選択肢を規則に従って順番に確認して行き、目的の状態
や解にたどり着くための計算手順だ。
基本的な探索アルゴリズムに、幅優先探索（BFS）及び、深さ優先
探索（DFS）がある。この二つは単純で古くからあるものだが、現在で
も広く使われている探索アルゴリズムの多くは、幅優先探索・深さ優先
探索を土台として、探索する問題の性質に合わせて調整したものなの
だ。
例えばGoogleマップなどの経路探索は幅優先探索をもとにした「ダ
イクストラ法」というアルゴリズムである。またパソコンのフォルダを探
索し目的のファイルを探すプログラムには深さ優先探索が用いられて
いる。
↑ Googleマップによる経路探索。様々な交通手段を探索し、優先順位に従っ
て結果を表示している。
探索アルゴリズム体験体験
「迷路探索」と「ハノイの塔」の２つについて、DFSとBFSを用いた探
索デモを用意した。２つのデモはボタンにより切り替え可能である。
「迷路探索」ではスタートからゴールへと移動できる道筋を見つけるこ
と、「ハノイの塔」では全ての円盤が大きい順に下から指定位置に積
みあがることが目標である。
以下の点に注目して見ると面白いだろう。
・幅優先探索 (BFS)は必ず最短の方法 (経路)を見つけられる
・深さ優先探索は (DFS)は一時的に覚えておく状態（デモでは赤～
白になっているマス及び状態）の個数が少ない
（これは深さ優先探索の非常に重要な特徴だ。数独などは幅優先探
索を用いて解くと膨大な数の状態を記憶しておかなければならなくな
るが、深さ優先探索では現在の状態のみ存在すれば規則的に次試
すべき状態が分かる）
↑ ハノイの塔のルール。デモではランダムな配置で開始する4枚の円盤による
ハノイの塔を解いている。（画像：ハナヤマ）


# Page. 8

![Page Image](https://bcdn.docswell.com/page/V7PKG85VJ8.jpg)

04
計算機技術の発展
音声ガイド
コンピュータの普及
04
第一次AIブームから第二次AIブームの間に
1960年代に第一次AIブームが徐々に廃れた後の1970年代、ICの集
積度が急激に向上し、小さな機械にコンピュータとしての機能を収めるこ
とができるようになっていった。
1975年には、マイクロプロセッサを搭載した組み立て式コンピュータ
「Altair 8800」が発売され、コンピュータの小型化・低価格化が急速に進
んでいった。
こうしたハードウェアの発達によって、より多くの研究者や企業が高い
計算能力を利用できるようになった。1980年代には、この計算機環境を
土台としてAI研究の実用化が進み、第二次AIブームへとつながってい
く。
↑Altair8800（左）と、使用されたMPUであるintel8800（右）
電子計算機の商業的成功
半導体技術の進歩によってコンピュータが小型・低価格化すると、そ
れまで研究や業務が中心だった用途は一般家庭にも広がっていった。
その象徴的な例の一つが、1983年に任天堂が発売した「ファミリーコ
ンピュータ」である。CPUや画像処理用ICを搭載しながら家庭向けの
商品として大量に販売され、海外版を含め6000万台以上を売り上げ
た。
こうしてPCやゲーム機などの巨大な民生市場が成立すると、今度は
その市場が半導体産業への投資や大量生産、企業間競争を支えるよ
うになった。技術の進歩が市場を生み、その市場がさらに技術の進歩
を加速する循環が生まれたのである。
↑任天堂ファミリーコンピュータ（画像：任天堂）


# Page. 9

![Page Image](https://bcdn.docswell.com/page/2JVV6NPRJQ.jpg)

05
第二次AIブーム
音声ガイド
ルールベースのエキスパートシステム
04
第二次AIブーム
1980年代からAI研究が大きく盛り上がった。これが第二次AIブー
ムである。
ここで特に注目されたのがエキスパートシステムだ。このシステム
を簡単に説明すると「AならばBと判断するというルールをたくさん組
み合わせ、専門家の判断を再現する」というものである。
この技術により、地下から鉱物を見つける「PROSPECTOR (プロ
スペクター)」や、病気を診断しできる「MYCIN(マイシン)」などのAIが
実現された。AI技術の開発が実を結び、実用に足る能力を持った瞬
間である。
↑ MYCIN（マイシン）の基本的な仕組み
与えられたルールを繰り返し用いながら、推論のようにし
て結論を導いていた。
ブームの終焉
第二次AIブームは1990年代初頭に収束していった。エキスパート
システムなどの技術自体はかなり実用化されていたが、期待や投
資が次第に縮小していったのだ。
これには次のような原因があるとされている。
・知識を入れるのが大変
専門家があらゆる状況を想定し、知見をまとめ上げてルール集合
にする必要があったが、これが非常に高コストだった。
・保守コストの肥大化
膨大な数のルールになると、一部のルール変更が他のルールと矛
盾を引き起こすなどが起き、維持管理が難しかった。
・汎用化の失敗
専門家の知見を入れるコスト、保守コストのせいで、膨大な数の
ルールを扱う汎用的なAIは出来なかった。
↑ Symbolics 3620
第二次AIブームの間、LISPというプログラミング言語が、大量の専門知識を
扱う当時のAIスタイルと合致したことで流行し、LISPが高速に動作する専用
機までも作られた。これはそのうちの一つである。
（画像：Leigh Klotz）


# Page. 10

![Page Image](https://bcdn.docswell.com/page/5EGLNKP6JL.jpg)

06
膨大なデータに基づいた予測
音声ガイド
回帰分析
05
回帰分析とは
1）回帰分析とは
コンピュータが進化し膨大なデータを扱えるようになったため、たくさ
んのデータを使った分析ができるようになった。回帰分析はその分析
の手法の一つである。回帰分析を用いると、要因が結果に与える影
響を可視化し分かりやすくすることができる。これは現代でも広く用い
られる超重要技術である。
2）回帰分析のやり方(単回帰分析、最小二乗法）
①集めたデータをグラフ上に点で打つ
②その点の数値との差の二乗の総和が最も小さくなるような直線（回
帰直線）を引く
③さらなる分析も可能（相関係数、信頼区間、etc…）
https://www.salesanalytics.co.jp/column/no00163/
回帰分析ってなんの意味があるの？
1）回帰分析の使用例
自分の営業する店に何個客席を用意するかを考える。
客席の量と年間売上の関係を調べるため、複数店舗での年間売上と客席
のデータを入手し、[横軸：客席の数 縦軸：売り上げ]でグラフを書き回帰直
線を引く。
例では、雑に客席が20増えるごとに売上は約3000万上がると予測でき
る。また、点が線に近いことから、この回帰分析の信憑性は高い(=客席数と
売上の関係が濃い)と言える。
2）回帰分析の意味
前述の分析によって、客席を多くした方が売り上げが伸びると予測するこ
とができる。このように、回帰分析はある事象Aが別の事象Ｂにどれだけ影
響しているかを分析する道具である。ただし、得られる結果はあくまで傾向
であり因果関係を示すものではないため注意が必要だ。（売上が大きいから
座席を増やしたという可能性もある）
データを点で
打ち、線を引
く
&lt;回帰分析の使い道 &gt;
左のグラフから席を20席増
やすと売上が3000万上が
ることがわかる
売上が3000万円上がる
座席が20席増える
https://data-viz-lab.com/regression-analysis


# Page. 11

![Page Image](https://bcdn.docswell.com/page/4JQYQN227P.jpg)

3. 機械学習と
ニューラルネットワーク


# Page. 12

![Page Image](https://bcdn.docswell.com/page/K74WNGLPE1.jpg)

07
機械学習
音声ガイド
様々な機械学習
06
機械学習とは
機械学習とは、「データをもとに、予測や判断のための規則を
向上させていく技術・手法」である。
近年使われているAIの殆ど全てはこの機械学習の技術を用
いて性能向上を行っている。（AIという語を、機械学習によって
作られたシステム、として用いることもある）
また、第二章で紹介した「回帰分析」も、収集したデータをもと
に予測規則を作る仕組みであるため、広い意味では機械学習と
言える。多くの機械学習は根本的にはこの回帰分析と同じ
「データをもとに仕組み(あるいは計算式)を向上させる」という根
本構造を有しているのだ。
データ数の増加
性能の向上
コラム：機械学習の3分類
機械学習は、次の3つに分類されることがある。
教師あり学習： 入力データと対応する正しい出力をもつデータ集合を
用いてAIモデルの学習を行う手法である。モデルは、これらのデータに
対して上手く出力を予測出来るように、学習を行う。
教師なし学習 ：入力に対して出力が対応せず、データそのものから特
徴や構造、パターンを見つけ出す手法である。ただし、パターンである
基準などを、人間があらかじめ定める必要がある。
強化学習 ：AI自身が与えられた環境下で様々なことを試しながら、学
習を繰り返すことによって、行動に対する報酬を最大化していく方法。
なお、現代AIは構造が複雑化しており、この3分類に当てはめる無意
味さが増しつつある。特に教師なし学習で顕著で、これは他の２つに当
てはまらない、対応する出力を用いない仕組みをひっくるめた、いわば
余りもの的な分類である。
犬
猫
教師あり学習
教師なし学習
強化学習
画像認識など
簡単なグループ化など
運動モデルなど
(画像：Boston Dynamics,Unitree)


# Page. 13

![Page Image](https://bcdn.docswell.com/page/LJ1Y5DLXEG.jpg)

08
マルコフ連鎖
LLMの先駆け
音声ガイド
07
マルコフ連鎖とは
現代のLLMよりはるか昔から、「次の単語を予測する」という
考えをした人がいた。ロシアの数学者アンドレイ・マルコフであ
る。
今から1００年以上前、この人は「次に出現する状態は、直前
の状態のみによって決まる」という確率モデルを作り出した。大
量の文章から、単語が何%での確率でどの単語に続くかを計算
し、それに基づいて文を生成する。これのみでは文法が崩れや
すく、完全な人間のような文章は作れないものの、かなりAIの本
質に近いものが考えられていたと言えるだろう。
上の図のようにいくつかの文から、特定の単語の次に続く言葉
の確率を計算する
マルコフ連鎖体験
今回、僕は大量の漫画の名言をもとに、マルコフ連鎖を用い
て、その漫画の名言っぽいものを生成するプログラムを作りまし
た。
いろいろな漫画を集めて作ってみたので、楽しんでもらったら嬉
しいです。
生成例：
ONE-PIECE: おまえが どこの 誰だか、 この 帽子に 誓った
鬼滅の刃 ：人間は皆お前の頸に刃を振るう!! 心を燃やせ燃や
せ!!!
↑ 展示物の操作画面


# Page. 14

![Page Image](https://bcdn.docswell.com/page/GJWG5YVK72.jpg)

09
ニューラルネットワークという革命
音声ガイド
人間の脳の構造を数学的に模倣した機械学習モデル
08
ニューラルネットワーク(Neural Network,NN)
回帰分析では、入力と出力の間の関係を一次関数などによる予測を行うこ
とができた。しかし現実の多くの事象はより複雑であり、複雑化した入力と出
力の対応を予測できる仕組みが求められた。
それを実現する手法及び構造がニューラルネットワーク(NN)である。これは
脳の神経細胞である「ニューロン」を数学的に簡素化して表現したアルゴリズ
ムで、いまやあらゆる現代AIに使われている。 これが考案されたのは1950年
代だが、計算量が多く近年まで実用化に至らなかった。
ところで、これから解説する複雑なAIについての解説を読むうえで、「NNは
入力と出力の対応を最適化できるブラックボックスだ」 と認識するのは非常
に重要である。本展示でも何が入力で何が出力かを意識しながら読むと分か
りやすいだろう。
入力層
隠れ層
出力層
↑ニューラルネットワークの模式図。入力された情報が、線や点において規
則的に処理をうけながら出力層へと流れていく。
※なお、各ニューロンとそれらをつなぐ線に対応して調節可能な値が存在し、これらをパラメータと言う。図では135個のパラメータがあ
るのに対し、ChatGPTの初期モデルであるGPT-3は1750億パラメータを有する。
脳の仕組みを模倣！
人間の脳は主に「ニューロン」「シナプス」の二つで構成されている。右上の
模式図においてはそれぞれ、丸がニューロン、線がシナプスに対応する。実
際の脳はこのネットワークよりさらに複雑だが、このアルゴリズムでは情報が
一方向に流れるよう簡素化されている（場合が多い）。
各ニューロン（丸）における処理は右式のようになっているが、ここでその処
理について詳しく解説することはしない。
ニューラルネットワークは、入力に対する出力を最適化するアルゴリズムで
あるため、出力の答えセットが用意されている教師あり学習及び強化学習で
用いられる。
学習には、パラメータを少し変えたときに出力が正解に寄るか、離れるかを
確かめ、正解に寄る方にパラメータを調整する「勾配降下法」がよく使われる。
1986年ごろに、勾配を効率よく計算できる「誤差逆伝播法」というアルゴリズ
ムが広まり、学習が飛躍的に高速化した。
線に対応するパラ
メータ（重み）
丸に対応するパラ
メータ（バイアス）
一つ前の層からの信号
の重み付き合計
↑ 基本的なニューラルネットワークにおける各ニューロンにおける処理(活性
化関数がReLUの場合。最近はGELU,SiLUなどが主流)。0との最大値(max)
を取ることで線形でない分析が出来るようになっている。


# Page. 15

![Page Image](https://bcdn.docswell.com/page/4EZLNX4N73.jpg)

10
コラム：深層強化学習
音声ガイド
ニューラルネットワーク×強化学習
09
深層強化学習 とはどのようなものか
深層強化学習とは、ニューラルネットワークに対して行う強化学習
のことである。
強化学習とは、AIが環境の中で行動を選び、その結果がよりよくな
るように、行動の選び方を学んでいく枠組みであった。
ニューラルネットワークではない強化学習の方法として、「問題、回
答、点数」の３つ(より正確には状況, 行動, 報酬)を経験した全てのケースにつ
いて記録するという方法が考えられる。しかしこれでは覚えるケース
が膨大になる。より大きな問題は経験したことのないケースについて
は何も分からないことである。
ニューラルネットワークを用いることで、未経験のケースも類推で良
い行動ができるようになる（場合もある）。
五目並べAIを作ってみた
今回私が展示しようと思っているのは５目並べのAIである。実
際にはオセロをやりたかったが、思った以上に複雑だったので、
五目並べにした。最初何もない状態から、5000試合以上対戦さ
せたが、実際に対人戦をしようとすると、弱すぎて相手にならな
かった。 だから初期設定として、最低限、敗北をしないように防
ぐことができるように設定した。最初は攻めと守りを同じ優先度
にしたが、プレイヤーが先手の場合50パーセントで最速負けし
てしまったので、守りの優先度を上げた。また、深層強化学習を
しているところを見られるようにした。
実際にやってみてほしい。
↑ Google DeepMindが開発した囲碁AI「ALphaGo」。深層強化学習を用いて
盤面評価を行い、評価の高い盤面を探索アルゴリズムによって探す。


# Page. 16

![Page Image](https://bcdn.docswell.com/page/Y76W84397V.jpg)

11
コラム： GPU
音声ガイド
株価爆上げNVIDIA
10
ゲームの発展によりGPUの開発が過熱
3Dゲームでは、画面を構成する大量の画素や3Dモデルに対して同
じ処理を何度も実行する必要がある。1990年代になりゲームの高速化
高画質化が進むと、既存のコンピュータ（CPU）では徐々に対応しづらく
なっていた。
CPUは少数の複雑な処理を高速に行うことができるが、大規模な並
列処理には不向きである。そこで発明されたのがGPU（Graphics
Processing Unit）である。GPUは大量の比較的単純な計算を一度に
処理できる演算ユニットである。 GPUはゲームという分野で確かな商
業的成功を収めており、十分に開発投資が成された。その結果として、
この計算能力が他の分野、すなわちAIに、処理の高速化のために転用
されることとなるのだ。
出典https://pc.watch.impress.co.jp/docs/topic/review/1655963.html
NVIDIAGeForceRTX5090という、GPUが搭載されたグラフィックボード
サブコラム：PS3クラスタ
ゲーム市場が計算機性能を押し上げた顕著な例が、
PlayStation 3である。PS3には、Sony・IBM・東芝が共同開発し
た高性能プロセッサ「Cell」が搭載された。高性能なゲームを実
現するため、これらの企業はプロセッサの開発に大規模な投資
を行い、さらに巨大なゲーム市場に向けて大量生産した。その
結果、高い計算能力を持つコンピュータを比較的安価に入手で
きるようになり、研究機関ではPS3を数百〜数千台接続し、科学
計算用のスーパーコンピュータとして利用する例まで現れた。
前述したGPUも同じ構造を持ち、ゲーム向けに発達した高い
並列計算能力が、後にAIの計算へ利用されることとなる。
↑米空軍で使われていたPS3クラスタ


# Page. 17

![Page Image](https://bcdn.docswell.com/page/G75M9QLD74.jpg)

12
画像処理 AI
音声ガイド
～CNN～
11
画像処理を支えるCNN
CNN(Convolutional Neural Network)は、画像処理に特化した
ニューラルネットワークである。
画像は基本的に細かい要素の集合として構成されているため、画像
の一部だけを切り抜きパターンを分析する「畳み込み層」を用いること
で、小規模なネットワークで画像処理ができるようになっている。
具体的には、それぞれの畳み込み層では、特定の位置のマスについ
て、全ての層をお手本のパターンと比較し、そしてその一致度を１つの
画素のようなものとして次の層に送る。
2012年にAlexNetが作られたことを契機に爆発的に普及し、現在も
深く根付いているが、現在は新方式の開発も進んできている。
処理の方向
↑ CNNの概要。各図形が１つの畳み込み層を示す後ろのレイヤーに行くにつ
れ、細かいパターンから大局的な図形が認識できるようになっていく。実際は
畳み込み層と畳み込み層の間にはプーリング層などがある。
様々な分野で活躍するCNN
CNNは、現在では画像を扱うさまざまな製品やサービスに利用さ
れている。
代表的な例として、医療分野ではX線、CT、MRIなどの画像から
病変の候補を検出する診断支援、製造業ではカメラ画像から製品
の傷や欠陥を見つける不良品検査が挙げられる。また、自動車に
搭載したカメラの映像から歩行者や車両、道路標識などを認識する
ことから、運転支援にも用いられている。さらには、スマートフォンの
顔認識や被写体認識、書類やレシートを読み取るOCRなど、CNN
を用いた画像認識技術は身近な物に広く組み込まれている。
このようにCNNは、研究用途にとどまらず、安全性や作業効率の
向上、自動化を支える技術として社会に定着している。
↑ MTCNNによる顔認識の例


# Page. 18

![Page Image](https://bcdn.docswell.com/page/9J292P3MER.jpg)

13
コラム： CNN
12
CNNのコラム
「過学習」とその対策
機械学習において、同じデータを用いて何度も学習させると、その
学習させたデータにだけ特化したモデルが出来る「過学習」 という現
象が存在する。
そのため、CNNなど画像処理モデルを学習させる際には、学習に
使う画像に対し拡大、縮小、回転、色調変化を行い、疑似的に画像の
種類を嵩増ししている。
ちなみに、こうした編集を使うと画像は理論上無限に増やすことが
出来るが、実質的なモデルの性能増加は2倍~5倍に留まるという研
究結果もある。これは、画像の変形では本質的な情報量は増えない
からである。右の画像をいくら変形しても顔のパーツについては分か
らない事からも想像がつくだろう。
shortcut learning
元画像
加工後の画像のイメージ
参照 : Adobe Stock
例
犬がいるかどうか見分ける場合
牧草地にいる牛は認識できるのに、砂浜に立たせると認識できな
い——機械学習において、本来意図された特徴ではなく、それにたま
たま付随する特徴をもとに判断するようになってしまう現象を
「shortcut learning（ショートカット学習）」という。
右の例では、犬の写っている画像の背景を差し替えると、AIが正し
く判断できなくなっている。学習データに偏りがあり「背景に木があれ
ば犬」と判定するだけで正解率が高くなる場合、犬そのものの特徴を
学ばず、実質的に「背景に木があるか」の判定器が出来上がってしま
うのだ。
やっかいなのは、学習データと同じ傾向のテストデータで測る限り、
これが高い精度として現れてしまう点である。通常の評価では見抜け
ず、条件の違うデータに移して初めて破綻が明らかになる。
音声ガイド
AI
：犬がいます
AI
：犬はいません
参照 : ペッツファース


# Page. 19

![Page Image](https://bcdn.docswell.com/page/DEY4Y51PJM.jpg)

14
画像生成
stable diffusion
stable diffusionとその仕組み
学習時
Stable Diffusionは、英系スタートアップ企業のStability AIを中心に開発さ
れ2022年8月に発表された、「拡散モデル」と呼ばれる種類の画像生成AIモ
デルである。
Stable Diffusionは、学習データを簡単に作れる、「ノイズの乗った画像から
「乗っているノイズ」を当てる作業」を学習する。意図的にノイズを加えた画像
に対し、ノイズの様子を予測させる訓練を行うのだ。
生成時は、その逆に乱数ノイズから出発し、予測されたノイズを少しずつ差
し引く。これを数十回繰り返すうちに、砂嵐から像が浮かび上がる。このとき
入力された文を「テキストエンコーダー」を用いてベクトルに変換してヒントを
与え、予測に反映させることで、テキストで入力した、望んだ内容へ誘導でき
る。
生成時
Text Encoder
画像生成AIは、画像を作り出す時に入力した文章に基づくヒントを受
ける。 このとき、文章をそのままAIが扱うことは難しいため、文章の持
つ意味を圧縮した数値データを用いる必要がある。このとき圧縮する変
換器こそがText Encoderである。
ここで、文の持つ情報を少数の数値データに圧縮する時に、どうして
も情報の欠落などが起きてしまう。そのため、従来の画像生成AIはテキ
ストエンコーダーの性能による制約を受けていた。
そのせいで、複雑な指示や細かな表現を正確に反映することが難し
い場合があった。
それに対し、近年はGeminiやChatGPTなどのマルチモーダルAI(複
数種類の情報を統合して処理出来るAI)が登場し、文章だけでなく画像
や音声なども理解できるようになった。これにより画像生成AIの性能は
大きく向上し、新たな可能性が広がっている。
音声ガイド
13
「夕暮れ時に静かな海を見下ろす崖の上に位置する大きなガラス窓を持つ現代建築」(AIの画像生成)
ファイル:DALL-E 3 AI生成例image.png - ウィキメディア・コモン
ズ


# Page. 20

![Page Image](https://bcdn.docswell.com/page/VJNYPN2M78.jpg)

15
コラム：画像関連
音声ガイド
画像生成AI
13
ControlNet
Stable Diffusionなど拡散モデルには、文章を用いて指示を行う。し
かし、「腕をこの角度まで上げる」といった空間の指定は、言葉だけで
は狙いどおりに出せないという問題があった。
そこでControlNetという、図での指示を可能にするニューラルネット
ワーク構造が考案された。具体的な構造について触れる事はしない
が、どのように処理が行われるかについて軽く紹介する。
例えば人物を描かせるとき、利用者はあらかじめ骨格を渡しておく。
すると、拡散モデルがノイズを取り除く各ステップにおいて、骨格が示
す位置に手足を配置させるような影響が加わり続け、最終的に指示
通りの骨格で画像が完成するのだ。
↑骨格の例（左）とそれをもとに生成された画像の例（右）
画像：https://taziku.co.jp/blog/comfyui-a-openpause
AIが世界を騙した日
2023年3月、ローマ教皇フランシスコが白い高級パファージャ
ケットを着て歩く写真がSNSで爆発的に拡散した。瞬く間に世界
中へ広がり、有名人を含む多くの人が騙され、テレビでも報道さ
れるほどの騒動になった。
しかし、これはアメリカに住む31歳の建設作業員が、画像生
成AI「Midjourney」で作ったものだと後に判明した。本人に教皇
への悪意はなく、ただ「面白い画像を作ってみたかった」だけ
だったという。この一件は、AIが生み出す画像が「プロの目でも
一瞬では見抜けないレベル」に到達したことを世界中に思い知
らせた出来事であり、AIによる偽画像が一般の人々を大規模に
騙した最初の事例として、しばしば挙げられる。
↑当該画像 ©The New York Times


# Page. 21

![Page Image](https://bcdn.docswell.com/page/YE9P3R1WJ3.jpg)

4. LLMの台頭


# Page. 22

![Page Image](https://bcdn.docswell.com/page/GE8DMW4RED.jpg)

16
言語のベクトル化
音声ガイド
言語を数字に
14
言語のベクトル化
そもそも、コンピュータは人が使う言葉をそのままでは理解で
きない。処理できるのは「数字」だけである。
そのため、データの特徴を数値のセットに置き換えて、AI(∊コ
ンピュータ)に扱えるようにしてあげる必要がある。
ベクトル化とは、言葉や画像など人間が利用するデータを、コ
ンピューターが計算・処理しやすい「数字の並び（ベクトル）」に変
換する技術である。データを「数字の並び」や「空間の座標」に変
換することで、コンピュータがデータの特徴や意味の関係を計算
したり、データ同士がどれくらい似ているかを比較したりできるよ
うになる。
画像は２次元に単純化している。 Gemini Embedding 2 は標準3072次元
言語ベクトルの学習方法
言語ベクトルの数値は、人間が手で決めるのではなく、大量の文章
から自動的に学習される。最初はランダムな並びだが、学習を重ねる
につれて、単語の意味や使われ方を反映したものへと変わっていく。
学習には、文章の空欄に入る単語を当てる「穴埋め問題」などを用
いる。モデルは言語ベクトルをもとに単語を予測し、正解とのズレを計
算する。そしてそのズレが小さくなるように、「勾配降下法」を用いて、
モデルとベクトルの数値を少しずつ調整していく。ここで、同じ空欄に
入りうる単語(例えば「犬」と「猫」)は、モデルに似た予測をさせなけれ
ばならない。このときベクトルの数値も似たものにする方が都合が良
いことは想像に難くないだろう。
この調整を繰り返すうちに、似た文脈で使われる単語どうしは、自
然と近いベクトルで表されるようになる。
↑ 穴埋め問題の例（単純化している）。単語予測器及びベクト
ルはどちらも学習中の物を用いる。


# Page. 23

![Page Image](https://bcdn.docswell.com/page/LELM3N627R.jpg)

17
体験展示
音声ガイド
言葉の足し算
14
言葉の足し算とは
言語をベクトルとして数値データにすることができるなら、それ
を利用して計算ができる。
AIにおける言葉の足し算は、単語をベクトル化し、それを足し
たり引いたりして言葉の意味を計算・推論したり、別の単語を導
き出したりすることである。
例
王様 ー 男 ＋ 女 ＝ 女王
東京 ー 日本 ＋ フランス ＝ パリ
操作画面
使い方
「基本」タブは、一番上の入力欄に元にする単語、その下に意味
を引きたい単語、一番下に意味を足したい単語を入力し、実行
ボタンを押すと結果が下に表示される。
「複数」タブは、入力欄に計算させたい式を入力して実行を押す
と結果が表示される。
対応しているのは半角の「+」と「-」のみである。
単語と+、-の間はスペースまたは改行を入れる必要があるた
め、注意されたし。
入力例


# Page. 24

![Page Image](https://bcdn.docswell.com/page/4JMYDX59JW.jpg)

18
Recurrent Neural Networks (RNN)
音声ガイド
文脈の記憶
15
文脈と1つの単語で物を考える
人間が文章を理解するとき前から後へと順に読んでいく。ここで、あ
る単語を読むときそれ以前の文脈を把握した状態で読む。
これを模倣して作られたのがRNN(Recurrent Neural Networks)で
ある。Recurrentはラテン語由来の単語で、繰り返し(Re)走る
(current)、等と訳せる。
内部的には、その単語までの文脈を１つのベクトルとしたもの(文脈
ベクトル)を保持した状態で、単語を一つ読み、新たな文脈ベクトルを構
成する仕組みとなっている。
2016年ごろまで、google翻訳は統計的機械翻訳であったが、RNN
を用いたものに刷新されたことにより革新的に性能が向上した。（な
お、現在は後述するTransformerベースになっている）
↑ RNNによる推論の概略。長文を入れた場合は、学習時において横にと
ても長いニューラルネットワークと同じような状況になる。
Attentionの登場
既存の(RNN型)翻訳機は、推論機（エンコーダ）で推論完了した文章
全体を1つのベクトルにまとめ、そのベクトルのみを用いて出力機（デ
コーダ）で1単語ずつ出力していく。この方式では、１つの文脈ベクトル
に文章すべての情報を詰め込む必要があるが、長文になってくると、
情報量が収まりきらず、長文翻訳の制度が低くなってしまう問題があっ
た。
そこで「Attention(注意)機構」という、参照する文脈ベクトルを選び直
す仕組みが考案された。これは、全文読んだ後の1つの文脈ベクトル
を使うのではなく、単語１つを出力するときに、文章を読んでいる途中
の文脈ベクトル全てを「ちょうど良いバランスで混ぜたもの」を用いるも
のだ。この統合機構こそがAttention機構である。Attention機構は翻訳
作業中のデコーダの文脈ベクトルを参考に適切な混ぜ方を決定する。
このバランス感覚(比喩)はエンコーダ及びデコーダのRNNと同時に学
習される。
↑Attention無し（左）とAttentionあり（右）の比較。


# Page. 25

![Page Image](https://bcdn.docswell.com/page/PJR94N3979.jpg)

19
ATTENTION IS ALL YOU NEED
音声ガイド
「ある単語を見るとき、他のどの単語を重視するか」という発想
16
Transformerが起こした革命
「Attention Is All You Need」は2017年に発表された論文である。直
訳すると「必要なのはAttentionだけだ」。
その論文で発表されたTransformerは、名前の通りAttention機構だけ
を使用するニューラルネットワーク構造であり、現在隆盛を誇る
LLM(Large Language Model, 大規模言語モデル )を初めほぼ全て
の現代AIはこれを利用している。
Transformerの中心となるのは、Self-Attention(自己注意)機構であ
る。これは、入力された文章内のどの単語がどの単語と強く関係してい
るかを計算するものである。RNNにおいてAttention機構が文脈ベクト
ルに対して行っていた重みづけを、単語そのものの意味ベクトルに対し
て行うようにしたと思えばよい。
Attention機構は、より正確には、大量の単語ベクトルをまとめて処理
して混ぜているのではない。それぞれの単語の意味ベクトルと今の理
解の文脈ベクトルという2つのベクトルから、相性を計算※し、その相性
度合いを混ぜるときの比率としている。
ここで、単語の意味ベクトルだけを用いるこの方式では語順の情報
が失われてしまうのではと疑問に思うかもしれない。実際にその問題
は発生し、それを解決するために、単語ベクトルに位置の情報(今気に
している単語の何文字前か)を付加する「位置エンコーディング」という
技術が開発された。そんなので上手く行くか？と思ってしまうが、どうや
ら上手く行ってしまったようだ。
※ニューラルネットワークにではなく、殆どはただの行列積 (GPUで高速に計算できる )
GPUとのスーパーコラボレーション
RNNでは、結果を逐次的に次のRNNに代入する構造であるた
め、全体として１つの長いニューラルネットワークのようになってし
まう。そのため学習が一直線的にしか行えず、時間がかかってし
まうという問題があった。
それに対しTransformerは、全ての単語に対してAttention機構
で言葉のマッチングを1回行う、という構造になっており、学習する
のはAttentionの単純な構造のパラメータである。この単純な計算
はGPUを用いると並列に計算することができ、高度に高速化され
る。
Transformerの本質的な革新はこの学習の高速化にあり、モデ
ルの大型化、学習データ量の膨大化、それに伴う性能向上が実現
されていく。
↑ AIによる翻訳文生成の模式図。右側がモデルが参考にする
情報、左が生成されている文章
(Attention Is All You Needで発表されたものとは別の方式)


# Page. 26

![Page Image](https://bcdn.docswell.com/page/PEXQ2N43JX.jpg)

20
スケーリング則
音声ガイド
大きくすれば大きくするほど...
17
LLMを大きくすると性能も上がる
RNNは言葉を一文字ずつ順番にしか読めず学習の速度も遅かっ
た。それに対し、2017年の論文、「Attention Is All You Need」で発表
された「Transformer」はその学習にかかる時間が圧倒的に短かっ
た。
これにより、モデルのサイズを大きくしても現実的な時間で学習が完
了するようになった。モデルが大きくなるほど複雑な内部ベクトルを保
持し、複雑に処理することができるようになるため、性能が向上する。
これを「スケーリング則」と言う。
ここで、モデルサイズのみを大きくすると学習データに対して過度に
最適化される過学習という問題が起きるため、同時にデータ量も必要
になる。
間
違
い
の
数
計算量の増加
データの増加
間違いが減り性能が向上
モデルの規模拡大
出典: https://arxiv.org/pdf/2001.08361
Scaling Laws for Neural Language Models - Figure 1
スケーリング則の限界
スケーリング則では、モデルサイズ、学習データ量を増やすと性能が
向上するが、このうち学習データが枯渇しつつあった。
そこで、現在では教師データを用いない強化学習による性能改善が
行われている。
10数台のAIに、同時に数学や科学の問題を解かせる。そして、出し
てきた答えの正解度合いの高い文章を正解の出力として、その推論に
寄るようにパラメータを調整し、性能改善する。(不正確だが概念理解
には十分であろう）
また、最近のAIサービス(ChatGPT,Geminiなど)は、「考えていま
す...」のような表示が出ることがあるが、これは、内部的には大量の文
字を出力して推論を行っているいる時間だ。最近のAIは１つの単語を
出力するにも数千万回規模の膨大な計算を行っており、1文字でも出
力するとその計算の成果を少しと言えどを次に繋げられ、深く思考出来
るようになる。
↑AIの推論の例(実例に基づくものではない)ネットワーク内部の処理は
正確には確認できていないので、想像である。
進んだ注:また、「3784」「9460」等は１回で出力されることは無いが、簡略化している。


# Page. 27

![Page Image](https://bcdn.docswell.com/page/3EK9MNZNED.jpg)

21
コラム：チューリングテスト
音声ガイド
18
チューリングテストとは？
機械
チューリングテストとは、イギリスの数学者アラン・チューリングが
「人工知能」という語が生まれたダートマス会議の六年前、1950年に
提案した、機械やプログラムが人間と区別できるかどうかを判別する
テストだ。
これは第一次AIブームに先立つ時期の提案であった。テストでは、
人間の判定者が、会話の相手が人間か機械かを知らされないまま会
話を行う。そして、判定者が相手を機械だと明確に見分けられなけれ
ば合格である。
なお、この会話は、機械が言語を音声に変換する能力に判定が左
右されないよう、チャット形式などで行われる。
人間か機械か判定
判定者
人間
体験展示：チューリングテストゲーム
試しにチューリングテストをしてみよう。
PCに好きなメッセージを入力してみてほしい。それはAI及び
人間に送信され、2つの返信が来る。それ以降はそれぞれと自
由にチャットすることができる。
どちらが人間か分かったら、上にあるボタンを押してほしい。
正解不正解が表示される。
↑各種AIモデルと、より人間的であると判定された割合。近年の
モデルは人間より人間的であると判断される割合が高い。


# Page. 28

![Page Image](https://bcdn.docswell.com/page/L73WYVDZ75.jpg)

22
記号接地問題
AIは言葉の意味を「理解」しているか？
音声ガイド
19
LLMは一見万能！だけど...?
人間は、「りんご」と聞けばりんごの味や食感を思い浮かべることがで
きる。 しかし、LLMは膨大な文章から「りんご」、「赤い」、「甘い」といっ
た単語の関係を学習し、文章を生成しているだけであるため、一見現実
世界を理解しているように見えても、現実世界での意味や経験とは結び
ついていない。これは記号接地問題(Symbol Grounding Problem)と呼
ばれる、AIの古典的問題だ。
ただし、これを問題とするか否かは別である。現代AIは仮にそれが実
際の経験に基づいていないにしても、あたかも経験があるかのような返
答ができる。外部から見分けのつかない動作に対して、その内部で”本
当に”「接地」ないし「理解」しているかどうか、という議論は無意味だ、と
いう見方も存在する。
↑AI(ChatGPT, GPT-5.6 Sol) との対話例。さもりんごを食べたこ
とがあるかのような返答をしている。
新時代の接地問題
「記号接地問題」は基本的には哲学的命題であり、技術的な文脈で
議論になることは少ない。接地していなくても十分な成果を挙げている
からだ。事実、コーディング・科学研究分野におけるAIの業績は凄まじ
い。しかし、「接地していないこと」が実用的に問題になる領域がある。
それはハードウェア設計である。
ハードウェア設計のような領域ではLLMの性能は顕著に低い。原因
はハードウェア設計についてのデータ不足だろうが、そもそもこの領域
の知識は、設計し、試作し、壊し、原因を探って直すという物理的な試
行錯誤を通じて生まれるものが大半である。テキストに残らない暗黙
知が大量にあるため、AIが学習可能になっている知識が殆ど存在しな
いのだ。
古典的な接地問題とは様相が異なっているが、AIが接地していない
ことには確かに問題が存在する。
↑ 最先端AIモデルであるGPT-6 Astraによって設計されたターボファンの
画像。しかし、この羽根形状は明らかに製造不可能である。
画像：@adamdotnew (Xより引用)


# Page. 29

![Page Image](https://bcdn.docswell.com/page/87DK58P4JG.jpg)

5. physical AI


# Page. 30

![Page Image](https://bcdn.docswell.com/page/VJPKG8NVE8.jpg)

23
PhysicalAIとは？
音声ガイド
現代のロボットはここまで進歩した！
20
近年のphysical AI の急激な進展
ここまで主にLLMなどソフトウェア領域を中心に見てきたが、
ロボット研究部なのでAIロボットの動向も見ておこう。近年、
physical AI (=物理的AI) は目覚ましい成長を遂げている。今ま
では夢物語と思われていた「ロボットが人間のように見て・理解
して・動く」という段階へ一気に近付いた。
中国のUnitree社や、アメリカのboston dynamics社では本物
の犬のように歩くロボットや、サッカーやボクシングなどができる
二足歩行ロボットなどが既に作られている。
出典：https://bostondynamics.com/
このセクションの内容
このセクションでは、主にphisicalAIについて、
・実現への道筋（ハードウェア領域での発展）
・VLAモデルと接地問題
・付随する倫理的な課題
この三点について解説を行っていく。
↑今年8月に開催された北京ロボットスポーツ大会(北京机器人运动会精彩回
顾)の様子。この大会では100m走8秒64という記録がマークされた。(画像：中
国电子报)


# Page. 31

![Page Image](https://bcdn.docswell.com/page/2EVV6NKREQ.jpg)

24
ハードウェア技術の発展
音声ガイド
Quasi Direct Drive
21
QDDモーター
QDDモーターとは、準ダイレクトドライブ（Quasi DIrect Drive）モー
ターのことで、近年の急激なPhysical AIの発展における主役とも言え
るかもしれない。最新のロボットアームやヒューマノイド、4足歩行ロ
ボットなどに用いられている。
既存の産業ロボットなどに使われている高減速比のギアードモー
ターは衝撃などでギアが割れやすい。また洗濯機などに使われる、
全く減速機をつけないDD(ダイレクトドライブ)モーターは大型かつ消
費電力も多かった。
QDDモーターはギア比を1:5~1:15程度にしたものであり、衝撃に
対して強く、また小型である、まさにいいとこどりの製品なのだ。
↑ QDDモーターの構造。モーターとギアが一体になった構造を
している(画像：CubeMars)
ドローンの発展との関連
このQDDモーターの中核部品には、「BLDC（ブラシレスDC）モー
ター」が使われている。BLDCモーターは精密な数値制御をすること
で、トルク（大雑把には回転させる力）を一定に保つことができる。ま
た、体積あたりのトルク(トルク密度)も他の種類のモーターに比べると
高い。さらにはブラシという部品を使わないため耐久性も良い。
しかし従来、ロボットに採用できるようなBLDCモーターは産業用の
高価なものに限られていたという問題があった。
この状況を変えたのが、2010年ごろのホビー用ドローン産業の成
長である。これにより、小型で高性能なBLDCモーターが大量に生産
され、安価に流通するようになった。
こうしたBLDCモーターの転用により、QDDモーターの開発が進
み、近年の著しいロボット開発につながるのだ。
↑ドローンに使用されるBLDCモーター（画像：秋月電子通商）


# Page. 32

![Page Image](https://bcdn.docswell.com/page/57GLNKQ6EL.jpg)

25
体験展示：模倣学習
音声ガイド
やってみよう！Physical AI
22
模倣学習
模倣学習とは、人間の動作をロボットに模倣させることで、ロボット
が様々な課題（タスク）をこなすことが出来るようにするための、学習
方法の一つである。
データの収集方法は主に３種類ある。
・テレオペレーション：人間がロボットを操作し、その操作を再現出来る
ように学習する
・UMI(Universal Manipulation Interface)：ロボットの手先部分と同じ
役割を果たす装置を人間が扱い、実質的にテレオペレーションと同様
の役割を果たす
・動画からの学習：人間の動作の動画からどうしたらロボットが再現で
きるかを分析し、学習データとする
体験展示
ロボットがホワイトボードを消すデモを用意した。
ホワイトボードに何かを書いた後、開始ボタンを押すと、ロボッ
トが自動で書かれた物を検出し、消す動作を行う。
ロボットはAIモデルによって動作している
ため、動きに不確定さがあります。動作
中は絶対に近づかないでください。
↑UMIによる画像取得の様子とそれに適合したロボット
(画像:Chi et al., &quot;Universal Manipulation Interface,&quot; RSS 2024 )


# Page. 33

![Page Image](https://bcdn.docswell.com/page/4EQYQNK2JP.jpg)

26
VLAモデル
音声ガイド
真のAGIへの道筋
23
VLAモデル(Vision Language Action Model)
ACTやDiffusion Policyなどの模倣学習モデルは、学習データに
沿った動きしかできない。赤いボールをつかんで動かす動作を学習し
たら、赤いボールをつかんで動かす動作しかできない。青いボールを
つかんで動かす事はできないのだ。それが実質的に殆ど同じ動作で
あるにも関わらず、である。
その課題に対し、現在「VLAモデル(視覚言語行動モデル)」の研究
が進んでいる。カメラの画像情報、Transformerによる言語情報の処
理、モーター駆動及び応力センサなどでの動作情報の処理などを統
合的に行うモデルである。ある程度の学習を行うことで、言語的指示
により学習データにない未知のタスクをこなすことができるようになる
点にその長所がある。
VLAモデルと記号接地問題
VLAモデルは、（実践的な）記号接地問題への解答となりうる。本展示
では、AIが接地していないことの実用的な問題として、テキストに残らない
暗黙知をAIが学習できないことを挙げた。VLAモデルはこの制約の構造
そのものを変える。
VLAモデルを搭載したロボットがタスクを実行するたびに、そのとき見え
ていた映像・受け取った指示・実行した動作・その結果が、一組のデータ
として記録される。これは、テキストに残りにくかった暗黙知を直接含みう
る。
さらに、物理世界でのやりとりは事実上無限に生成できるため、収集可
能なデータ量の上限はテキストとは桁違いに高い。なおそれらを有効に使
うためには自律的なフィードバックが必要であり、課題は山積みだ。しかし
テキストという単一のデータソースに依存していたAIが、物理世界という
桁違いに広い情報源へのアクセスを得つつあることは事実で、今後のさら
なる発展に注目である。
↑VLAモデルの未知課題への対応を示す図。「ボール」の特徴、「緑」の特徴を
学んで、未知の「緑のボール」に対応出来る。（実際には数十～数千のデータ
を収集して出来るようになる）
VLAモデルの学習に使える（かもしれない）範囲
LLMが学習に使える範囲
⾔語化された知識
テキストに変換しづらい知識
画像：1X(@1X_tech, Xより引用)及びFigure(@Figure_robot, Xより引用)


# Page. 34

![Page Image](https://bcdn.docswell.com/page/KJ4WNGPP71.jpg)

27
倫理的課題
AIの社会実装にあたって
音声ガイド
24
主な課題
Physical AIの社会実装が進むにつれ、倫理的課題も浮上する。従来の
AIは主に情報を出力していたが、Physical AIは自ら判断し、現実世界で行
動すため、AIの判断が人間の安全に直接影響する。
例えば、人型ロボットがバランスを崩し、転倒しそうになったとする。その
まま倒れれば近くの人にぶつかる可能性があるが、そばにいる別の人の腕
をつかめば転倒を防げるかもしれない。しかし、突然腕をつかむことで、そ
の人を傷つけてしまう危険もある。
このとき、AIはどう行動するべきだろうか。 人間なら「結果的にそうなった」
で済んでいた事態も、AIでは事前に設計された選択となる。このような道徳
的判断に万人が合意できる正解はないが、誰かがその判断基準を設計し
なければならないのだ。
↑ 自動運転車は直進して歩行者の命を犠牲にするべきか、壁に激突して
乗客の命を犠牲にするべきか？（画像：Moral Machneより引用）
課題解決に向けた対策
こうした倫理的課題に対応するには、法制度と技術の両面から対
策する必要がある。Physical AIでは、AIの誤判断だけでなく、悪意あ
る指示も被害につながり得る。
例えば、AIロボットに悪意ある指示を与え、ロボットが人を傷つけて
しまうケースなどが考えられる。この場合、指示した人物、メーカー、
（あるいは将来的にはロボット自身！？）、誰がどれだけの責任を負う
のか、という問題が生じる。製造物責任法（PL法）など既存法をAIに
どう適用するか整理する必要がある。同時に、危険な動作をAIだけで
決定させない安全機構など、事故を未然に防ぐ設計も欠かせない。
さらに、事故後に原因を検証するため、AIが何を認識し、どんな指
示を受け、なぜその行動を選んだのかを記録・追跡できる仕組みも必
要となる。説明可能なAI（XAI）は、そのための技術の一つである。
画像：AI総合研究所


# Page. 35

![Page Image](https://bcdn.docswell.com/page/LE1Y5D9X7G.jpg)

6. おわりに


# Page. 36

![Page Image](https://bcdn.docswell.com/page/GEWG5YQKJ2.jpg)

28
現代AIの抱える課題
音声ガイド
25
バイアスのかかったAI
AIは近年急速に発展し、ChatGPTやGeminiをはじめとし、人々の生
活にも浸透している。AIを中立的な情報源として使う人も多いのではな
いだろうか。
しかし、AIの出力には確かにバイアスがかかっていることが研究で知
られている。2025年の PNAS Nexus の研究では、GPT-4o、Claude
3.5 Sonnet、Gemini 1.5 Flash、等5種類のAIモデルに、約 36万1,000
件の架空の履歴書を評価させたところ、黒人男性の採用候補者は、他
の条件が同等の白人男性より低く評価される傾向が多くのモデルで確
認された。AIは「差別はいけない」と答えられても、実際には差別を行っ
てしまうのだ。
当面の間、私たちはそれを踏まえた使い方をするべきだろう。
↑ AIのバイアスの例。上図のような傾向が多くのモデルで見られた。
学習データの倫理的課題
AIの学習には膨大なデータが使われる。その中には他人に著作権
のあるデータもあり、それについて世界中で議論が行われている。
（特に絵、イラスト、音楽など芸術作品の文脈で）
これに対する各所の対応は様々だ。右に表を掲載した。
筆者は個人的には次のように考える。そもそもAIの学習と人間の学
習は、仕組みとして区別がつかない(注)。人間もまた、他人の作品を
大量に見て学習し、自分の表現を行うからだ。であるならば、AIにも
人間と同じ基準を適用するほかなく、AIを人間と同じように扱い、著作
権法違反で逮捕出来るようにしたらいいのではないだろうか。
しかし依然として残る問題もある。例えば人間のイラストレーターが
一枚の絵を仕上げるのに数時間を要するのに対し、AIはその時間で
数千枚を出力できる。ルールが公平であることと、結果が公平である
ことは、同じではないのだ。
↑ 世界各所におけるのAI学習規制法の現状
左側注：人間には自分の絵を見ながら自己改善していくプロセスがあるため、異なる部分もある。前述
Stable DIffusionなどは顕著に異なるだろう。ではAIが手でイラストを描くならそれは許されるべきか、とい
う観点も出てくる。（なおAIが他人のイラストのつなぎ合わせでイラストを生成しているかのように語られる
ことがあるが、それは誤解であり、学習データはモデルの調整にのみ使われる。但し参考画像としてAIに
渡して生成させる場合はその限りでない）


# Page. 37

![Page Image](https://bcdn.docswell.com/page/47ZLNXWNJ3.jpg)

29
AIとSNS
音声ガイド
世界情勢と情報社会
26
技術の囲い込み(Claude Fable)
今年6月9日、AnthropicはClaude Fable 5を一般公開した。しかしそ
のわずか3日後にあたる6月12日、突如として米国政府の輸出禁止命
令により、米国内外問わず公開が停止され、その後約19日間にわたり
Fable 5にアクセス出来ない事態が続いた。
これはFableの持つ高いソフトウェア解析能力、脆弱性発見能力が
「ジェイルブレイク」によりその安全措置を潜り抜け、サイバー攻撃など
に悪用されるリスクを懸念したものだとされている。
こうした安全上のリスクを懸念するのは妥当なことだが、AIを自国内
で囲い込むような政府要求が出たのは事実であり、今後技術が広く使
える状況が続くのか、注視していきたい。
画像：SAMYUKTA LAKSHMI GETTY IMAGES
SNSにおけるAIの悪用
新技術が生まれた時には毎度のことだが、その技術の悪用が生まれ
る。包丁の普及により、包丁による傷害事件が起こりうるようになった
が、包丁が開発されるべきではなかったかと言うと、そう言い切ることも
できない。
しかし、AIは他の技術とは異なっている側面もある。人間の代替とな
りうる点だ。資金を払えば、人間が書いたような文章を数多く生み出す
ことが出来る。これにより、SNS上でまるで人間が発信しているかのよ
うに見せることも出来る。
これは政治上の影響も大きい。SNS上における「人の声」や世論形成
において、AIによる影響が否定できなくなりつつある。そのため、これら
に過度に左右されることなく、客観的な事実と自らの論理的な判断に基
づき選挙へ臨むことが、今の有権者に必要な能力となっているのだろ
う。
利用者の多い大手テキスト主体のSNS


# Page. 38

![Page Image](https://bcdn.docswell.com/page/YJ6W84G9JV.jpg)

30
まとめ
音声ガイド
人工知能のこれから
27
「人工知能の世界」
さて、ここまでAIの発展してきた歴史、そして現代AIの仕組みを(軽く
ではあるが)紹介してきた。ではこれからAIはどのように発展し、世界は
どのように変容するのだろうか？
確かなことは言えないが、起こりうるケースを列挙してみる。
A: 一部の人間が AIを活用し権力集中を盤石なものとする
中国は典型的かもしれないが、他の国でも、あるいは世界全体とし
て同様な事態になりうる。（日本も他人事ではないだろう）
B: AIがすべての知的労働を代替し人間は肉体労働に従事する
古典的SFのAIディストピア。大いに現実味がある。
C: AIが肉体労働を代替し、人間は知的活動に従事する
古典的SFのAIユートピア。現状、実現性は薄そうだ。
↑ 左のような世界観で描かれたSF小説は数多くある。上はその一例
である。(左からハーモニー(伊藤計劃), Manna(Marshall Brain), プ
レイヤー・ピアノ(カート・ヴォネガット))
過渡期に生きる私たち
上では様々な可能性を紹介したが、その世界までの過渡期を生きる
私たちの責任は重い。私たちの選択一つで将来の形は大きく変容しう
る。
しかし、AIは未だ人間の学習環境の設計のもとを離れていない。現
在もAIは人間の指定した目標に従って最適化、学習が行われている。
（それでもAIが想定外の行動をすることはあるが）
ただし、人間によるモデル設計という最低限の制約はいつでもなくな
りうる。その制限が外れた時、AIは急激に変容し予測不可能になる。
いずれにせよ、AIについての正しい知識を身に着けることは非常に
重要である。本展示を通して、皆さんが少しでもAIに関する理解を深め
る一助となったのであれば、部員一同の努力も報われるというものだ。
AIによってどのように社会が変革し
ていくのか、楽しみですね！


# Page. 39

![Page Image](https://bcdn.docswell.com/page/GJ5M9QVDJ4.jpg)

HⅡB
「ロボット研究部の日常」
へお進みください！


