脇田康希学位論文公聴会スライド 着桟操船の自動化に向けた人工ニューラルネットワークを用いた船舶操縦モデルと軌道追従制御

>100 Views

July 30, 26

スライド概要

profile-image

大阪大学 工学研究科 地球総合工学専攻 船舶海洋工学部門 船舶知能化領域です. 研究室の発表スライドなどを共有します. We are Ship Intelligentization Subarea, Dept. of Naval Architecture & Ocean Engineering, Div. of Global Architecture, Graduate School of Engineering, Osaka University.

シェア

またはPlayer版

埋め込む »CMSなどでJSが使えない場合

ダウンロード

関連スライド

各ページのテキスト
1.

2025-1-24 着桟操船の⾃動化に向けた ⼈⼯ニューラルネットワークを⽤いた 船舶操縦モデルと軌道追従制御 脇⽥ 康希 船舶知能化領域

2.

⽬次 2 l 1章:序章 l 2章:事前知識 l 3章:ANNを⽤いた操縦モデルの推定⼿法について l 4章:ANNを⽤いた操縦モデル推定のためのデータ拡張⼿法につ いて l 5章:RLを⽤いた軌道追従制御の獲得⼿法について l 6章:総括 2

3.

3 ⽬次 l 1章:序章 l 研究背景 l 研究⽬的 l 2章:事前知識 l 3章:ANNを⽤いた操縦モデルの推定⼿法について l 4章:ANNを⽤いた操縦モデル推定のためのデータ拡張⼿法につ いて l 5章:RLを⽤いた軌道追従制御の獲得⼿法について l 6章:総括 3

4.

4 1章:研究背景 ⾃動運航船のための⾃動着桟操船に関する研究 ⾃動運航船(MASS) 着桟操船の⾃動化 l 研究開発が活発化 l 着桟操船の定義 l 利点 l ⼈件費の削減 l 安全性の向上 l 運航の効率化 l 実証実験 l MEGURI2040 l アプローチ操船 l 着岸操船 l 着桟操船の難しさ l 操船の複雑さ l 外乱影響の強さ l 障害物との近さ Fig. 4 : 着桟操船軌道の例 船員への負担が⼤きい Agnes N. Mwange, Yoshiki Miyauchi, Taichi Kambara, Hiroaki Koike, Kazuyoshi Hosogaya, & Atsuo Maki. (2024). Quantitative Evaluation of Full-Scale Ship Maneuvering Characteristics During Berthing and Unberthing. 4

5.

5 1章:研究⽬的 ⾃動着桟操船のための 操縦モデルの推定と追従制御則の獲得 学位論⽂で取り組む内容 想定する問題設定 l ⾃動着桟に必要な技術要素 l 着桟操船を想定 l 操船制御アルゴリズム l 低船速+標準船速のい ずれにも対応すること が必要 l 航路計画 l 追従制御 l 状況認識技術 l シミュレーション環境 l 既存船舶を想定 l 操縦モデル l 外乱モデル l 3,4章:⼈⼯ニューラルネットワーク (ANN)を⽤いた操縦モデルの推定⼿法 l 5章:強化学習(RL)を⽤いた軌道追従制 御⽅策の獲得⼿法 l 実船データが利⽤可能 Fig. 5 : 与えられた計画 軌道とその追従 結果の例 l 多様な船 (アクチュエータ構成) に適⽤可能であるこ とが望ましい 5

6.

6 ⽬次 l 1章:序章 l 2章:事前知識 l 座標系と操縦運動⽅程式 l 供試船1 l 供試船2 l 3章:ANNを⽤いた操縦モデルの推定⼿法について l 4章:ANNを⽤いた操縦モデル推定のためのデータ拡張⼿法につ いて l 5章:RLを⽤いた軌道追従制御の獲得⼿法について l 6章:総括 6

7.
[beta]
7

2章:座標系と操縦運動⽅程式

⾵外乱を考慮した平⽔中における
surge-sway-yawの操縦運動を考える
座標系(供試船2)

Variables
𝜼
𝒙
𝝂

𝒖

𝒘&

Fig. 7 : 座標系

𝒘'

Description

𝑥! , 𝑦!

ミドシップの位置座標

𝜓

回頭⾓

𝑢, 𝑣"

ミドシップの縦・横速度

𝑟

回頭⾓速度

𝛿# , 𝛿$

Port側とStarboard側の
舵⾓

𝑛#

プロペラ回転数

𝑛%&

バウスラスタ回転数

𝑈&

真⾵速

𝜉&

真⾵向

𝑈'

相対⾵速

𝛾'

相対⾵向

操縦運動⽅程式
l

以下のODEに従うと仮定
cos 𝜓 −sin 𝜓 0
𝜼̇ = sin 𝜓 cos 𝜓 0 𝝂
0
0
1
𝝂̇ = 𝑭 𝑵, 𝑼, 𝑾!
⇒ 𝒙̇ = 𝒇 𝑿, 𝑼, 𝑾"
l 𝑿, 𝑵, 𝑼, 𝑾! , 𝑾" :
現在と過去数ステップ間の離散時
刻における𝒙, 𝝂, 𝒖, 𝒘! , 𝒘" をそれぞ
れまとめたベクトル

l

3,4章では𝑭をデータから推定
7

8.

8 2章:供試船1 ⼀軸⼀舵船の模型船(3m) l アクチュエータ構成 l プロペラ l舵 観測機器構成 l GNSS l 位置,速度を計測し, ミッドシップ座標へ変換 l Gyro l 回頭⾓と⾓速度を計測 l Anemometer l 相対⾵速⾵向を計測し, 真⾵速⾵向へ変換 l 計測周期:10 Hz Fig. 8 : 供試船1 8

9.

9 2章:供試船2 ⼀軸⼆舵船の模型船(3m) l アクチュエータ構成 l VecTwin rudder system l Bow thruster VecTwin rudder system l FPPとFishtail Rudders×2で ⾼い操縦性能を持つ l 1つのサイドスラスターがあれば さまざまな操船が可能 Fig. 9 - 2 : 着桟操船試験と4コーナーDP試験1) Fig. 9 - 1 : 供試船2 1) Kouki Wakita. Model-Based Reinforcement Learning for Trajectory Tracking Control of Autonomous Surface Ship. In The 34th International Ocean and Polar Engineering Conference, pages ISOPE–I–24–524, 06 2024. 9

10.

⽬次 10 l 1章:序章 l 2章:事前知識 l 3章:ANNを⽤いた操縦モデルの推定⼿法について l 4章:ANNを⽤いた操縦モデル推定のためのデータ拡張⼿法につ いて l 5章:RLを⽤いた軌道追従制御の獲得⼿法について l 6章:総括 10

11.

11 3章:研究背景 ANNで操縦モデルのシステム同定する ⽔槽試験による推定 システム同定 (SI) による推定 l 実船システムを直接推定し,既存船に有効な⼿法 l 船体やアクチュ Parametric Non-Parametric エータの縮尺模型 事前知識 あり なし の流体⼒を計測し, 利点 - 適切なモデルを⽤いれば - 任意のアクチュエータ構成に適 より少ないデータで推定 ⽤可能 状態と⼒の関係を 可能 - 複雑なシステムも表現できる可 能性 モデル化 モデル例 l デメリット l 試験施設が必要 l 尺度影響の可能性 - MMGモデル1) - Abkowitzモデル2) - Neural Network3) - Support Vector Machine4) - Gaussian Process5) 1) Serge Sutulo and C. Guedes Soares. Application of an offline identification algorithm for adjusting parameters of a modular manoeuvring mathematical model. Ocean Engineering, Vol. 279, p. 114328, 2023. 2) Martin A Abkowitz. Measurement of hydrodynamic characteristics from ship maneuvering trials by system identification. In Transactions of Society of Naval Architects and Marine Engineers 88, pp. 283–318, 1980. 3) L. Moreira and C. Guedes Soares. Dynamic model of manoeuvrability using recursive neural networks. Ocean Engineering, Vol. 30, No. 13, pp. 1669 – 1697, 2003. 4) W. L. Luo and Z. J. Zou. Parametric Identification of Ship Maneuvering Models by Using Support Vector Machines. Journal of Ship Research, Vol. 53, No. 01, pp. 19–30, 03 2009. 5) Yifan Xue, et al. System identification of ship dynamic model based on gaussian process regression with input noise. Ocean Engineering, Vol. 216, p. 107862, 2020. 11

12.

3章:研究⽬的 12 ANNを⽤いた(低速)操縦モデル推定⼿法の提案 l 訓練⼿法の改善 l ノイズが⼊りやすい加速度の観測値を必要としない,位置や速度の予測誤差の最 ⼩化による操縦モデルの推定⼿法を提案し,模型船データで有効性を検証した. l データ収集⽅法の改善 l ジグザグ操船や旋回操船データが⽤いられてきたが,低速操縦運動の効率的な計 測のためにランダム操船試験を追加し,模型船データで有効性を検証した. l RNNモデルの⽐較 l 従来,操縦モデル推定に⽤いられたRNNモデルには2種類存在し,考慮する履歴 ⻑さが異なる.それらの2種類のRNNモデルの精度⽐較を模型船データで⾏う. 12

13.

3章:順伝播型ニューラルネットワーク (FNN) 13 代表的な機械学習モデル FNNの基本構造 l 「線形変換」と「⾮線形変換」の繰り返し で構成される多⼊⼒多出⼒関数 𝒚 = 𝒇𝜽 𝒙 𝒉" = 𝒈" 𝒃" + 𝑾" ⋅ 𝒙 𝒉# = 𝒈# 𝒃# + 𝑾# ⋅ 𝒉" ⟹ ⋮ 𝒚 = 𝒈$ 𝒃$ + 𝑾$ ⋅ 𝒉$%" l 利点 𝑾# ∈ 𝜽:重み⾏列 𝒃# ∈ 𝜽:バイアス項, 𝒈# :活性化関数 (e.g. tanh関数,ReLU関数) l 普遍的な近似能⼒ l ⼤規模データに適⽤可能 13

14.

14 3章:回帰型ニューラルネットワーク (RNN) 履歴を内部状態として記憶するNNモデル RNN層 l 前時間ステップの 出⼒を再度⼊⼒に とる 無限インパルス応答 有限インパルス応答 (IIR)型 (FIR)型 l 全ての履歴を継承 𝒚! 4層⽬ l 𝑁. ステッ プだけ履歴 を継承 2層⽬ 2層⽬ Fig. 14 : RNN unit 𝒛!"#,# 𝒙! 4層⽬ 3層⽬ 3層⽬ 1層⽬ 𝒚! 𝒛!,# 1層⽬ 𝒙!"%"&# ⋯ 1層⽬ 1層⽬ 𝒙!"# 𝒙! 14

15.

15 3章:回帰分析ベースの⼿法 ⼊出⼒関係を直接推定する RNNモデルを通した加速度の予測 𝒗˙ 𝑡( 𝒗˙ 𝑡# 𝝂̇ ' 𝑡( 𝝂̇ ' 𝑡# 𝐹' 𝝂 𝑡( 𝒖 𝑡( 𝒘) 𝑡( 𝒛(,* 観測値 ⋯ a ⋯ 𝒗˙ 𝑡! 𝝂̇ ' 𝑡! 𝒛#,* 𝒛!"#,* RNN𝐹モデル or FNNモデル ⋯ 𝐹' ' 𝝂 𝑡# 𝒖 𝑡# 観測値 ⋯ 𝒘) 𝑡# 𝝂 𝑡! 𝒖 𝑡! 𝒘) 𝑡! 損失関数 l 加速度の予測誤差 ℒ ("#$) 𝜃 1 ) , = ∑&'( 𝒗˙ 𝑡& − 𝝂̇ * 𝑡& 𝑾 𝒗˙ 𝑁 l 𝑾𝒗˙ :成分毎の分散の逆数を対⾓ 成分に持つ⾏列 l 加速度の観測値を必要とする 15

16.
[beta]
16

3章:軌道推定ベースの⼿法

位置や速度の予測軌道と観測軌道の誤差を最⼩化
RNNモデルを通した座標と速度の予測 損失関数
𝒙 𝑡(

𝒙観測値
𝑡⋯

𝒙 𝑡#
𝒙' 𝑡#

𝒙' 𝑡-

Δ𝑡

Δ𝑡
𝒙̇ ' 𝑡#

𝒙̇ ' 𝑡(
𝑓'
𝒙' 𝑡(
𝒖 𝑡(
𝒘) 𝑡(

𝒛(,*

⋯

𝒙 𝑡!

𝒙 𝑡!&#

𝒙' 𝑡!

𝒙' 𝑡!&#
Δ𝑡

⋯

𝒙̇ ' 𝑡!

𝒛#,*
𝒛!"#,*
⋯
RNN𝑓モデル
or FNNモデル
𝑓'
'
𝒙' 𝑡#
𝒖 𝑡#
⋯
観測値
𝒘) 𝑡#

𝒙' 𝑡!
𝒖 𝑡!
𝒘) 𝑡!

l 位置と速度の予測誤差
ℒ (0123) 𝜃
1 89:
=
= ∑567 𝒙 𝑡5 − 𝒙; 𝑡5 𝑾
𝒙
𝑁
l 𝑾𝒙 :成分毎の分散の逆数
を対⾓成分に持つ⾏列

l 加速度の計測値を必要と
しない
16

17.

17 3章:検証実験のための模型試験データ ランダム操船試験を導⼊した l 供試船 l ⼀軸⼀舵船(供試船1) を使⽤した l 試験内容 l T:旋回試験 l Z:ジグザグ試験 l R:ランダム操船試験 l B:着桟試験 (⼿動制御) Fig. 17 - 1 : 供試船1 Fig. 17 - 2 : ランダム操船試験結果 Fig. 17 - 3 : アクチュエータ状態のヒストグラム 17

18.

18 3章:検証実験内容 5パターンの実験を実施した l Type-1,2の⽐較 l 履歴の⻑さによる精度の違いを⽐ 較する. l Type-1,3の⽐較 l 訓練⼿法の違いによる予測精度の 違いを⽐較する. l Type-1,4,5の⽐較 l FIR-RNN:有限インパルス型RNN l 与えられるデータ集合の違いによ l IIR-RNN:無限インパルス型RNN る予測精度の違いを⽐較する. l Regression:回帰分析ベースの⼿法 l Trajectory estimation: l MMGモデルとの⽐較 軌道推定ベースの⼿法 l ⼿法の有効性を確認する. 18

19.

19 3章:検証実験結果 訓練⼿法の⽐較 l 軌道推定ベースの⼿法 により予測精度の向上 軌道推定ベース 回帰分析ベース ※評価指標はℒ (/012) 𝜃 , (つまり位置と速度の誤差) Fig. 19 : 操縦運動予測結果 19

20.

20 3章:検証実験結果 RNNモデルの⽐較 l 予測誤差:FIR < IIR 有限インパルス 無限インパルス 訓練データ集合の⽐較 l データ増で精度向上 l R(TZ)で訓練→ R(TZ)の精度向上 l Rの追加→Bの精度向上 データ量が⼤ より⻑い期間の履歴影響を考慮 することが,必ずしも予測精度 を向上させるわけではない ランダムなし ランダムあり - 訓練データと分布の近い運動の予測精度が⾼くなる - Rにより低速操縦を含むBの精度が向上している 20

21.

21 3章:検証実験結果 MMGモデルとの⽐較 l ⽐較したMMGモデル l 拘束模型試験と経験式 l 予測誤差 l TZR:RNN < MMG l B2:RNN < MMG l B1, B3:RNN > MMG Fig. 21 - 1 : B1の予測結果 Fig. 21 - 2 : B2の予測結果 最も良いType l 分布が近い訓練データ が与えられれば, MMGモデルより⾼精 度な予測が可能になる Fig. 21 - 3 : B3の予測結果 21

22.

3章:結⾔ 22 ANNを⽤いた(低速)操縦モデル推定⼿法の提案 l 訓練⼿法の改善 l 加速度の観測を必要としない軌道推定ベースの訓練⼿法を RNN を⽤いた操縦モデルへ導 ⼊し,従来の回帰分析ベースの訓練⼿法によるものと⽐較して予測精度が向上すること を⽰した. l データ収集⽅法の改善 l 低速操縦運動の予測精度向上のため,ランダム操船試験を訓練データに追加した.その 結果,低速操縦運動を含む着桟操船軌道の予測精度が向上することをしめした. l RNNモデルの⽐較 l 2種類のRNNモデルを⽐較し,より⻑い期間の履歴影響を考慮することが必ずしも予測 精度を向上させるわけではないことを⽰した. l 分布が近い訓練データが与えられれば,MMGモデルより⾼精度に (低速)操縦運動を予測できる. 22

23.

⽬次 23 l 1章:序章 l 2章:事前知識 l 3章:ANNを⽤いた操縦モデルの推定⼿法 l 4章:ANNを⽤いた操縦モデル推定のためのデータ拡張⼿法 l 5章:RLを⽤いた軌道追従制御の獲得⼿法 l 6章:総括 23

24.

24 4章:研究背景 必ずしも⾼精度な操縦モデルが得られるわけではない データへの依存性 l 3章では,ANNにより ⾼精度で操縦モデルを 推定できる可能性を⽰ した l しかし,利⽤可能な データによって推定精 度が変化する l Non-Parametric SIは特 に依存しやすい 着桟操船のためを想定 l 必要なデータの多さ l 低船速と標準船速のデータが必要 l 低速操船のパターンの多さ(後進,逆転) l データ収集コストの⾼さ l 実船試験(海上公試など)で収集 l 運航時に収集 l 必ずしも⼗分なデータが利⽤可能とは 限らない 24

25.

25 4章:研究⽬的 予測精度向上のためデータ拡張技術を導⼊ データ拡張 研究スコープ l 合成データを⽣成することでデータ を増やす⼿法 ANNを⽤いた着桟操船の ための操縦モデルの推定 精度向上のため l 時系列データへの適⽤例 1) l jittering, rotation, scaling, magnitude warping, slicing, permutation, time warping, etc. すべての⼿法が有効なわけではない 1) B.K. Iwana, S. Uchida, An empirical survey of data augmentation for time series classification with neural networks, PLOS ONE 16(7), 1 (2021) l 有効なデータ拡張⼿法 を⽰す l データ拡張⼿法の有効 性を⽰す 25

26.

26 4章:使⽤するデータ形状について 基準となるデータ集合 l 必要なデータは⼀定⻑さの時系列の集合 where 𝒟 (/012) = 𝑿4,* , 𝑼4,* , 𝑾7,4,* *8#,⋯,% 𝒙5 𝑡* , 𝒙5 𝑡* + Δ𝑡 , ⋯ , 𝒙5 𝑡* + (𝐾 − 1)Δ𝑡 5 ∈ ℝ64 𝑼4,* = 𝒖5 𝑡* , 𝒖5 𝑡* + Δ𝑡 , ⋯ , 𝒖5 𝑡* + (𝐾 − 1)Δ𝑡 5 ∈ ℝ%#4 𝑿4,* = 𝑾7,4,* = 5 5 𝒘5 7 𝑡* , 𝒘7 𝑡* + Δ𝑡 , ⋯ , 𝒘7 𝑡* + (𝐾 − 1)Δ𝑡 5 ∈ ℝ-4 Optimize Parameters Fig. 26 - 1 : 操縦モデルの推定⽅法 l 試験データを⼀定⻑さの部分列に 切り分けてデータ集合を⽤意する l この⽅法のデータ集合を𝒟 (/01) と表記 Fig. 26 - 2 : 時系列データの切り分け⽅法 26

27.
[beta]
27

4章:データ拡張⼿法

JitteringとSlicingを導⼊する
Slicing 1,2) l 重複して時系列を抜き出す
𝒟 ()*+) =

()*+)

()*+)

()*+)

𝑿$,&,' , 𝑼$,&,' , 𝑾",$,&,'
()*+)
𝑿$,&,' =
()*+)
𝑼$,&,' =

where

$* 5$
'12,3,…, )6

&13,0,…,/
𝒙 𝑡& + 𝑖𝑆Δ𝑡 , 𝒙 𝑡& + (𝑖𝑆 + 1)Δ𝑡 , ⋯ , 𝒙- 𝑡& + (𝑖𝑆 + 𝐾 − 1)Δ𝑡

-

∈ ℝ.$

𝒖- 𝑡& + 𝑖𝑆Δ𝑡 , 𝒖- 𝑡& + (𝑖𝑆 + 1)Δ𝑡 , ⋯ , 𝒖- 𝑡& + (𝑖𝑆 + 𝐾 − 1)Δ𝑡

-

∈ ℝ/($

()*+)

𝑾",$,&,' = 𝒘" 𝑡& + 𝑖𝑆Δ𝑡 , 𝒘" 𝑡& + (𝑖𝑆 + 1)Δ𝑡 , ⋯ , 𝒘" 𝑡& + (𝑖𝑆 + 𝐾 − 1)Δ𝑡

-

∈ ℝ0$

Jittering 3) l ノイズを加える
𝒟 (9+:) =

where

()@A)

()@A)

()@A)

𝑿$,&,' + 𝑬7 , 𝑼𝑲,&,' , 𝑾",$,&,'
𝑬7 ∼ 𝒩 𝟎, diag

(9+:) 0
𝜎8+
,

'12,3,⋯, $)*/$ 53
(9+:) 0
𝜎;+
,

&13,⋯,/,713,0,⋯,E

(9+:) 0
𝜎<
,

(9+:) 0
𝜎=
,

(9+:) 0
𝜎>,
,

(9+:) 0
𝜎?

1) A. Le Guennec, et. al, Data Augmenta3on for Time Series Classifica3on using Convolu3onal Neural Networks. in ECML/PKDD Workshop on Advanced Analy:cs and Learning on Temporal Data (2016)
2) Z. Cui, et. al. Mul3-scale convolu3onal neural networks for 3me series classifica3on, (2016)
3) T.T. Um, et. aĺ, Data augmenta3on of wearable sensor data for parkinsons disease monitoring using convolu3onal neural networks. in Proceedings of the 19th ACM Interna:onal Conference on Mul:modal Interac:on, (2017)

27

28.

28 4章:検証実験について 模型実験によりデータ拡張⼿法の検証を実施 l Feedforward NNを使⽤ l ⼊⼒変数を訓練データで標準化 l 中間層が4層 l 軌道推定ベースの⼿法を使⽤ l ただし,評価関数は L M2 N(O9:)PM 1 ℒ (0123) 𝜽 = , 𝒙(𝑡) − 𝒙𝜽(𝑡) =𝑾3 d𝑡 + 𝜆‖𝜽‖= 𝑁 M6M2 K6: l ミニバッチ学習と勾配降下法(Adam)で最適化を実施 l Validationデータに対して最⼩なパラメータを選択 28

29.

29 4章:検証実験のための模型試験データ ランダム操船試験を実施した 離着桟操船の実運航データ1)との⽐較 l 供試船 l ⼀軸⼆舵船 (供試船2) を使⽤した 1) Yoshiki Miyauchi, Taichi Kambara, Naoya Umeda, Kazuyoshi Hosogaya, and Astuo Maki. Statistical analysis of port navigation and maneuver of a japanese merchant vessel. In Conference proceedings, the Japan Society of Naval Architects and Ocean Engineers, Vol. 35, pp. 77-87, 2022. (in Japanese). Fig. 29 - 1 : 供試船2 l 試験内容 l ランダム操船試験 l 着桟試験 (⼿動制御) Fig. 29 - 2 : 離着桟操船とランダム操船のデータ分布の⽐較 29

30.

30 4章:検証実験内容 8つの訓練データ集合を⽤意して⽐較する 2301.8 (s) 2301.8 (s) 2301.8 (s) 2301.8 (s) 2301.8 (s) 2301.8 (s) 2301.8 (s) 4603.6 (s) 1201.2 (s) 1201.2 (s) 200.0 (s) l 観測周波数:1 (Hz) l 𝒟 (0123) はSlicingで2倍 のデータ量に拡張さ れた集合を意味する. l 𝒟 (56078) は2倍の観測 データ量を持つ集合 を意味する. 30

31.

4章:検証結果(テストデータに対する予測精度) 31 データ拡張によりテストデータの予測精度が向上 乱数への依存性をみるため ー>乱数を変更して10回繰り返し計算 l SlicingまたはJitteringに より評価関数値が減少して いる l 併⽤も可能である Fig. 31 : Testデータセットの評価関数値 l 観測データ量が2倍のデー タセットの評価関数値が最 も⼩さくなっている 31

32.

4章:検証結果(テストデータに対する予測精度) 32 データ拡張で減らせなかった誤差 100 (s) 毎に初期化 Fig. 32 - 1 : Testデータセットにおける状態量の予測結果 Fig. 32 - 2 : Testデータセットにおける状態量の予測結果 32

33.

33 4章:検証結果(推定誤差の要因) 外挿⼊⼒が誤差の発⽣要因の⼀つ Fig. 33 - 2 : ⾵速⾵向の2Dヒストグラム l 外挿⼊⼒ではデータ拡張により性能が向上しなかった l Fig. 33 - 1 : Testデータセットの⼊⼒時系列 SlicingとJitteringではどの観測データからも離れたデータは 合成することができない 33

34.

4章:検証結果(着桟データに対する予測精度) 34 着桟操船データには外挿なし Fig. 34 - 1 : ⾵速⾵向の2Dヒストグラム Fig. 34 - 2 : 訓練データ集合とテストデータ集合のデータ分布 34

35.

4章:検証結果(着桟データに対する予測精度) 35 着桟操船では, 𝒟 ("#$%&) に⽐べて⼤きく劣ることはなかった l あ Fig. 35 : テストデータ(着桟操船)の予測結果 35

36.

4章:検証結果(着桟データに対する予測精度) 36 着桟操船では, 𝒟 ("#$%&) に⽐べて⼤きく劣ることはなかった Fig. 36 : テストデータ(着桟操船)の予測結果 36

37.

4章:結⾔ 37 ANNの操縦モデル推定⼿法にデータ拡張技術を導⼊ l 模型試験データを⽤いた検証結果から以下を⽰した l Slicing,Jittering及びその併⽤が予測精度を向上させた l しかし,2倍の観測データを含む訓練データを超えることはなく,これは SlicingとJitteringが外挿⼊⼒に対する予測精度を向上させる効果がないこ とが理由であった l ただし,外挿が少ない着桟データに対しては, 2倍の観測データを含む訓 練データから⼤きく劣ることはなかった l 課題 l データ分布に対する予測精度の依存度が⾼いまま l データ収集⽅法(ランダム操船)が⼿動で実施されており,再現性に⽋ける 37

38.

⽬次 38 l 1章:序章 l 2章:事前知識 l 3章:ANNを⽤いた操縦モデルの推定⼿法について l 4章:ANNを⽤いた操縦モデル推定のためのデータ拡張⼿法につ いて l 5章:RLを⽤いた軌道追従制御の獲得⼿法について l 6章:総括 38

39.

39 5章:研究背景 強化学習(RL)で軌道追従制御⽅策を獲得する 着桟操船制御 ⽬的とする軌道追従制御 l 軌道計画と追従制御で取り組 まれることが多い l 着桟のための追従制御⽅策 l l 仮想線とPD制御2) l 最適軌道計画とDPS3) l ベジェ曲線とPure Pursuit4) 最適軌道計画とPD制御1) l 着桟のための追従制御⽅策の 獲得⼿法の確⽴を⽬指す 1) 2) 3) 4) Kouichi Shouji et al, A Study on the Optimization of Ship Maneuvering by Optimal Control Theory (1st Report), Journal of the Society of Naval Architects of Japan, Vol 1993, No. 173, pp. 221-229, 1993. Y.A. Ahmed et al. Consistently trained artificial neural network for automatic ship berthing control. TransNav, the International Journal on Marine Navigation and Safety of Sea Transportation, Vol. 9, No. 3, pp. 417–426, 2015. Andreas B. Martinsen, et al. Optimization-based automatic docking and berthing of asvs using exteroceptive sensors: Theory and experiments. IEEE Access, Vol. 8, pp. 204974–204986, 2020. Ryohei Sawada et al. Path following algorithm application to automatic berthing control. Journal of Marine Science and Technology, Vol. 26, No. 2, pp. 541–554, 2021. l 標準船速と低船速への対応 l 後進,旋回,クラビングなどの特殊操船 を実現 l 外乱下で追従誤差を⼩さく保つ l RLを⽤いて獲得する l 不確実性を考慮し,最適な制御⽅策を獲 得可能 l 価値関数と⽅策関数をFNNで表すことで 複雑なアクチュエータ構成へ対応可能 39

40.

40 5章:研究⽬的 着桟のための軌道追従制御⽅策の獲得⼿法の提案 モデルベースRL 提案⼿法の特徴 l 操縦シミュレーション 環境を構築する l 軌道追従制御としてのRL⼿法 l シミュレーション上で 軌道追従制御⽅策の訓 練を実施する Action (Control inputs) Environment Model Maneuvering Model Wind model Agent Actuator model Observation and Reward l 参照軌道の⾃動⽣成⼿法 l 報酬関数と状態変数の設計⼿法 l 障害物の考慮 l 障害物の⾃動⽣成⼿法 l 報酬関数と状態変数の設計⼿法 l 操縦モデル推定(3,4章)との統合 l 操縦運動データのみから制御⽅策を獲得する⼿法 40

41.

41 5章:強化学習概要 累積報酬を最⼤化する⾏動⽅針を学習する枠組み l システムはMDPを仮定される MDP:マルコフ決定過程 l 期待割引累積報酬 Table : MDPの構成要素 𝒔 状態変数 𝒂 ⾏動変数 𝑝 𝒔-./ ∣ 𝒔- , 𝒂- 状態遷移モデル 𝑟 𝒔-./ , 𝒔- , 𝒂- 報酬関数 𝛾 割引率 ⽬的関数 O9: 船舶の操船 制御問題と して定式化 する l 本研究では,TD3により最適 ⽅策を学習する 𝐽𝝁 = 𝐸S∼U𝝁 , 𝛾 59:𝑟 𝒔5N:, 𝒔5 , 𝒂5 where 56: 𝜏 = 𝒔& , 𝒂& , … , 𝒔'%" , 𝒂'%" , 𝒔' , '%" 𝜌𝝁 = 𝑝 𝒔& @ 𝑝 𝒔)+" ∣ 𝒔) , 𝝁 𝒔) )*" 𝒂 = 𝝁(𝒔) 41

42.

42 5章:提案⼿法の概要 軌道追従制御問題をMDPとしてモデル化 以降のスライドで説明 l 操縦運動のシミュレーション環境 Table : MDPの構成要素 𝒔 状態変数 𝒂 ⾏動変数 𝑝 𝒔!&# ∣ 𝒔! , 𝒂! 状態遷移モデル 𝑟 𝒔!&# , 𝒔! , 𝒂! 報酬関数 𝛾 割引率 l 操縦モデル l アクチュエータモデル l ⾵外乱モデル l 軌道追従制御問題 l 状態変数の定義 l 参照軌道の⽣成⽅法 l 報酬関数の定義 l 障害物の考慮 l 状態変数の定義 l 障害物の⽣成⽅法 l 報酬関数への追加ペナルティ 42

43.
[beta]
43

5章:操縦運動のシミュレーション環境

操縦モデル

アクチュエータモデル

l 以下のODEで表される

l 回転数と舵⾓の変化率を⼀定に
固定

cos 𝜓 −sin 𝜓 0
𝜼̇ = sin 𝜓 cos 𝜓 0 𝝂
0
0
1
𝝂̇ = 𝑭 𝝂, 𝒖, 𝒘,
l 𝑭 はMMG or FNNモデルによって表される.

⾵外乱モデル 1)

(act)
𝐾;
𝑦̇ = 𝐾;(act) (𝑟 − 𝑦)/𝜖
(act)
−𝐾;

for 𝜖 ≤ 𝑦
for − 𝜖 < 𝑟 − 𝑦 < 𝜖
for 𝑦 ≤ −𝜖

⾏動変数𝒂は状態ではなく指⽰値

l 以下の確率微分⽅程式で表される
'9 d𝑡 + 𝜎: d𝑊
d𝑈9 = 𝛼: 𝑈9 − 𝑈
!
d𝜉9 = 𝛼; 𝜉9 − 𝜉9̅ d𝑡 + 𝜎; d𝑊
l 係数は⾵速スペクトルから決定
1) Atsuo Maki, Yuuki Maruyama, Leo Dostal, Masahiro Sakai, Ryohei Sawada, Kenji Sasa, and Naoya Umeda.
Practical method for evaluating wind influence on autonomous ship operations. Journal of Marine Science and
Technology, Vol. 27, pp. 1302–1313, 12 2022.

Fig. 43 : 舵⾓変化のシミュレーション例
43

44.

44 5章:状態変数の定義 追従誤差と船体速度状態,外乱状態を観測する 追従誤差 l 参照軌道𝜼(/01) (𝑡)が与えられた時,追従誤差は 𝒔(U#/) = (U#/) W 𝒆V , (U#/) W 𝒆 X: , (U#/) W 𝒆 X; ,⋯, (U#/) W 𝒆 X< W where (U#/) 𝒆X (𝑡) = 𝑹Y( (𝜼(𝑡)) 𝜼(U#/) (𝑡 + 𝑇) − 𝜼(𝑡) l 検証実験では𝑇678,:,… は5,10,20,40 (s)を使⽤ l 状態変数は𝒔 = (/01) 3 𝒔 , 𝝂4 , 𝒖4 , 𝒘45 Fig. 44 : 追従誤差 4 のように定義される 44

45.

45 5章:参照軌道の⽣成 着桟操船でとり得る軌道を⽣成 l 定点保持軌道 Constant pose Random maneuver 𝒙(\]^) (𝑡) = (0,0,0,0,0,0)_ l ランダム操船軌道 l ランダムに制御⼊⼒が決定 された操縦運動軌道 VecTwin舵(供試船2)の場合 l ホバー⾓付近でランダムに選択 →低速運動を中⼼に l ゼロ舵⾓付近でランダムに選択 →前進運動を中⼼に Fig. 45 : 訓練時における参照軌道と追従制御の様⼦ 45

46.

46 5章:報酬関数の定義 (報酬関数)=(正の定数)ー(追従誤差ペナルティ) 追従誤差ペナルティ l エピソード終了条件 (./0) l 𝑒 (<=>) と𝑒 (1?@) の閾値は 時間経過により減少さ せる 𝒆& をスカラに変換する必要 がある (IJ)) l 例)重み付きノルム 𝒆2 l K 船⾸(船尾)の直線距離を使⽤ l 重みが不要 Fig. 46 - 1 : 追従誤差の測度 Fig. 46 - 2 : (𝑒 (AFG) + 𝑒 ():H) )/2の等値線図 Fig. 46 - 3 : 追従誤差閾値の時間減少 46

47.

47 5章:静的障害物の考慮 参照軌道に応じて障害物を⾃動⽣成 擬似障害物の⽣成⼿法 l 𝑥& 𝑦& 平⾯を格⼦点で区切る. l ⼀辺の⻑さは2𝐿)L+M l 初期位置座標が格⼦点の⼀つ l 参照軌道が通過する区間を選択する l 通過しなかった区間を全て障害物とする 障害物に関する状態変数 l 障害物との距離は (obs) 1 0 0 𝒆! (𝑡) = 𝒐(near) (𝑡 + 𝑇) − 𝜼(𝑡) 0 1 0 l ただし,𝒐(2/34) は𝜼(./0) から最も近い障害物点 𝒐(#$%&) (𝑡) = argmin 𝒐 − 𝒐∈* 1 0 0 (+$,) 𝜼 (𝑡) 0 1 0 l 障害物に関する状態変 数は 𝒔(obs) = (obs) 𝒆! " (obs) , 𝒆#! " (obs) , 𝒆#" " (obs) , ⋯ , 𝒆## 障害物を考える場合,状態変数は Fig. 47 - 1 : 擬似障害物の⽣成⼿順 𝒔= 𝒔(+$,) - , 𝒔(./,) - , 𝝂0 , 𝒖0 , 𝒘01 0 のように定義 " " Fig. 47 - 2 : 𝜼(IJ)) から最も近い障 害物点(𝒐(HJNO) ) 47

48.
[beta]
48

5章:静的障害物に関する報酬関数

(報酬関数)=(正の定数)ー(追従誤差ペナルティ)
ー(障害物に近づく追従誤差ペナルティ)
追加ペナルティ

エピソード終了条件

l

l 𝑐 (<=>) と𝑐 (1?@) の閾値は
時間経過により減少さ
せる

仮想障害物線(IOL)との
距離を考慮する
l 𝑙 (IJ)) (𝑡):
参照位置とIOLとの距離
l 𝑙 (AFG) (𝑡):
船⾸位置とIOLとの距離
l 𝑙 ():H) (𝑡):
船尾位置とIOLとの距離

𝑐 (2.3)

l

参照状態より𝒐(2/34) に

近ずくと以下のペナル
ティを加える
𝑙(+$,) (𝑡) − 𝑙(/.4) (𝑡)
0,
𝑙(+$,) (𝑡)
𝑙(+$,) (𝑡) − 𝑙(,2#) (𝑡)
(,2#)
𝑐
(𝑡) = max 0,
𝑙(+$,) (𝑡)

(%&')

𝑐 (%&') (𝑡) = 𝑐!

(%&')

− 𝑐)

(%&')

exp −𝜆* 𝑡 + 𝑐)

𝑐 (/.4) (𝑡) = max

Fig. 48 - 1 : 追従誤差の測度

Fig. 48 - 2 : 閾値の時間減少

48

49.

49 5章:検証実験 2つの実験を実施 MMGモデルを⽤いた実験 操縦運動データを⽤いた実験 l 検証⽬的 l 検証⽬的 l 追従制御として有効か? l 着桟軌道の追従に有効か? l 検証⽅法 l MMGモデルでシミュレーショ ン環境を構築 l シミュレーション環境(MMG) で軌道追従制御⽅策を学習 l シミュレーション環境(MMG) と実環境(模型試験)で検証 l データのみから追従制御⽅策を獲得可能 か? l 検証⽅法 l シミュレーション環境(MMG)から操縦運 動データを収集 l 操縦モデルをFNNで推定し,シミュレー ション環境を構築 l シミュレーション環境(FNN)で追従制御 ⽅策を学習 l シミュレーション環境(MMG)で検証 49

50.

50 5章:MMGモデルを⽤いた検証実験 2つの⽅策を訓練し,着桟軌道の追従実験を実施 実験設定 着桟軌道 l l Ctrl-w/o-OBST :追従制御⽅策 l 状態変数 𝒔(+$,) 𝒔= l - , 𝝂0 , 𝒖0 追従誤差 報酬関数 :+ 𝑒 (/.4) 𝑡5 + 𝑒 (,2#) 𝑡5 𝑎8 − 𝑢;,8 ≡2− − 𝜆 K 𝑢,2+,8 𝑒 (2.3) 𝑡5 𝑟 𝑠567 , 𝑠5 , 𝑎5 追従誤差ペナルティ l 宮内ら1)の着桟軌道計画⼿法によ り⽣成 l l 0 = 897 制御コスト Fig. 50 - 1 : 訓練時の 累積報酬 l 1) Yoshiki Miyauchi, et al. Optimization on planning of trajectory and control of autonomous berthing and unberthing for the realistic port geometry. Ocean Engineering, Vol. 245, p. 110390, 2022. 時間最⼩化問題としてモデル化 CMA-ESにより最適化 𝟏𝟏(初期条件) × 𝟒(終端条件)種類 の軌道を準備 Ctrl-w/-OBST :障害物を考慮した追従制御⽅策 l 状態変数 𝒔= l 𝒔(+$,) - , 𝒔(./,) 𝑟 𝑠567 , 𝑠5 , 𝑎5 ≡4− 𝑒 , 𝝂0 , 𝒖0 0 障害物 との距離 報酬関数 /.4 - 𝑡5 + 𝑒 𝑒 2.3 𝑡5 ,2# 追加ペナルティ 𝑡5 − 𝑐 (/.4) :+ 𝑡5 + 𝑐 (,2#) 𝑡5 𝑎8 − 𝑢;,8 − 𝜆 K 𝑢,2+,8 𝑐 (2.3) 𝑡5 897 = Fig. 50 - 2 : 得られた最適着桟軌道 50

51.

l いずれも初期誤差を吸収で きている l ⽅位誤差を⼀時的に増加させ て誤差を吸収している l いずれも着桟点付近で船速 をほとんどゼロに的ている Ctrl-w/o-OBST 無⾵状態の追従結果 Ctrl-w/-OBST 5章:MMGモデルを⽤いた検証実験 51 l ただし,Ctrl-w/o-OBSTは衝 突してしまっている. 訓練環境で期待通りに機能する 軌道追従制御⽅策が得られている Fig. 51 : 着桟軌道の無⾵状態における追従結果 (左:⼊⾈,右:出船) 51

52.

52 5章:MMGモデルを⽤いた検証実験 衝突確率の⽐較結果 l 衝突確率の算出⽅法 l 終端条件と平均⾵速毎に確率を算出 l 初期追従誤差と平均⾵向を 確率的に決定 l 初期条件毎に100回(計1100回) シミュレーションを実施 衝突検知楕円の ⻑軸を0.5𝐿に変更 l 読み取れること l 平均⾵速が1.5(m/s)以上では衝突を避 けることが難しい l 𝒙^#"_,( , 𝒙^#"_,` , 𝒙^#"_,a で衝突確率の低減 l 𝒙^#"_,, でも他の終端条件と同程度の衝 突確率 障害物の考慮により着桟軌道 追従における衝突確率を低減 Fig. 52 - 1 : 最適着桟軌道 Fig. 52 - 2 : 𝜼:JOh,0の軌道 における船⾸側の衝突例 52

53.

5章:MMGモデルを⽤いた検証実験 53 模型実験結果 l 実験内容 l Ctrl-w/-OBSTを使⽤ l 𝜼5/46," , 𝜼0]1c,= の軌道 を使⽤ l 読み取れること l ⾵が穏やかであれば 着桟可能 (そうでなけ れば不可能) 実環境でも期待通りに機能する 軌道追従制御⽅策が得られている Fig. 53 : 模型実験における着桟軌道の追従結果 (左:⼊⾈,右:出船) 53

54.

54 5章:検証実験 2つの実験を実施 MMGモデルを⽤いた実験 操縦運動データを⽤いた実験 l 検証⽬的 l 検証⽬的 l 追従制御⽅策として有効か? l 着桟操船制御として有効か? l 検証⽅法 l MMGモデルでシミュレーショ ン環境を構築 l シミュレーション環境(MMG) で追従制御⽅策を学習 l シミュレーション環境(MMG) と実環境(模型試験)で検証 l データのみから追従制御⽅策を獲得可能か? l 検証⽅法 l シミュレーション環境(MMG)から操縦運動デー タを収集 l 操縦モデルをFNNで推定(4章)し,シミュレー ション環境を構築 l シミュレーション環境(FNN)で追従制御⽅策を 学習 l シミュレーション環境(MMG)で検証 ※⼆つの実験では,仮定する真のシステムが異なる 左:物理環境 右:MMGで構成されたシミュレーション環境 54

55.

5章:操縦運動データを⽤いた検証実験 55 操縦モデル推定結果 l 操縦運動データ l ランダム操船試験 l 1 (Hz),6,000 (s) l 推定⼿法 l 4章のFNNと訓練⼿法 Fig. 55 - 1 : 30°-30° zigzag maneuver. l 同⼿順(異なる乱数)で五つの操縦モデルを獲得 l 推定結果 l 標準船速から低船速に渡って,⼗分な推定精度 を持った操縦モデルを推定できている Fig. 55 - 2 : 30°-30° berthing maneuver. 55

56.

56 5章:操縦運動データを⽤いた検証実験 推定されたFNN環境で⽅策を訓練する 実験設定 追従制御⽅策 𝒔= l 2. Pure Sway 状態変数 𝒔(+$,) - , 𝝂0 , 𝒖0 , 𝒘>1 - 0 報酬関数 w Ya l Fig. 56 - 1 : 訓練時の 累積報酬 l l 1. Pure Surge 𝑒 /.4 𝑡567 + 𝑒 ,2# 𝑡567 − 𝒂5 − 𝒖 𝑡5 4. Surge + Sway 𝑟 𝒔567 , 𝒔5 , 𝒂5 ≡1− re Pu 3. l 参照軌道(着桟軌道と 4 Corner DP試験) 2𝑒 2.3 𝑡567 = 𝑹 FNN環境で訓練 l ⼀つの操縦モデルから⼀つの⽅策を訓 練し,合計5つの⽅策を訓練 MMG環境で訓練 l 同じ操縦モデルから5つの⽅策を訓練 5. Surge + Sway + Yaw Fig. 56 - 2 : 着桟操船の実運航 データ1) 1) Agnes N. Mwange, Yoshiki Miyauchi, Taichi Kambara, Hiroaki Koike, Kazuyoshi Hosogaya, & Atsuo Maki. (2024). Quantitative Evaluation of FullScale Ship Maneuvering Characteristics During Berthing and Unberthing. Fig. 56 - 3 : 4 Corner DP 試験 56

57.

5章:操縦運動データを⽤いた検証実験 57 4 Corner DP 試験 l ⾵外乱下においても,surge, sway, yawの独⽴運動および連成運動を追従可能 Mean wind Speed : 0.5 m/s Direction : Fig. 57 : 4 Corner DP 試験の追従結果 57

58.

5章:操縦運動データを⽤いた検証実験 58 着桟操船軌道の追従 l 約0.0~0.4 (m/s)のそれぞれの速度域で適切に参照軌道を追従可能 Mean wind Speed : 0.5 m/s Direction : Fig. 58 : 着桟操船軌道の追従結果 58

59.

59 5章:操縦運動データを⽤いた検証実験 乱数の異なる5つの⽅策の結果⽐較 l ほとんどの時間で追従誤差に⼤きな違いはない l FNN環境で訓練された⽅策は,⼀つのケースで0.5𝐿程度の⽐較的⼤きな追従誤差 を⽣じさせてしまっている Fig. 59 - 1 : 4 Corner DP 試験の追従誤差 Fig. 59 - 2 : 着桟操船軌道の追従誤差 59

60.

5章:結⾔ 60 RLによる軌道追従制御⽅策の獲得⼿法の提案をした l 提案した内容 l 操縦シミュレーション環境を構築し,その環境上で最適⽅策を訓練 l 軌道追従制御⽅策を得るため l ランダム操船による参照軌道の⽣成⼿法の導⼊ l 追従誤差に関する状態変数と報酬関数の定義 l 静的障害物を考慮するため l 参照軌道に応じた障害物の⽣成⼿法の提案 l 障害物との距離に関する状態変数と報酬関数の定義 l 検証実験の実施により以下を⽰した l 着桟操船軌道のような標準船速と低船速の両⽅を含む軌道を追従可能な制御⽅策を獲得 可能であること l 障害物を考慮させることで着桟操船軌道の追従実験における衝突確率が減少すること l 4章の操縦モデル推定⼿法を組み合わせることで,操縦運動データのみから軌道追従制御 ⽅策を獲得可能であること 60

61.

⽬次 61 l 1章:序章 l 2章:事前知識 l 3章:ANNを⽤いた操縦モデルの推定⼿法について l 4章:ANNを⽤いた操縦モデル推定のためのデータ拡張⼿法につ いて l 5章:RLを⽤いた軌道追従制御の獲得⼿法について l 6章:総括 61

62.

6章:総括 62 ANNを⽤いた操縦モデル推定⼿法に関して l 操縦モデルの予測精度向上のための⼿法改善に取り組んだ l 軌道推定ベースの訓練⼿法の導⼊,ランダム操船試験の導⼊,データ拡張 ⼿法の導⼊ l 適切な操縦運動データが利⽤可能であれば,⾼い精度で標準船速 および低船速の操縦運動を予測する操縦モデルが獲得可能である ことを⽰した l しかし,依然として利⽤可能なデータに対する予測精度の依存度 が⾼い l データ不⾜による不確実性を表現する操縦モデル (Under Review) l 部分的な物理モデルの利⽤によるデータ依存度の軽減 (今後のテーマ) 62

63.

6章:総括 63 RLを⽤いた軌道追従制御⽅策の獲得⼿法に関して l 着桟操船のための軌道追従制御⽅策の獲得⼿法を提案した l 軌道追従や障害物考慮のための報酬関数と状態変数の設計⼿法の提案 l 参照軌道や静的障害物⽣成⼿法の提案 l 着桟操船軌道のような標準船速と低船速の両⽅を含む軌道を追従 可能であることを⽰した l 操縦モデル推定⼿法を組み合わせることで,操縦運動データのみ から着桟操船の軌道追従制御⽅策を獲得できる可能性を⽰した 63