---
title: AI時代の時系列予測
tags: 
author: [MIKIO KUBO](https://docswell.com/user/mikiokubo)
site: [Docswell](https://www.docswell.com/)
thumbnail: https://bcdn.docswell.com/page/LELM69WM7R.jpg?width=480
description: AI時代の時系列予測} モデル・評価指標・自動機械学習（Automated Machine Learning; AutoML）・静的特徴量の実務設計
published: August 20, 26
canonical: https://docswell.com/s/mikiokubo/K7NLM7-forecast
---
# Page. 1

![Page Image](https://bcdn.docswell.com/page/LELM69WM7R.jpg)

AI 時代の時系列予測
モデル・評価指標・自動機械学習（Automated Machine Learning; AutoML）
・静的特徴
量の実務設計
久保幹雄
原口和也
MOAI Lab
2026 年 8 月
1 / 116


# Page. 2

![Page Image](https://bcdn.docswell.com/page/4JMY5Z96JW.jpg)

本講演の全体像
1
予測問題をどう設計するか
2
予測モデルの地図
3
評価指標と検証
4
古典モデルと AutoML の実装選択肢
5
データセットからモデル候補を考える
6
静的特徴量の高度な活用
7
実務で信頼できる予測へ
2 / 116


# Page. 3

![Page Image](https://bcdn.docswell.com/page/PJR936GN79.jpg)

このセクション
1
予測問題をどう設計するか
2
予測モデルの地図
3
評価指標と検証
4
古典モデルと AutoML の実装選択肢
5
データセットからモデル候補を考える
6
静的特徴量の高度な活用
7
実務で信頼できる予測へ
3 / 116


# Page. 4

![Page Image](https://bcdn.docswell.com/page/PEXQ4MX8JX.jpg)

時系列予測は「モデル選択」だけではない
予測パイプラインを構成する要素
データ設計
1
予測対象・系列キー・時間粒度
予測ホライズンと利用可能な情報
⇓
2
3
ベースラインと候補モデル
4
評価指標と時系列分割
5
計算時間・説明性・保守性
モデル比較
⇓
意思決定
精度はアルゴリズム名だけでは決まら
ない
4 / 116


# Page. 5

![Page Image](https://bcdn.docswell.com/page/3EK9ZGWLED.jpg)

大きな流れ：ローカルからグローバルへ
ローカルモデル
グローバルモデル
一系列ごとに個別学習
多数系列を一つのモデルで学習
統計モデルが中心
機械学習・深層学習が中心
短系列・少数系列で安定しやすい
商品・店舗間で情報を共有
系列間の共通パターンを利用しない
短い履歴や疎な需要にも可能性
AutoML・アンサンブル・基盤モデルにより、比較可能な選択肢が急増した。
5 / 116


# Page. 6

![Page Image](https://bcdn.docswell.com/page/L73WDN1675.jpg)

例題：自動販売機の需要予測
100 台の自動販売機 × 10 商品
2 年分の日次データ
1 か月先を予測
系列キー：自販機識別子（Identifier; ID）
× 商品 ID
ターゲット：demand
重要な問い
その特徴量は、予測を作る時点で本当に利用で
きるか？
6 / 116


# Page. 7

![Page Image](https://bcdn.docswell.com/page/87DKPWXMJG.jpg)

入力変数を 4 種類に分ける
役割
例
注意点
ターゲット
系列キー
需要量 demand
自販機 ID × 商品 ID
静的特徴量
設置場所、商品カテゴリ、店舗タイプ
未来共変量
曜日、休日、販促予定、気温予報
過去共変量
実測気温、実績顧客数
未来に予測する値
識別子であり、未知 ID 自体には意味
がない
系列内で不変。未知系列にも意味を持
つ属性が有用
予測期間の値が事前に確定または保存
されていること
将来値を入力するとデータリークに
なる
7 / 116


# Page. 8

![Page Image](https://bcdn.docswell.com/page/VJPKN9PQE8.jpg)

MOAI-Forecasting による一連の流れ
1
データを読み込む
2
ターゲット・時刻・系列 ID を指定
3
静的特徴量と共変量を分類
4
ホライズンと評価指標を設定
5
AutoML で候補とアンサンブルを比較
6
予測、分位点、特徴量重要度を点検
例題の比較
重み付きアンサンブルの平方根平均二乗誤差（Root
Mean Squared Error; RMSE）：2.0214
季節ナイーブの RMSE：5.0477
8 / 116


# Page. 9

![Page Image](https://bcdn.docswell.com/page/2EVVKM2PEQ.jpg)

静的特徴量と共変量の設定画面
系列 ID と静的特徴量を区別
将来値が分かる列だけを未
来共変量へ指定
実測値は原則として過去共
変量
入力区分を保存し、再現可
能にする
9 / 116


# Page. 10

![Page Image](https://bcdn.docswell.com/page/57GLQGRQEL.jpg)

予測結果と分位点予測の出力
実線：実績、破線：予測、色：系列
下位 10%点、中央値、上位 90%点を系列・時点ご
とに出力
10 / 116


# Page. 11

![Page Image](https://bcdn.docswell.com/page/4EQYKXVWJP.jpg)

時系列特徴量の自動生成
元の期列、ターゲット、系
列 ID を保持
分散、標準偏差、最大値な
どを追加
表形式機械学習の入力列
として利用
生成前後の列数とデータ
を画面で確認
目的
水準だけでなく、変動、ピー
ク、規則性、周期性を数値特徴
量としてモデルへ渡す。
11 / 116


# Page. 12

![Page Image](https://bcdn.docswell.com/page/KJ4WP6M171.jpg)

自動生成できる時系列特徴量の例
カテゴリ
代表例
捉える性質
基本統計量
mean、median、variance、standard
deviation、skewness、kurtosis、quantile
absolute energy、absolute sum of
changes、entropy、CID complexity
autocorrelation、partial autocorrelation、
linear trend、Augmented Dickey–Fuller
test
Fast Fourier Transform coefficients、
Welch power spectrum、wavelet
coefficients
number of peaks、longest strike above
mean
分布の中心、広がり、非対称性、裾の重さ
時間変化と複雑度
相関とトレンド
周波数領域
局所形状
変動量、不規則性、系列形状の複雑さ
時点間依存、増減傾向、定常性
周期、主要周波数、時間局所的な周期構造
ピーク数、水準超過の持続時間
データリーク防止
時点 t の特徴量は t 以前の観測だけで計算する。rolling-origin の各窓で特徴量生成をやり直し、特徴量なしとのアブレーションで増分
価値を確認する。
12 / 116


# Page. 13

![Page Image](https://bcdn.docswell.com/page/LE1Y9V857G.jpg)

このセクション
1
予測問題をどう設計するか
2
予測モデルの地図
3
評価指標と検証
4
古典モデルと AutoML の実装選択肢
5
データセットからモデル候補を考える
6
静的特徴量の高度な活用
7
実務で信頼できる予測へ
13 / 116


# Page. 14

![Page Image](https://bcdn.docswell.com/page/GEWGQLZWJ2.jpg)

モデルを 5 群に分類する
モデル群
主な強み
主な注意点
ベースライン
統計的モデル
表形式機械学習
深層学習
時系列基盤モデル
高速・透明・診断に有用
短系列でも安定、理論が明確
多系列・外生変数・非線形性
長期依存・共変量・確率予測
事前学習、ゼロショット
複雑な関係は表現しない
多系列の情報共有は限定的
ラグ設計と外挿に注意
データ量、計算量、調整が必要
ドメイン差、入力仕様、コスト
複雑なモデルは、ベースラインを上回って初めて価値を持つ。
14 / 116


# Page. 15

![Page Image](https://bcdn.docswell.com/page/47ZLWM12J3.jpg)

ベースラインは「最低ライン」以上の役割を持つ
ナイーブ：ft+h = yt
季節ナイーブ：ft+h = yt+h−m
平均モデル
ゼロモデル
診断できること
季節性の強さ
データ分割の誤り
評価指標の不整合
高価なモデルの増分価値
yt ：時点 t の実績、ft+h ：h 期先予測、m：季節周期。
強い季節性を持つ需要では、前年同月を返すだけのモデルが複雑なシステムを上回ることもある。
15 / 116


# Page. 16

![Page Image](https://bcdn.docswell.com/page/YJ6WGNW6JV.jpg)

統計モデル：指数平滑とその発展
指数平滑法（Exponential Smoothing; ES）
f0 = y0 ,
ft+1 = αyt + (1 − α)ft
ft+1 は時点 t で作る 1 期先予測、yt は時点 t の実現値、α ∈ [0, 1] は平滑化定数である。α が大
きいほど直近の実績を重視する。
Holt 法：水準と傾向を別々に平滑化する
Holt–Winters 法：水準・傾向・季節成分を平滑化する
Complex Exponential Smoothing（CES）：複素数値の状態で変動を表す
Trigonometric seasonality, Box–Cox transformation, Autoregressive Moving Average
errors, Trend, Seasonal components（TBATS）：複数季節性などを扱う
16 / 116


# Page. 17

![Page Image](https://bcdn.docswell.com/page/GJ5MV5M5J4.jpg)

単純移動平均：直近 k 期を同じ重みで平均する
定義
時点 t までの観測から 1 期先を予測するとき、単純移動平均（Simple Moving Average; SMA）は
k−1
ft+1 =
1X
yt−j
k
j=0
と定義される。yt は実現値、k は平均に含める窓幅である。
k が小さい場合
k が大きい場合
直近の変化へ速く追随する
変動を強く平滑化する
ノイズや外れ値の影響を受けやすい
水準変化への追随が遅れる
急な水準変化の検出に向く
安定系列の基準予測に向く
限界
窓内の観測へ同じ重みを与え、窓外の情報を突然捨てる。トレンドや季節性は別途扱う必要がある。
17 / 116


# Page. 18

![Page Image](https://bcdn.docswell.com/page/LE3WDNW5E5.jpg)

Holt 法：水準と傾向を同時に更新する
状態更新式
st = αyt + (1 − α)(st−1 + bt−1 ),
bt = β(st − st−1 ) + (1 − β)bt−1 ,
ft+h = st + hbt .
st 時点 t の水準、
bt 1 期あたりの傾向、
α, β 水準・傾向の平滑化定数、
h 予測ホライズン。
単純指数平滑に線形トレンドを加えたモデルであり、季節性は明示的に扱わない。
長期では hbt が直線的に伸び続けるため、減衰トレンド版も比較候補になる。
短い単変量系列でも学習しやすく、機械学習や深層学習の強い比較対象となる。
18 / 116


# Page. 19

![Page Image](https://bcdn.docswell.com/page/8EDKPWKY7G.jpg)

Holt–Winters 法：加法的な季節変動
季節周期を L、季節成分を ct とする。季節振幅が水準によらずほぼ一定なら加法型を用いる。
加法型の更新式
st = α(yt − ct−L ) + (1 − α)(st−1 + bt−1 ),
bt = β(st − st−1 ) + (1 − β)bt−1 ,
ct = γ(yt − st ) + (1 − γ)ct−L ,
ft+h = st + hbt + ct−L+1+((h−1) mod L) .
st が水準、bt が傾向、ct が季節位置ごとの差、γ が季節成分の更新率である。
月次データの年周期なら L = 12、日次データの週周期なら L = 7 が典型である。
初期状態と周期 L を誤ると精度が崩れるため、季節ナイーブと同じ周期で比較する。
19 / 116


# Page. 20

![Page Image](https://bcdn.docswell.com/page/V7PKN9K2J8.jpg)

Holt–Winters 法：乗法的な季節変動
水準が大きくなるほど季節振幅も大きくなる系列では、季節成分を比率として扱う。
乗法型の更新式
st = α
yt
+ (1 − α)(st−1 + bt−1 ),
ct−L
bt = β(st − st−1 ) + (1 − β)bt−1 ,
yt
ct = γ
+ (1 − γ)ct−L ,
st
ft+h = (st + hbt )ct−L+1+((h−1) mod L) .
向く系列
注意
売上規模に比例して季節振幅が増える
ゼロや負値を含む系列にはそのまま使いにくい
対数変換後に加法構造が自然になる
加法型との優劣は rolling-origin で決める
20 / 116


# Page. 21

![Page Image](https://bcdn.docswell.com/page/2JVVKMVXJQ.jpg)

統計モデル：自己回帰和分移動平均
Autoregressive Integrated Moving Average（ARIMA）(p, d, q)
φp (B)(1 − B)d Yt = c + θq (B)t
自己回帰（Autoregressive; AR）：過去 p 期の値を利用
和分（Integrated; I）：d 回の階差で系列を定常化
移動平均（Moving Average; MA）：過去 q 期の予測誤差を利用
Yt は実績、B は BYt = Yt−1 を満たすバックシフト演算子、c は定数、φp (B) と θq (B) はそれぞれ AR・
MA の係数多項式、t は誤差である。
21 / 116


# Page. 22

![Page Image](https://bcdn.docswell.com/page/5EGLQGLRJL.jpg)

AR・MA・ARMA：ARIMA を構成する基本要素
自己回帰モデル AR(p)
yt = c +
p
X
移動平均モデル MA(q)
yt = c + t +
φj yt−j + t
q
X
θj t−j
j=1
j=1
現在値を現在と過去 q 期の予測誤差で表す。単純移動平
均とは異なる。
現在値を過去 p 期の観測値の線形結合として表す。
自己回帰移動平均モデル ARMA(p, q)
yt = c +
p
X
j=1
φj yt−j + t +
q
X
θj t−j
j=1
定常系列に対し、過去値と過去誤差の両方を用いる。
22 / 116


# Page. 23

![Page Image](https://bcdn.docswell.com/page/4JQYKXYY7P.jpg)

ARIMA：階差によって非定常系列を扱う
バックシフト演算子 B を Byt = yt−1 と定義すると、1 回階差は
(1 − B)yt = yt − yt−1
であり、d 回階差は (1 − B)d yt となる。
ARIMA(p, d, q)

1 −
p
X

φj B
j
j=1
|
{z
φp (B): 自己回帰

d
q
X

j
(1 − B) yt = c + 1 +
θj B t .
| {z }
j=1
} 階差
|
{z
}
θq (B): 移動平均
p, d, q を大きくしすぎると過適合しやすい。AutoARIMA は情報量規準などで候補を探索する。
季節差分と季節 AR/MA 項を加えると SARIMA、外生変数を加えると SARIMAX となる。
複数変数を同時に扱う Vector ARIMA（VARIMA）は変数間の相互依存もモデル化する。
23 / 116


# Page. 24

![Page Image](https://bcdn.docswell.com/page/K74WP6WZE1.jpg)

Theta 法：曲率を変えた複数の系列を外挿する
原系列 yt から、曲率を係数 θ で変換した Theta 線 Zt (θ) を構成する。代表的な定義は二階差分を用いて
∆2 Zt (θ) = θ ∆2 yt
と表される。異なる θ の線を別々に外挿し、重み wr で結合する。
fT+h =
R
X
r=1
(θ )
r
wr fT+h
,
R
X
wr = 1
r=1
θ = 0 は曲率を除いた長期傾向、θ &gt; 1 は局所的な曲率を強調する。
標準的な Theta 法は、条件の下でドリフト付き単純指数平滑と等価に表現できる。
計算が軽く、短い系列や長期トレンドを持つ系列の有力な比較候補である。
誤解しやすい点
θ は ARIMA の次数ではなく、Theta 線の曲率を制御する係数である。
24 / 116


# Page. 25

![Page Image](https://bcdn.docswell.com/page/LJ1Y9VYDEG.jpg)

Prophet：傾向・季節・イベントを加法分解する
基本モデル
yt = gt + st + ht + t
gt 区分線形またはロジスティック成長による傾向。変化点で傾きを変えられる。
st フーリエ級数で表す年次・週次・日次などの季節性。
ht 休日、販促、イベントなど、指定した日付の効果。
t 未説明の誤差。
周期 P の季節性は、次数 K のフーリエ級数として
st =
K 
X
k=1
2πkt
2πkt
ak cos
+ bk sin
P
P

と表せる。休日表、成長上限、変化点事前分布などの設定が精度を左右する。
25 / 116


# Page. 26

![Page Image](https://bcdn.docswell.com/page/GJWGQLG872.jpg)

間欠需要：Croston 法とバイアス補正
非ゼロ需要が発生したときだけ、需要量 zt と発生間隔 pt を更新する。
zt = αyt + (1 − α)zt−1 ,
pt = βqt + (1 − β)pt−1
zt ：非ゼロ需要量の平滑値、pt ：需要間隔の平滑値、qt ：直前の非ゼロ需要からの間隔、α, β：平滑化定数。
Croston 予測
Syntetos–Boylan 補正
zt
ft+1 =
pt


β zt
ft+1 = 1 −
2 pt
ft+1 は 1 期先の需要率予測。需要サイズを平
均発生間隔で割る。
係数 1 − β/2 により Croston 法の正のバイア
スを軽減する。
26 / 116


# Page. 27

![Page Image](https://bcdn.docswell.com/page/4EZLWML973.jpg)

間欠需要：ADIDA・IMAPA・NPTS
ADIDA
IMAPA
NPTS
Aggregate–Disaggregate
Intermittent Demand
Approach。細粒度の需要を幅 k
で集約し、
複数の集約幅 k ∈ K で予測し、元
粒度へ戻した予測を平均する。
X
(k)
fT+h =
wk fT+h
Non-Parametric Time Series
forecaster。過去値 yj を、時
刻・季節位置の類似度に基づく重
みで再標本化する。
k∈K
(k)
Yr
=
k
X
y(r−1)k+j
j=1
を予測してから元の粒度へ配分す
る。ゼロの連続を平滑化できる。
単一の集約幅への依存を弱める。
Pr(YT+h = yj ) ∝ K(T + h, j)
分布形を固定しない確率予測と
なる。
比較方法
Zero、季節ナイーブ、Croston 補正版を含め、ゼロ率・需要間隔・集約粒度別に評価する。
27 / 116


# Page. 28

![Page Image](https://bcdn.docswell.com/page/Y76WGNWD7V.jpg)

機械学習による時系列予測：表形式回帰への変換
基本的な考え方
系列 i の予測起点 T で、過去の値と利用可能な特徴量を一つのベクトル x iT にまとめ、回帰モデル gθ,h で
h 期先を予測する。
x iT = (yiT , yi,T−1 , . . . , 移動統計, カレンダー, 共変量),
学習と予測の流れ
fi,T+h = gθ,h (x iT )
適用上の要点
1
各系列・各時点から学習行を作る
多数系列、カテゴリ、外生変数を高速に扱える
2
LightGBM などで全系列をまとめて学習する
ラグや移動統計は過去だけから計算する
予測起点で同じ特徴量を作り、将来値を出力
する
木モデルは学習範囲外の長期トレンドを外挿
しにくい
3
28 / 116


# Page. 29

![Page Image](https://bcdn.docswell.com/page/G75MV5M874.jpg)

線形回帰：時系列特徴量の効果を加法的に表す
ラグ、カレンダー、静的特徴量、共変量を x iT へまとめ、
fi,T+h = β0,h + x &gt;
iT βh
とする。ホライズンごとに係数を分ければ、1 日先と 30 日先で異なる関係を表せる。
正則化付き推定
bh = arg min
β
X
β

2
yi,T+h − β0 − x &gt;
+ λ1 kβk1 + λ2 kβk22 .
iT β
(i,T)∈Dh
L1 正則化は不要な特徴量の係数を 0 へ近づけ、L2 正則化は係数の極端な増大を抑える。
係数の符号と大きさを説明しやすく、トレンドの線形外挿も可能である。
非線形性、閾値効果、複雑なカテゴリ交互作用は、交差項や別モデルが必要になる。
29 / 116


# Page. 30

![Page Image](https://bcdn.docswell.com/page/9J293N9VER.jpg)

ランダムフォレスト：多数の決定木を平均する
学習データと特徴量をランダムに抽出して B 本の回帰木 Tb を学習し、
B
fi,T+h =
1X
Tb (x iT )
B
b=1
と平均するバギング法である。
仕組み
時系列での注意
各木はブートストラップ標本で学習
学習行の作成は時間順序を守る
各分岐で特徴量の一部だけを候補にする
カテゴリは通常、事前符号化が必要
相関の低い木を平均して分散を下げる
葉の平均値を返すため範囲外外挿は苦手
位置付け
調整が比較的容易で安定した非線形ベースラインだが、大規模データでは勾配ブースティングより重くな
る場合がある。
30 / 116


# Page. 31

![Page Image](https://bcdn.docswell.com/page/DEY41P4QJM.jpg)

勾配ブースティング決定木：残差を順次修正する
M 本の弱い木を加法的に組み合わせる。
FM (x) = F0 (x) + η
M
X
Tm (x),
fi,T+h = FM (x iT )
m=1
各反復では、損失 L(y, F) の負の勾配
rn,m = −
∂L(yn , F(x n ))
∂F(x n )
F=Fm−1
を近似する木 Tm を学習する。η は学習率である。
XGBoost：二次勾配と L1/L2 正則化、欠損値の分岐方向を学習する。
LightGBM：ヒストグラムと葉単位成長で、大規模・高次元データを高速に扱う。
CatBoost：順序付きターゲット統計により、カテゴリ変数のリークを抑えて処理する。
31 / 116


# Page. 32

![Page Image](https://bcdn.docswell.com/page/VJNY25Y278.jpg)

表形式モデルの実装：共有 Direct・Per-step・Recursive
方式
予測式と学習方法
性質
共有 Direct
ホライズン h も特徴量へ含め、同じ回帰器 gθ
で fi,T+h = gθ (x iT , h) を予測する。
モデルを共有できる。未知の将来ターゲットから
作るラグは欠損として扱う。通常のベクトル一括
出力 MIMO とは異なる。
Per-step
各 h = 1, . . . , H に専用回帰器 gθh を学習し、
fi,T+h = gθh (x iT ) とする。
ステップ固有の関係を表せるが、H が長いほど
モデル数と計算量が増える。
Recursive
1 期先モデル gθ を用い、fi,T+1 を次時点のラ
グへ戻して fi,T+2 , . . . を反復生成する。
学習は軽いが、予測誤差と分布ずれがホライズン
方向へ伝播する。
比較条件
同じラグ、同じ未来共変量、同じ rolling-origin 窓、同じ探索予算で方式だけを変える。
32 / 116


# Page. 33

![Page Image](https://bcdn.docswell.com/page/YE9P1YPDJ3.jpg)

複数ステップ予測の 3 戦略
戦略
仕組み
トレードオフ
Recursive
Per-step / Direct
多 入 力 多 出 力
（Multiple-Input
Multiple-Output;
MIMO）
1 期先予測を次の入力へ戻す
ホライズンごとに専用モデル
ホライズン全体を一括出力
モデル数は少ないが誤差が伝播
誤差伝播を避けるがモデル数が増加
将来時点間を共同学習するが出力が
高次元
ホライズンが長いほど、予測の出し方そのものが性能を左右する。
33 / 116


# Page. 34

![Page Image](https://bcdn.docswell.com/page/GE8D46D5ED.jpg)

代表的な木モデルの使い分け
モデル
特徴
カテゴリ
向く場面
Random Forest
XGBoost
LightGBM
CatBoost
バギング、並列化しやすい
二次近似、L1/L2 正則化
葉単位成長、ヒストグラム
Ordered Boosting、対称木
事前符号化
通常は事前符号化
内部処理が可能
順序付き統計で自動処理
安定した非線形ベースライン
精度と制御性のバランス
大規模・高次元・高速探索
カテゴリ変数が多いデータ
34 / 116


# Page. 35

![Page Image](https://bcdn.docswell.com/page/LELM69M37R.jpg)

深層学習による時系列予測：表現も同時に学習する
基本的な考え方
ラグ特徴量を人手で完全に設計する代わりに、ニューラルネットワークが履歴、静的特徴量、過去共変量、
未来共変量から予測に必要な内部表現を学習する。
θ
future
(y i,1:T , si , x past
i,1:T , x i,1:T+H ) −−→ (fi,T+1 , . . . , fi,T+H )
G
得意なこと
導入時の確認
多数系列でパラメータを共有するグローバル
予測
十分な系列数・観測数があるか
長い依存関係と非線形な相互作用の学習
学習時間、乱数、過学習、再学習コストを管
理できるか
分位点や確率分布による不確実性の出力
共変量の入力仕様がモデルと一致するか
35 / 116


# Page. 36

![Page Image](https://bcdn.docswell.com/page/4JMY5ZYMJW.jpg)

RNN と LSTM：過去を隠れ状態へ圧縮する
基本的な Recurrent Neural Network（RNN）
ht = φ(Wx x t + Wh ht−1 + b),
ft+1 = Wo ht + bo .
ht が時点 t までの情報を要約する隠れ状態、φ が非線形活性化関数である。
Long Short-Term Memory（LSTM）は、忘却・入力・出力ゲートで記憶 ct を制御する。
f t = σ(Wf [ht−1 , x t ] + bf ),
et = tanh(Wc [ht−1 , x t ] + bc ),
c
it = σ(Wi [ht−1 , x t ] + bi ),
et .
ct−1 + it c
ct = f t
勾配消失を緩和し、RNN より長い依存関係を保持しやすい。
36 / 116


# Page. 37

![Page Image](https://bcdn.docswell.com/page/PJR9369L79.jpg)

DeepAR：多数系列を共有する自己回帰型確率予測
系列 i の静的特徴量 si 、共変量 x it 、直前の実現値を RNN へ入力する。
hit = RNNθ (hi,t−1 , yi,t−1 , x it , si )
隠れ状態から確率分布のパラメータ ψit を出力し、
ψit = Whit + b,
yit ∼ p( · | ψit )
とする。学習では全系列の負の対数尤度
L(θ) = −
XX
i
log p(yit | yi,1:t−1 , x i,1:t , si )
t
を最小化する。予測時は分布から逐次サンプリングし、平均・中央値・分位点を得る。
適した場面
多数系列、系列ごとのスケール差、間欠需要、在庫計画のように予測分布が必要な場合。
37 / 116


# Page. 38

![Page Image](https://bcdn.docswell.com/page/PEXQ4M36JX.jpg)

DLinear・NLinear：分解または基準値除去後に線形写像する
DLinear
NLinear
長さ L の入力 y を移動平均によるトレンド t と残
差 r へ分解する。
最終観測値 yT を基準として系列を中心化し、
t = MAk (y),
r =y−t
各成分を独立な線形層でホライズン H へ写像する。
z = y − yT 1,
f = Wz + b + yT 1
と予測する。水準のずれに対して安定しやすい。
f = Wt t + Wr r + b
構造が単純で高速なため、Transformer 系を評価する前の強いベースラインとなる。
線形写像だけで十分かは、予測長、周期、共変量の有無に依存する。
38 / 116


# Page. 39

![Page Image](https://bcdn.docswell.com/page/3EK9ZGYGED.jpg)

PatchTST：時系列をパッチへ分割して Attention を適用する
長さ L の入力を長さ P、ストライド S のパッチへ分割する。パッチ数は概ね


L−P
Np =
+1
S
である。各パッチ pj ∈ RP を埋め込みへ変換し、位置情報を加える。
zj = Wp pj + ej
Transformer の自己注意は
QK &gt;
Attention(Q, K, V) = softmax p
dk
!
V
でパッチ間の依存関係を学習する。
点単位よりトークン数が減り、長い履歴を扱いやすい。ただし計算量はパッチ数 Np に対して二次で
ある。
チャネル独立設計では各変量を同じ重みの Transformer で処理し、変量間の混合は限定的となる。
パッチ長 P とストライド S は、局所パターンの解像度と計算量を左右する。
39 / 116


# Page. 40

![Page Image](https://bcdn.docswell.com/page/L73WDN9575.jpg)

Temporal Fusion Transformer：異種入力を選択し分位点を予測する
Temporal Fusion Transformer（TFT）は、静的特徴量、既知未来共変量、観測済み過去共変量を分けて処理する。
変数選択ネットワーク
時点 t の候補変数表現 v jt へ重みを与え、
exp(ejt )
ajt = P
,
k exp(ekt )
et =
x
X
ajt v jt
j
と統合する。重み ajt は変数重要度を解釈する手掛かりになる。
静的コンテキストで LSTM 状態、変数選択、ゲートを条件付けする。
LSTM で局所的な時間発展を処理し、解釈可能な Attention で長期依存を捉える。
分位水準 q ごとに fi,t を出力し、ピンボール損失
q
ρq (y − f ) = max{q(y − f ), (q − 1)(y − f )}
q
q
q
を最小化する。
適した場面
販促、価格、休日、店舗属性などが豊富で、説明性と予測区間の両方が必要な業務時系列。
40 / 116


# Page. 41

![Page Image](https://bcdn.docswell.com/page/87DKPWGYJG.jpg)

N-BEATS・N-HiTS：残差をブロックで段階的に説明する
N-BEATS の基本ブロック
入力残差 x (`) から、過去を説明する backcast と未来を表す forecast を出力する。
(`)
(`)
b(`) = B(`) θb ,
f (`) = F(`) θf
X (`)
x (`+1) = x (`) − b(`) ,
f =
f .
`
Generic 基底は柔軟性を重視し、Trend ／ Seasonality 基底は予測を成分へ分解しやすい。
N-HiTS は多重レートのサンプリングと階層的補間により、異なる時間スケールを効率よく扱う。
共変量よりターゲット履歴を中心に、長期予測と多様な周期を学習したい場合の候補となる。
41 / 116


# Page. 42

![Page Image](https://bcdn.docswell.com/page/VJPKN932E8.jpg)

TCN・WaveNet：拡張因果畳み込みで長い履歴を見る
1 次元の因果畳み込みは未来の入力を参照せず、拡張率 d を用いて
zt =
K−1
X
wk xt−dk
k=0
と計算する。層ごとに d = 1, 2, 4, . . . と増やすと、少ない層で広い受容野を得る。
Temporal Convolutional Network
WaveNet
因果畳み込み＋残差接続
ゲート付き拡張畳み込み
時点方向を並列計算できる
residual ／ skip 接続を積層
局所パターンと長期依存を両立
値を bucket 化して確率的に逐次生成する実
装もある
受容野が季節周期や必要な履歴長を覆うよう、カーネル幅・層数・dilation を設計する。
42 / 116


# Page. 43

![Page Image](https://bcdn.docswell.com/page/2EVVKM4XEQ.jpg)

TiDE・Simple Feedforward・TSMixer：直接多段予測
TiDE
Simple Feedforward
TSMixer
過去ターゲットと共変量を Dense
encoder で圧縮し、将来既知共変量ととも
に decoder へ渡す。
履歴窓を平坦化し、多層パーセプトロンで
ホライズン全体を一括出力する。
時間方向の混合と特徴量方向の混合を交互
に適用する MLP 型モデル。
f = W2 φ(W1 y + b1 ) + b2
X = X + MLPtime (X),
z = Eθ (y 1:T , x 1:T+H ),
f T+1:T+H = Dθ (z, x T+1:T+H )
軽量な深層学習ベースラインとなる。
0
X
00
= X + MLPfeature (X )
0
0
共通点
自己回帰せずホライズン全体を直接出力できるため誤差伝播を避けやすい。共変量対応は実装ごとに確認する。
43 / 116


# Page. 44

![Page Image](https://bcdn.docswell.com/page/57GLQG1REL.jpg)

深層学習モデルの比較
モデル
構造
共変量
出力
向く場面
DeepAR
自己回帰型リカレン
ト・ニューラルネット
ワーク（Recurrent
Neural Network;
RNN）
パッチ型 Transformer
Long Short-Term
Memory（LSTM）＋
Attention ＋ Gate
分解＋線形層
静的・動的
確率分布
多数系列、間欠需要、
在庫意思決定
原則単変量
静的・既知未来・観測済
一括予測
分位点
長い履歴と明瞭な周期
外生要因と説明性が
重要
原則単変量
一括予測
軽量な長期予測ベース
ライン
PatchTST
Temporal
Fusion
Transformer（TFT）
DLinear
深層学習はデータ量・計算量・調整コストに見合う改善があるかで判断する。
44 / 116


# Page. 45

![Page Image](https://bcdn.docswell.com/page/4EQYKXDYJP.jpg)

時系列基盤モデル：大規模事前学習を予測へ利用する
大規模言語モデルとの関係
Transformer と大規模事前学習を利用する点は大規模言語モデルと共通するが、入力は文章ではなく数値
時系列である。値をトークン化する方式、複数時点をパッチとして埋め込む方式などにより、異なる分野の
系列から汎用パターンを学ぶ。
推論の流れ
1
2
3
4
履歴を正規化し、トークンまたはパッチへ
変換
万能ではない
学習分布と業務データの差で性能が変わる
事前学習済みモデルへ文脈として入力
共変量・多変量入力への対応はモデルごとに
異なる
追加学習なしのゼロショット、または微調整
で予測
文脈長、予測長、推論時間、モデル版を固定
して比較する
サンプルや分位点として不確実性も出力
季節ナイーブや専用学習モデルとのバックテ
ストが必要
45 / 116


# Page. 46

![Page Image](https://bcdn.docswell.com/page/KJ4WP6ZZ71.jpg)

Chronos：数値をトークン化して自己回帰生成する
系列 y1:T をスケール s で正規化し、連続値を V 個のビンへ量子化する。
y 
t
zt = Q
,
zt ∈ {1, . . . , V}
s
T5 型モデルは過去トークンから次トークンの分布を学習する。
p(zT+1:T+H | z1:T ) =
H
Y
p(zT+h | z1:T+h−1 )
h=1
1
分布から複数のトークン列を自己回帰的にサンプリングする。
2
ビンの代表値へ逆変換し、元のスケール s を戻す。
3
サンプル集合から平均、中央値、分位点、予測区間を計算する。
長所と限界
確率的生成の仕組みが明快だが、量子化誤差、逐次生成、多数サンプリングによる推論コストがある。基本
形は単変量である。
46 / 116


# Page. 47

![Page Image](https://bcdn.docswell.com/page/LE1Y9VRD7G.jpg)

Chronos-Bolt：パッチ入力から分位点を直接出力する
履歴を長さ P のパッチ pj へ分割し、連続値のまま埋め込む。
ej = Wp pj + bp ,
j = 1, . . . , Np
エンコーダ表現から、ホライズン h と分位水準 q ごとの値を一括出力する。
q
{fT+h
: h = 1, . . . , H, q ∈ Q} = Gθ (e1:Np )
学習損失は複数分位点のピンボール損失の和である。
L=
H X
X
q
ρq (yT+h − fT+h
)
h=1 q∈Q
自己回帰サンプリングが不要で、Chronos より高速に推論できる。
パッチ化により長い文脈を効率的に扱う。CPU 利用も現実的な候補となる。
基本的には単変量で、共変量を直接入力するモデルではない。
47 / 116


# Page. 48

![Page Image](https://bcdn.docswell.com/page/GEWGQL18J2.jpg)

Chronos-2：系列・共変量を文脈内で共同処理する
連続パッチ埋め込みを用い、時間方向の Attention に加えて、同じグループに入れた系列間の Attention
を行う。
Htime = Attntime (E),
Hgroup = Attngroup (Htime )
予測対象系列、関連系列、過去共変量、未来既知共変量を同じ文脈へ配置し、
q
fi,T+1:T+H
= Gθ (Ci ),
と分位点を直接出力する。Ci は対象系列 i に与える文脈である。
追加学習なしでも、関連系列と共変量から文脈内学習できる可能性がある。
グループの定義、系列の並び、バッチ構成が結果に影響し得るため、再現可能な規則を固定する。
静的特徴量、既知未来、過去共変量の対応範囲は利用する実装・版で確認する。
48 / 116


# Page. 49

![Page Image](https://bcdn.docswell.com/page/47ZLWMP9J3.jpg)

Toto：可観測性データ向けの確率的 Transformer
Toto は高頻度・非定常・外れ値の多い監視メトリクスを想定した decoder-only Transformer である。
因果的なパッチ単位正規化により、未来情報を使わず局所的な水準と尺度を調整する。
ej =
p
pj − µj
σj + ε
出力は K 成分の Student-t 混合分布で表す。
p(yt+1 | Ht ) =
K
X
k=1
πk tνk (yt+1 ; µk , σk ),
X
πk = 1
k
Student-t 分布は裾が重く、急変や外れ値を正規分布より柔軟に表現できる。
時間方向と変量方向の情報を処理し、多変量の監視系列へ対応する。
推論用 GPU、モデル重み、文脈長、サンプル数を固定してコストと精度を比較する。
49 / 116


# Page. 50

![Page Image](https://bcdn.docswell.com/page/YJ6WGNMDJV.jpg)

代表的な時系列基盤モデル
モデル
表現
出力
多変量・共変量
特徴
Chronos
値を量子化しトーク
ン化
パッチ埋め込み
連続パッチ＋ group
attention
因果パッチ＋時系列
専用 Transformer
自己回帰サンプル
単変量
分位点を一括出力
分位点を一括出力
単変量
多変量・共変量対応
Text-to-Text Transfer
Transformer（T5）型
高速なゼロショット
文脈内学習、長い文脈
Student-t 混合
多変量
Chronos-Bolt
Chronos-2
Toto
急変・外れ値・監視
系列
導入時の確認
ドメイン差、文脈長、予測長、共変量仕様、推論コスト、モデル版を固定して比較する。
50 / 116


# Page. 51

![Page Image](https://bcdn.docswell.com/page/GJ5MV5Z8J4.jpg)

アンサンブル：異なるモデルの誤差を相殺する
M 個のモデルの予測 fit
(m)
を重み付きで結合する。
fitens =
M
X
(m)
wm fit
,
wm ≥ 0,
m=1
M
X
wm = 1
m=1
検証データ上で、例えば二乗誤差を最小にする重みを求める。
b = arg min
w
w
改善しやすい条件
構造の異なるモデルを含む
個々の誤差相関が低い
検証窓が運用期間を代表する
!2
X
i,t
yit −
X
(m)
wm fit
m
注意
同じ誤りをするモデルを増やしても改善し
ない
重み学習にもデータリーク防止が必要
推論・保守対象のモデル数が増える
51 / 116


# Page. 52

![Page Image](https://bcdn.docswell.com/page/9E293NRV7R.jpg)

このセクション
1
予測問題をどう設計するか
2
予測モデルの地図
3
評価指標と検証
4
古典モデルと AutoML の実装選択肢
5
データセットからモデル候補を考える
6
静的特徴量の高度な活用
7
実務で信頼できる予測へ
52 / 116


# Page. 53

![Page Image](https://bcdn.docswell.com/page/D7Y41PDQEM.jpg)

評価指標で用いる共通記号
yit 時系列 i の期 t における実現値
fit 時系列 i の期 t における点予測値
fitq 時系列 i の期 t における分位水準 q の予測値
N データセット内の時系列数
T 学習期間の最終時点
H 予測期間（ホライズン）の長さ
m 季節周期
複数系列を集約する際の基本注意
指標によって、規模の大きい系列を強く重み付けするか、各系列を同等に扱うかが異なる。
53 / 116


# Page. 54

![Page Image](https://bcdn.docswell.com/page/VENY2562J8.jpg)

平均絶対誤差（Mean Absolute Error; MAE）
MAE =
N
T+H
1 1 X X
|yit − fit | .
NH
i=1 t=T+1
全系列・全予測時点の絶対誤差を平均する
外れ値の影響は二乗誤差より小さく、中央値の推定に対応する
スケールに関する注意
MAE はスケール依存である。複数系列を一括評価すると、値の大きい系列が全体の指標へ大き
く寄与する。
54 / 116


# Page. 55

![Page Image](https://bcdn.docswell.com/page/Y79P1YLDE3.jpg)

平均二乗誤差（Mean Squared Error; MSE）
MSE =
N
T+H
1 X X
(yit − fit )2
NH
i=1 t=T+1
最適な点予測 二乗誤差の期待値を最小にする点予測は条件付き平均である。
単位 ターゲットの単位の二乗となるため、業務量として直感的に解釈しにくい。
感度 誤差を二乗するので、大きな予測外しへ強いペナルティを与える。
系列集約 正規化しないため、規模の大きい系列の誤差が全体値を支配しやすい。
利用場面
大きな外しが欠品、停止、緊急輸送などの重大な損失につながる場合。ただし外れ値自体がデータ異常な
ら、先に品質確認が必要である。
55 / 116


# Page. 56

![Page Image](https://bcdn.docswell.com/page/G78D46X57D.jpg)

平方根平均二乗誤差（Root Mean Squared Error; RMSE）
v
u
N T+H
X
u1 1 X
2
RMSE = t
(yit − fit ) .
NH
i=1 t=T+1
誤差を二乗するため、大きな予測外しを強く罰する
平方根を取るため、ターゲットと同じ単位で解釈できる
スケールに関する注意
RMSE もスケール依存であり、規模の大きい系列や外れ値の影響を強く受ける。
56 / 116


# Page. 57

![Page Image](https://bcdn.docswell.com/page/L7LM6983JR.jpg)

加重絶対パーセント誤差（Weighted Absolute Percentage Error;
WAPE）
N T+H
X
X
WAPE =
|yit − fit |
i=1 t=T+1
N T+H
X
X
.
|yit |
i=1 t=T+1
データ全体を同じ定数倍しても値が変わらない無次元指標
個々の実績値にゼロが含まれていても計算できる
スケールに関する注意
系列をまとめて計算すると、実績量の大きい系列ほど重く評価される。分母の実績絶対値総和が
0 なら未定義である。
57 / 116


# Page. 58

![Page Image](https://bcdn.docswell.com/page/4EMY5Z6MEW.jpg)

平均絶対スケール誤差（Mean Absolute Scaled Error; MASE）
MASE =
N
T+H
1 1 X 1 X
|yit − fit |,
NH
ai
i=1
ai =
1
T −m
t=T+1
T
X
|yit − yi,t−m |.
t=m+1
ai は系列 i の学習期間における平均絶対季節誤差である。
スケールに関する注意
系列ごとにスケールを調整するため、規模の異なる系列を同等に評価できる。一方、ai = 0 の系
列では未定義であり、ゼロが多い系列では不安定になり得る。
58 / 116


# Page. 59

![Page Image](https://bcdn.docswell.com/page/PER936PLJ9.jpg)

平方根平均二乗スケール誤差（Root Mean Squared Scaled Error;
RMSSE）
v
u
N
T+H
u1 1 X
1 X
RMSSE = t
(yit − fit )2 ,
NH
si
i=1
si =
1
T −m
T
X
t=T+1
(yit − yi,t−m )2 .
t=m+1
si は系列 i の学習期間における平均季節二乗誤差である。
スケールに関する注意
系列ごとの季節変動で二乗誤差を正規化する。si = 0 の系列では未定義であり、大きな外れ値に
は敏感である。
59 / 116


# Page. 60

![Page Image](https://bcdn.docswell.com/page/P7XQ4MN6EX.jpg)

平方根平均二乗対数誤差（Root Mean Squared Logarithmic
Error; RMSLE）
v
u
T+H
N
X
u 1 X
RMSLE = t
[ln(1 + yit ) − ln(1 + fit )]2
NH
i=1 t=T+1
対数変換により、絶対量より相対的な差を重視し、大きな値の影響を圧縮する。
yit &gt; −1 かつ fit &gt; −1 で定義される。需要予測では通常、実績・予測を非負として扱う。
同じ比率の過大予測と過小予測に対する挙動は、元スケールの RMSE とは異なる。
負の予測を 0 へ切り上げるか、モデルをエラーとするかを評価前に固定する。
注意
対数変換後の誤差であり、元の需要単位での損失を直接表さない。意思決定コストとの対応を確認する。
60 / 116


# Page. 61

![Page Image](https://bcdn.docswell.com/page/37K9ZGNG7D.jpg)

平均絶対パーセント誤差（Mean Absolute Percentage Error;
MAPE）
MAPE =
N
T+H
1 X X |yit − fit |
NH
|yit |
i=1 t=T+1
各観測の実績値で割るため、形式上はスケールに依存しない比率指標である。
yit = 0 で未定義となり、実績が小さい観測へ極端に大きな重みを与える。
同じ絶対誤差でも小規模系列を強く罰し、過大・過小予測の扱いも対称ではない。
結論
ゼロ需要や低需要を含む実務データには不向きである。WAPE、MASE、RMSSE などを優先して検討する。
61 / 116


# Page. 62

![Page Image](https://bcdn.docswell.com/page/LJ3WDNV5J5.jpg)

対称平均絶対パーセント誤差（Symmetric MAPE; SMAPE）
SMAPE =
N
T+H
2 X X |yit − fit |
NH
|yit | + |fit |
i=1 t=T+1
分母に実績と予測の両方を使い、MAPE の非対称性を緩和しようとする。
yit = fit = 0 では 0/0 となる。本書ではその項の寄与を 0 とするが、実装ごとに規約が異なる。
ゼロが多い系列では「0/0 をどう処理したか」が集約値へ大きく影響する。
再現性
値域を [0, 2] とする定義と [0, 100%] とする定義がある。係数 2、百分率化、ゼロ処理を必ず記録する。
62 / 116


# Page. 63

![Page Image](https://bcdn.docswell.com/page/8JDKPW8YEG.jpg)

分位点損失：過小予測と過大予測を非対称に評価
分位水準 q ∈ (0, 1) に対し、本書では通常のピンボール損失を 2 倍した
(
2(1 − q)(fitq − yit ), yit &lt; fitq ,
q
ρq (yit , fit ) =
2q(yit − fitq ),
yit ≥ fitq
を用いる。q が大きいほど過小予測への罰が大きい。
分位点損失
予測区間の被覆率
予測区間の幅
63 / 116


# Page. 64

![Page Image](https://bcdn.docswell.com/page/VEPKN98278.jpg)

スケール済み分位点損失（Scaled Quantile Loss; SQL）
SQL =
T+H
N
1 1 X 1 X 1 X
ρq (yit , fitq ).
NH
ai
|Q| q∈Q
i=1
t=T+1
Q は評価する分位水準の集合、ai は MASE と同じ平均絶対季節誤差である。
スケールに関する注意
各系列をスケール調整して同等に評価する。ai = 0 では未定義であり、中央値 q = 0.5 だけを使う場合は
MASE と等価になる。
64 / 116


# Page. 65

![Page Image](https://bcdn.docswell.com/page/27VVKMNX7Q.jpg)

加重分位点損失（Weighted Quantile Loss; WQL）
T+H
N
X
X
WQL =
i=1 t=T+1
1 X
ρq (yit , fitq )
|Q| q∈Q
T+H
N
X
X
.
|yit |
i=1 t=T+1
スケールに関する注意
データ全体の定数倍には不変だが、複数系列では実績量の大きい系列が強く重み付けされる。分母が 0 な
ら未定義である。
65 / 116


# Page. 66

![Page Image](https://bcdn.docswell.com/page/5JGLQGKR7L.jpg)

時系列の検証は時間順序を守る
窓
学習
検証
予測
1
2
3






h期
h期
h期
ランダム分割は未来情報を過去へ混ぜる危険がある
複数の rolling-origin 窓で期間依存の性能を確認
特徴量生成・クラスタリング・スケーリングも各学習窓内で実行
系列別、ホライズン別、重要イベント別にも誤差を分解
66 / 116


# Page. 67

![Page Image](https://bcdn.docswell.com/page/47QYKXNYEP.jpg)

このセクション
1
予測問題をどう設計するか
2
予測モデルの地図
3
評価指標と検証
4
古典モデルと AutoML の実装選択肢
5
データセットからモデル候補を考える
6
静的特徴量の高度な活用
7
実務で信頼できる予測へ
67 / 116


# Page. 68

![Page Image](https://bcdn.docswell.com/page/KE4WP6GZJ1.jpg)

古典モデルのカタログ
ローカル／統計モデル
グローバルモデル
ARIMA、AutoARIMA、Vector ARIMA（VARIMA）
Linear Regression、Regression Model
ETS、AutoETS、Exponential Smoothing
LightGBM、XGBoost、CatBoost、Random Forest
AutoCES、AutoMFLES、Theta、FourTheta
RNN / LSTM、Block RNN、時間畳み込みネットワーク
（Temporal Convolutional Network; TCN）
TBATS、AutoTBATS、高速フーリエ変換（Fast Fourier
Transform; FFT）、Prophet
Croston、Kalman Forecaster
Naive Drift / Mean / Moving Average / Seasonal
Neural Basis Expansion Analysis for Interpretable
Time Series Forecasting（N-BEATS）、Neural
Hierarchical Interpolation for Time Series
Forecasting（N-HiTS）
DLinear、NLinear
TFT、TSMixer、TiDE、Transformer
候補名を暗記するより、データ特性と入力仕様で絞り込む。
68 / 116


# Page. 69

![Page Image](https://bcdn.docswell.com/page/L71Y9VDDJG.jpg)

自動選択型の統計モデル：AutoETS・AutoCES・AutoTBATS・
AutoMFLES
モデル
探索・表現
利用上の要点
AutoETS
誤差 E、傾向 T 、季節 S の加法／乗法、減衰の
候補を比較する。
複素数状態 zt を更新し、実部などから予測する
複素指数平滑の候補を AIC 等で選ぶ。
Box–Cox 変換、ARMA 誤差、傾向、三角関数
季節成分を自動調整する。
Moving-average、Fourier、Linear trend、
Exponential Smoothing 等の成分を組み合わ
せる。
短い系列でも安定しやすい。ゼロ・負値がある場
合は乗法構成の可否を確認する。
波形的・周期的な変動の候補。通常の ETS、
Theta、季節ナイーブと比較する。
複数・非整数季節性を扱えるが、系列数が多いと
計算負荷が大きい。
複数の構造を軽量に統合する候補。探索範囲と実
装版を記録する。
AutoCES
AutoTBATS
AutoMFLES
自動選択の意味
「Auto」は候補構造やパラメータを探索することであり、適切な検証分割・周期・評価指標まで自動的に保証するものではない。
69 / 116


# Page. 70

![Page Image](https://bcdn.docswell.com/page/G7WGQLY8E2.jpg)

TBATS・FFT・Kalman：複雑な周期と状態を扱う
TBATS
FFT 予測
Kalman Forecaster
季節成分を三角関数で表す。
離散フーリエ変換
状態空間モデル
K
(j)
st =
j
X

ajk cos(ωjk t)
Xk =
T−1
X
yt e−2πikt/T
t=0
k=1
+ bjk sin(ωjk t)

複数季節周期と ARMA 誤差を組
み合わせる。
から主要周波数を残し、逆変換を
未来へ外挿する。明瞭な周期向け。
zt = Azt−1 +wt ,
yt = Czt +vt
で潜在状態を逐次推定する。欠測
やノイズへ柔軟。
70 / 116


# Page. 71

![Page Image](https://bcdn.docswell.com/page/4JZLWMX9E3.jpg)

ナイーブ派生モデル：何を基準値にするか
モデル
予測式
役割
Naive
fT+h = yT
最終観測値を維持。ランダムウォー
ク型系列の基準。
Naive Drift
fT+h = yT + h
Naive Mean
Naive Moving Average
Naive Seasonal
P
fT+h = T −1 Tt=1 yt
P
fT+h = k −1 k−1
j=0 yT−j
Seasonal Average
同じ季節位置に属する過去値の平均
Zero
fT+h = 0
yT − y1
T −1
fT+h = yT+h−mdh/me
始点から終点までの平均傾きを外挿
する。
定常な水準系列の基準。
直近水準を平滑化する。
同じ季節位置の値を繰り返す。強い
季節性の必須基準。
季節性を維持しつつノイズを平均化
する。
ゼロ発生の多い系列で「何も起きな
い」基準を与える。
71 / 116


# Page. 72

![Page Image](https://bcdn.docswell.com/page/YE6WGN4DEV.jpg)

AutoML の探索空間
モデル群
主な候補
ベースライン
統計
SeasonalNaive、Naive、Average
ETS、AutoARIMA、AutoETS、AutoCES、Theta、Non-Parametric
Time Series forecaster（NPTS）
Aggregate-Disaggregate Intermittent Demand Approach
（ADIDA）、Croston、Intermittent Multiple Aggregation Prediction
Algorithm（IMAPA）
DirectTabular、PerStepTabular、RecursiveTabular
DeepAR、DLinear、PatchTST、TFT、TiDE、WaveNet
Chronos-2、Chronos、Toto
Weighted Ensemble、Multi-layer Stacking
間欠需要
表形式
深層学習
事前学習
アンサンブル
72 / 116


# Page. 73

![Page Image](https://bcdn.docswell.com/page/GE5MV5Q8E4.jpg)

AutoML 実装名：ベースライン・統計・間欠需要
実装名
スライド中の意味と役割
NaiveModel / SeasonalNaiveModel
AverageModel
/
SeasonalAverageModel / ZeroModel
ETSModel / AutoETSModel
AutoARIMAModel
AutoCESModel
ThetaModel / AutoTheta
NPTSModel
ADIDAModel / CrostonModel /
IMAPAModel
最終値または同じ季節位置を返す必須ベースライン。
全体平均、季節位置平均、常時ゼロの基準予測。
ETS 構成を手動指定、または誤差・傾向・季節構成を自動探索する。
ARIMA ／季節 ARIMA の次数を情報量規準などで自動探索する。
複素指数平滑の候補構造を自動選択する。
Theta 線を使う軽量なトレンド予測。実装により季節調整や候補選択を行う。
過去観測を非パラメトリックに再利用して確率分布を作る。
集約・分解、需要量と発生間隔、複数集約レベルを使う間欠需要モデル。
73 / 116


# Page. 74

![Page Image](https://bcdn.docswell.com/page/97293NPVJR.jpg)

AutoML 実装名：表形式・深層・事前学習
実装名
予測方式
DirectTabularModel
PerStepTabularModel
RecursiveTabularModel
DeepARModel
DLinearModel
PatchTSTModel
SimpleFeedForwardModel
TemporalFusionTransformerModel
TiDEModel / WaveNetModel
ChronosModel / Chronos2Model
TotoModel
全将来行で一つの表形式回帰器を共有する直接型。
ホライズンの各ステップに専用回帰器を学習する。
1 期先予測をラグへ戻して逐次予測する。
RNN によるグローバル自己回帰型確率予測。
トレンド・残差分解と線形層による直接予測。
パッチ化した履歴を Transformer で処理する。
履歴窓からホライズン全体を多層パーセプトロンで出力する。
静的・既知未来・過去入力を統合し分位点を予測する。
Dense encoder–decoder、または拡張因果畳み込みを用いる。
トークン型、共変量対応パッチ型、可観測性向け確率 Transformer の事前学習モ
デル。
/
74 / 116


# Page. 75

![Page Image](https://bcdn.docswell.com/page/DJY41P5Q7M.jpg)

AutoML の基本設定：探索前に意味を固定する
予測長 H 一度に必要な将来期間。評価窓と運用上の意思決定周期に一致させる。
頻度 日次・週次・月次など。欠けた時点を補完するか、観測不在として扱うかを決める。
評価指標 平均／中央値／分位点のどれを最適化するか、系列規模をどう重み付けするかを決める。
探索時間 候補モデル数、ハイパーパラメータ探索、深層学習の反復数へ影響する。
検証窓数 rolling-origin の起点数。多いほど期間変動を評価できるが計算量が増える。
共変量 静的、未来既知、過去観測を分け、予測時に同じ方法で入手できることを確認する。
比較可能性
モデル間で日付範囲、対象系列、ホライズン、検証窓、指標、特徴量、探索予算を固定しなければ、リー
ダーボードの差をモデル性能へ帰属できない。
75 / 116


# Page. 76

![Page Image](https://bcdn.docswell.com/page/V7NY25N2E8.jpg)

外付け共変量回帰と残差予測
モデル本体が共変量を直接扱わない場合、共変量回帰器 rγ と時系列モデル gθ を組み合わせられる。
bitreg = rγ (x it , si ),
y
bitreg
eit = yit − y
残差 eit を時系列モデルで予測し、回帰成分を戻す。
fi,T+h = rγ (x i,T+h , si ) + gθ (ei,1:T ; h)
販促・休日などの同時点効果と、残差の自己相関・季節性を分けて扱える。
回帰器と残差モデルは各 rolling-origin 学習窓内で再適合する。
共変量が弱い、未来値が不正確、回帰器が過適合する場合は精度が悪化し得る。
76 / 116


# Page. 77

![Page Image](https://bcdn.docswell.com/page/YJ9P1YRD73.jpg)

多層スタッキング：予測を次層の特徴量にする
第 1 層モデル m = 1, . . . , M の out-of-fold 予測を作り、メタモデルへ入力する。


(1)
(M)
zit = fit , . . . , fit
,
fitstack = gη (zit )
メタモデルは「どの状況でどのモデルを信頼するか」を非線形に学習できる。
学習データ自身への当てはめ値をメタ特徴量にすると重大なリークになるため、必ず時系列
out-of-fold 予測を用いる。
層数を増やすほど計算・保存・説明・障害対応が複雑になる。
単純な重み付き平均を上回る増分価値を、独立したテスト期間で確認する。
77 / 116


# Page. 78

![Page Image](https://bcdn.docswell.com/page/GJ8D46W5JD.jpg)

AutoML で固定すべき条件
データ条件
実験条件
頻度とホライズン
評価指標
学習・検証・テスト期間
探索時間とプリセット
系列 ID とターゲット
乱数条件
静的・過去・未来共変量
ソフトウェアとモデルの版
欠損・外れ値・ゼロの処理
計算資源
AutoML は比較を自動化するが、データの意味までは自動判定しない。
78 / 116


# Page. 79

![Page Image](https://bcdn.docswell.com/page/LJLM69N3ER.jpg)

追加特徴量への対応を先に確認する
モデルの型
静的特徴量
未来共変量
過去共変量
統計ローカル
表形式
DeepAR
TFT / TiDE
Chronos / Bolt
Chronos-2
限定的
カテゴリ／数値として利用
埋め込みとして利用
明示的に分離して利用
原則非対応
文脈内で利用
モデルにより対応
利用しやすい
利用可能
利用可能
原則非対応
利用可能
モデルにより対応
ラグとして利用
利用可能
利用可能
原則非対応
利用可能
同じ「共変量対応」でも、モデル内部への統合方法は異なる。
79 / 116


# Page. 80

![Page Image](https://bcdn.docswell.com/page/47MY5ZXM7W.jpg)

このセクション
1
予測問題をどう設計するか
2
予測モデルの地図
3
評価指標と検証
4
古典モデルと AutoML の実装選択肢
5
データセットからモデル候補を考える
6
静的特徴量の高度な活用
7
実務で信頼できる予測へ
80 / 116


# Page. 81

![Page Image](https://bcdn.docswell.com/page/P7R936NLE9.jpg)

データセットは 3 種類に整理できる
単変量
多変量・多数系列
静的特徴量付き
AirPassengers
Electricity
M5 Forecasting
MonthlyMilk
Electricity
Transformer
Temperature（ETT）
Rossmann
Sunspots
Taxi / Temperature
Vending Machine
Traffic / Uber
Weather / Energy
推奨モデルは保証ではなく、最初のバックテストに含める候補である。
81 / 116


# Page. 82

![Page Image](https://bcdn.docswell.com/page/PJXQ4M867X.jpg)

短い単変量系列：古典モデルを強くする
AirPassengers
月次、1949–1960
トレンド＋乗法的な年周期
系列長は短い
最初の候補
季節ナイーブ
指数平滑、AutoARIMA、Theta
対数／ Box–Cox 変換
深層学習には短すぎる。
82 / 116


# Page. 83

![Page Image](https://bcdn.docswell.com/page/3JK9ZGKGJD.jpg)

多数系列・高頻度：グローバルモデルを比較する
ElectricityDataset
15 分間隔、370 顧客
日内・曜日周期
顧客差、欠測、ゼロ区間
比較候補
系列別季節ナイーブ
global LightGBM / XGBoost
TFT / N-HiTS / TiDE
83 / 116


# Page. 84

![Page Image](https://bcdn.docswell.com/page/LE3WDNZ5E5.jpg)

単変量データセット：ビール生産量と心拍数
AusBeerDataset
四半期季節性・長期トレンド・構造変化。AutoARIMA、指数平滑、
TBATS を比較する。
HeartRateDataset
0.5 秒間隔の短期生体信号。Kalman、ARIMA、TCN や予測残差
による異常検知が候補。
84 / 116


# Page. 85

![Page Image](https://bcdn.docswell.com/page/8EDKPWRY7G.jpg)

単変量データセット：牛乳生産量と欠損データ
MonthlyMilkDataset
年周期と緩やかなトレンド。季節ナイーブ、指数平滑、
AutoARIMA、Theta を比較する。
MonthlyMilkIncompleteDataset
欠損補完の影響を検証するデータ。補間方法も各検証窓の学習期間
内で決める。
85 / 116


# Page. 86

![Page Image](https://bcdn.docswell.com/page/V7PKN9W2J8.jpg)

単変量データセット：太陽黒点と二重季節性
SunspotsDataset
約 11 年の長周期。AutoARIMA、FFT、N-BEATS、N-HiTS など
を長い検証窓で比較する。
TaylorDataset
半時間電力需要に日内・週内の二重季節性。TBATS や複数季節ラ
グを持つ表形式モデルが候補。
86 / 116


# Page. 87

![Page Image](https://bcdn.docswell.com/page/2JVVKM8XJQ.jpg)

単変量データセット：タクシー需要と気温
TaxiNewYorkDataset
30 分間隔の乗車需要。日内・曜日・休日特徴量を用いた
LightGBM や TFT を比較する。
TemperatureDataset
日次気温の年周期。季節ナイーブ、指数平滑、AutoARIMA と周期
的特徴量を比較する。
87 / 116


# Page. 88

![Page Image](https://bcdn.docswell.com/page/5EGLQG5RJL.jpg)

単変量データセット：ガソリン需要とワイン販売
USGasolineDataset
週次需要の季節性とトレンド。AutoARIMA、指数平滑、Theta、
カレンダー回帰が候補。
WineDataset
月次ワイン販売の強い季節性。季節ナイーブと古典モデルを先に比
較する。
88 / 116


# Page. 89

![Page Image](https://bcdn.docswell.com/page/4JQYKXZY7P.jpg)

単変量データセット：羊毛生産量
WoolyDataset
四半期の羊毛生産量
季節性と水準変化
指数平滑、AutoARIMA、
Theta を比較
短系列なので深層学習は慎重
に判断
89 / 116


# Page. 90

![Page Image](https://bcdn.docswell.com/page/K74WP63ZE1.jpg)

多変量データセット：観光階層と電力・気象
AustralianTourismDataset
地域・目的・都市区分を持つ階層時系列。Bottom-up や
Minimum Trace（MinT）調整を比較する。
ElectricityConsumptionZurichDataset
電力と観測気象。観測気象は過去共変量、保存済み気象予報だけを
未来共変量にする。
90 / 116


# Page. 91

![Page Image](https://bcdn.docswell.com/page/LJ1Y9V1DEG.jpg)

多変量データセット：電力市場と変圧器温度
EnergyDataset
発電、需要予測、実需要、価格が混在。ターゲットを明示し、予測
列と実績列を区別する。
Electricity Transformer Temperature（ETT）
h1Dataset
時間別負荷から油温を予測する多変量ベンチマーク。TFT、TiDE、
N-HiTS、LightGBM を比較する。
91 / 116


# Page. 92

![Page Image](https://bcdn.docswell.com/page/GJWGQL8872.jpg)

多変量データセット：ETT の別系列と高頻度版
ETTh2Dataset
ETTh1 とは異なる系列。複数系列をまとめるグローバル学習の比
較にも使える。
ETTm1Dataset
15 分間隔の高頻度版。短期依存と長い系列長に対して TiDE、
N-HiTS、TCN などを比較する。
92 / 116


# Page. 93

![Page Image](https://bcdn.docswell.com/page/4EZLWM8973.jpg)

多変量データセット：高頻度 ETT と為替
ETTm2Dataset
別系列の 15 分データ。短期には TCN、長期には N-HiTS や
TiDE を比較する。
ExchangeRateDataset
8 通貨の非定常系列。差分・リターン化と VARIMA、ARIMA、表
形式モデルを比較する。
93 / 116


# Page. 94

![Page Image](https://bcdn.docswell.com/page/Y76WGNPD7V.jpg)

多変量データセット：プロセスデータと季節商品
GasRateCO2Dataset
ガス流量と二酸化炭素濃度の短い 2 変量系列。VARIMA、
Kalman、線形ラグモデルが候補。
IceCreamHeaterDataset
逆位相の季節商品。系列別モデルと 2 変量モデルの差を確認する。
94 / 116


# Page. 95

![Page Image](https://bcdn.docswell.com/page/G75MV5K874.jpg)

多変量データセット：感染症と交通センサー
ILINetDataset
週次のインフルエンザ様疾患。季節性、流行ピーク、外れ年を分位
点予測でも評価する。
TrafficDataset
862 センサーの道路占有率。センサー ID と意味のある道路属性を
区別する。
95 / 116


# Page. 96

![Page Image](https://bcdn.docswell.com/page/9J293NWVER.jpg)

多変量データセット：配車需要と高頻度気象
UberTLCDataset
262 地点の配車需要。時刻、曜日、休日と地点属性を用いるグロー
バルモデルが候補。
WeatherDataset
10 分間隔の気象多変量。風向は正弦・余弦変換と未変換表現を比
較する。
96 / 116


# Page. 97

![Page Image](https://bcdn.docswell.com/page/DEY41PLQJM.jpg)

静的特徴量付きデータの設計例
データ
系列キー／静的特徴量
未来既知
注意点
M5
商品・店舗・部門・州
ゼロ需要、階層構造
Rossmann
店舗 ID、店舗タイプ、品揃え、
競合距離
自販機 × 商品、設置場所、商品
カテゴリ
曜日、イベント、
Supplemental Nutrition
Assistance Program
（SNAP）
営業、販促、祝日
Vending
週末、休暇、販促、気温予報、
停止予定
顧客数は通常、未来未知
実測気温は過去共変量
候補
季節ナイーブ、LightGBM / XGBoost、DeepAR / TFT、AutoML を同じ分割で比較する。
97 / 116


# Page. 98

![Page Image](https://bcdn.docswell.com/page/VJNY254278.jpg)

このセクション
1
予測問題をどう設計するか
2
予測モデルの地図
3
評価指標と検証
4
古典モデルと AutoML の実装選択肢
5
データセットからモデル候補を考える
6
静的特徴量の高度な活用
7
実務で信頼できる予測へ
98 / 116


# Page. 99

![Page Image](https://bcdn.docswell.com/page/YE9P1YQDJ3.jpg)

系列キーと意味のある静的属性を区別する
識別子
意味のある属性
商品 ID
商品カテゴリ、容量、価格帯
店舗 ID
店舗タイプ、地域、規模
センサー ID
設置場所、周辺環境
既存系列の識別には有効だが、未知 ID には
意味がない。
未知系列にも共有可能な構造を与える。
コールドスタートでは、ID ではなく意味を持つ属性が重要になる。
99 / 116


# Page. 100

![Page Image](https://bcdn.docswell.com/page/GE8D46G5ED.jpg)

DeepAR と TFT における静的特徴量
DeepAR
TFT
カテゴリを埋め込みベクトルへ変換
静的コンテキストを生成
RNN の入力・状態を系列属性で条件付け
変数選択・状態初期化・ゲートを条件
付け
全系列で確率分布のパラメータを共有
静的・既知未来・観測済入力を分離
効果はカテゴリ数、データ量、未知カテゴリ処理、属性の意味に依存する。
100 / 116


# Page. 101

![Page Image](https://bcdn.docswell.com/page/LELM69G37R.jpg)

カテゴリ埋め込み：ID を低次元ベクトルへ変換する
カテゴリ ci ∈ {1, . . . , C} を one-hot ベクトル oi で表し、学習可能な行列 E で
ei = E &gt; o i ∈ R d ,
dC
と埋め込む。複数のカテゴリ属性があれば埋め込みを連結する。
si = [estore
; eproduct
; eregion
]
i
i
i
予測損失を通じ、似た需要パターンを持つカテゴリが近い表現を獲得する可能性がある。
DeepAR では si を各時点の RNN 入力や初期状態へ加え、系列ごとの分布を条件付けする。
高カーディナリティ ID だけでは未知 ID を説明できない。商品カテゴリ、容量、地域など意味のある
属性を併用する。
未知カテゴリ用の予約値、低頻度カテゴリの統合、埋め込み次元 d を事前に設計する。
101 / 116


# Page. 102

![Page Image](https://bcdn.docswell.com/page/4JMY5ZQMJW.jpg)

TFT の静的コンテキスト：モデル内部の複数箇所を条件付けする
静的特徴量の埋め込み si から、用途別のコンテキストを生成する。
csel
= gsel (si ),
i
chi = gh (si ),
cci = gc (si ),
cgate
= ggate (si )
i
csel
時変入力の変数選択を系列属性で条件付けする。
i
chi , cci LSTM の初期隠れ状態とセル状態を初期化する。
cgate
時間処理後の静的強調・ゲート処理に用いる。
i
解釈上の注意
変数選択重みや Attention 重みはモデル内部の利用度を示す手掛かりであり、因果効果を直接表すもので
はない。
102 / 116


# Page. 103

![Page Image](https://bcdn.docswell.com/page/PJR9368L79.jpg)

勾配ブースティング決定木（Gradient Boosting Decision Tree;
GBDT）：カテゴリ処理と外挿
CatBoost：順序付きターゲット統計でリークを抑える
LightGBM：カテゴリ値を効率的に分割
静的特徴量と時間特徴量の交差を木が学習できる
限界
木の予測は学習時の葉の値の組合せであり、未知の長期トレンドを自然に外挿しにくい。
対策候補
時間トレンド、カテゴリ別トレンド、外部モデルの予測、線形モデルとの組合せをバックテスト
する。
103 / 116


# Page. 104

![Page Image](https://bcdn.docswell.com/page/PEXQ4ML6JX.jpg)

カテゴリ変数の符号化：リークを避けて統計量を作る
カテゴリ c の単純なターゲット平均
TE(c) =
P
n:cn =c yn
#{n : cn = c}
を同じ行のターゲットを含めて計算するとリークになる。平滑化した out-of-fold 符号化は
P
n∈T :cn =c yn + λµ
TE(−fold) (c) =
#{n ∈ T : cn = c} + λ
とし、対象行を含まない学習集合 T だけを使う。
CatBoost の ordered statistics は、ランダム順序で当該行より前のデータだけからカテゴリ統計
を作る。
時系列では、未来時点のターゲットをカテゴリ統計へ混ぜないよう、時間順序をさらに守る必要が
ある。
One-Hot、ネイティブカテゴリ分割、ターゲット符号化は、カテゴリ数とデータ量に応じて比較する。
104 / 116


# Page. 105

![Page Image](https://bcdn.docswell.com/page/3EK9ZGLGED.jpg)

特徴量エンジニアリングの 3 候補
方法
作り方
注意点
動的エンコーディング
カテゴリ別需要を集約し、トレンド
を外挿して未来共変量化
統計特徴量や DTW からクラスタ ID
を作る
曜日・月を sin/cos へ写像
外挿誤差が多数系列へ伝播
時系列クラスタリング
周期的エンコーディン
グ
各学習窓内で再推定する
非連続な休日効果は表しにくい
One-Hot、周期表現、両者併用を同一条件で比較する。
105 / 116


# Page. 106

![Page Image](https://bcdn.docswell.com/page/L73WDN3575.jpg)

動的エンコーディング：カテゴリ集約系列を未来共変量にする
カテゴリ c に属する系列集合 Ic の需要を集約する。
Ac,t =
X
i∈Ic
yit
または
Ac,t =
1 X
yit
|Ic |
i∈Ic
b c,T+h を作る。
集約系列へトレンド・季節モデルを適合し、未来値 A
b c(i),T+h , その他の共変量)
fi,T+h = gθ (個別ラグ, si , A
同じカテゴリに共通する成長・縮小を、各系列へ未来共変量として伝えられる。
集約予測の誤差が全系列へ伝播するため、元の GBDT、集約なし、実績集約の上限実験を比較する。
集約系列の作成と予測モデルの適合は、各 rolling-origin 学習窓内だけで行う。
106 / 116


# Page. 107

![Page Image](https://bcdn.docswell.com/page/87DKPW4YJG.jpg)

時系列クラスタリング：振る舞いから静的カテゴリを作る
系列 i から統計特徴量ベクトル ui を抽出し、距離に基づいてクラスタ zi を割り当てる。
ui = (自己相関, 分散, 間欠性, エントロピー, . . .),
zi = arg min kui − µk k2
k
K-Means 以外に、Dynamic Time Warping（DTW）距離
X
DDTW (i, j) = min
|yit − yjs |
π
(t,s)∈π
を使い、時間軸のずれを許容して系列を分類できる。
クラスタ ID をカテゴリ型静的特徴量として予測モデルへ追加する。
業務メタデータのみ、クラスタのみ、両方を同じ条件で比較する。
特徴抽出、標準化、次元圧縮、クラスタ中心は検証窓ごとに学習し直す。
107 / 116


# Page. 108

![Page Image](https://bcdn.docswell.com/page/VJPKN9M2E8.jpg)

周期的エンコーディング：時間の循環構造を座標化する
周期 P の位置 t を円周上の 2 次元座標へ写像する。


2πt
xtsin = sin
,
P
利点
xtcos = cos

2πt
P

限界
日曜日と月曜日、12 月と 1 月の近さを表せる
線形モデルでも滑らかな周期効果を学習で
きる
曜日ごとの任意の不連続効果は One-Hot が
柔軟
休日、月末、販促開始などは別フラグが必要
少ない列数で周期位置を表現できる
カテゴリ別位相差には交互作用が必要
One-Hot、Sine–Cosine、両者併用を同一バックテストで比較する。
108 / 116


# Page. 109

![Page Image](https://bcdn.docswell.com/page/2EVVKM9XEQ.jpg)

階層的予測：精度だけでなく整合性
集計制約
階層的調整
ytotal,t = yretail,t + ywholesale,t
ytotal,t は時点 t の総需要、yretail,t と
ywholesale,t は下位系列。各階層を独立予測す
ると、合計が一致しないことがある。
Bottom-up：最下層を合計
Top-down：上位を比率配分
MinT：誤差共分散を使い分散を最小化
基礎予測と和解予測を階層別にテストする。
109 / 116


# Page. 110

![Page Image](https://bcdn.docswell.com/page/57GLQGZREL.jpg)

階層的調整の行列表現と MinT
最下層系列 bt から全階層の系列 y t を集計行列 S で表す。
y t = Sbt
b T+h を、整合する予測へ線形変換する。
独立に作った基礎予測 y
e T+h = SGy
b T+h
y
MinT は基礎予測誤差の共分散行列 W を用い、調整後誤差共分散のトレースを小さくする。
GMinT = (S&gt; W −1 S)−1 S&gt; W −1
Bottom-up は最下層予測だけを採用して S で合計する。
Top-down は上位予測を過去比率などで下位へ配分する。
W の推定が不安定な場合は対角近似や縮小推定を使う。
整合性は保証されるが、各階層の精度向上は保証されないため階層別に評価する。
110 / 116


# Page. 111

![Page Image](https://bcdn.docswell.com/page/4EQYKXLYJP.jpg)

このセクション
1
予測問題をどう設計するか
2
予測モデルの地図
3
評価指標と検証
4
古典モデルと AutoML の実装選択肢
5
データセットからモデル候補を考える
6
静的特徴量の高度な活用
7
実務で信頼できる予測へ
111 / 116


# Page. 112

![Page Image](https://bcdn.docswell.com/page/KJ4WP6DZ71.jpg)

推奨する実務フロー
1
定義する：ターゲット、系列、粒度、ホライズン
2
分類する：静的・未来既知・過去共変量
3
基準を作る：季節ナイーブなどのベースライン
4
候補を広げる：統計、表形式、深層、基盤モデル
5
正しく測る：rolling-origin と目的に合う指標
6
分解して診る：系列別、期間別、イベント別
7
運用で選ぶ：精度、速度、説明性、保守性
112 / 116


# Page. 113

![Page Image](https://bcdn.docswell.com/page/LE1Y9VZD7G.jpg)

採用判断のチェックリスト
予測品質
運用品質
ベースラインを安定して上回るか
未来情報の入手方法は再現可能か
複数期間・複数系列で改善するか
学習・推論時間は許容範囲か
重要イベントで破綻しないか
モデル版と前処理を記録したか
区間予測は校正されているか
説明・監視・再学習が可能か
113 / 116


# Page. 114

![Page Image](https://bcdn.docswell.com/page/GEWGQL98J2.jpg)

まとめ
1
時系列予測はパイプライン設計問題である
2
単純な季節ナイーブを必ず比較対象にする
3
指標は意思決定上の損失に合わせる
4
特徴量は予測時の利用可能性で分類する
5
AutoML は比較を助けるが、データの意味は人が決める
6
静的特徴量は系列間の共有とコールドスタートを支える
7
精度・計算量・説明性・保守性を合わせて採用する
万能なモデルではなく、改善の根拠が明確な予測を目指す。
114 / 116


# Page. 115

![Page Image](https://bcdn.docswell.com/page/47ZLWM99J3.jpg)

参考文献（主要なもの）
Box, G. E. P. and Jenkins, G. M. (1970), Time Series Analysis: Forecasting and Control.
Holt, C. E. (1957), Forecasting Seasonals and Trends by Exponentially Weighted Averages.
Croston, J. D. (1972), Forecasting and Stock Control for Intermittent Demands.
Salinas et al. (2020), DeepAR: Probabilistic Forecasting with Autoregressive Recurrent Networks.
Lim et al. (2021), Temporal Fusion Transformers for Interpretable Multi-horizon Time Series Forecasting.
Nie et al. (2023), A Time Series is Worth 64 Words: Long-term Forecasting with Transformers.
Ansari et al. (2024), Chronos: Learning the Language of Time Series.
Hyndman et al. (2011); Wickramasuriya et al. (2019), Hierarchical Forecast Reconciliation.
本スライドは『AI 時代の時系列予測』の本文、評価指標、モデルマニュアル、AutoML マニュアル、データセット章をもとに構成した。
115 / 116


# Page. 116

![Page Image](https://bcdn.docswell.com/page/YJ6WGNKDJV.jpg)

ご清聴ありがとうございました
MOAI Lab
116 / 116


