画像処理 上級

深層学習と応用

上級の概要

上級では、深層学習を中心とした現代の画像処理技術を学ぶ。CNN による画像分類から始まり、物体検出、セマンティックセグメンテーション、そして GAN や拡散モデルによる画像生成まで、現代の画像処理の主要技術を習得する。

学習目標

  • CNN の構造と画像分類への応用を理解する
  • YOLO, SSD, Faster R-CNN などの物体検出手法を習得する
  • U-Net, DeepLab などのセグメンテーション手法を学ぶ
  • GAN, VAE, 拡散モデルによる画像生成を理解する
  • 医用画像処理などの専門応用を学ぶ

図解:CNN の構造

入力 H×W×3 Conv 特徴マップ Pool 縮小 Conv Pool Flatten FC 出力 猫: 0.92 犬: 0.05 鳥: 0.03 Softmax
図 1: CNN の構造 — 畳み込みとプーリングで特徴を抽出し、全結合層で分類する。層が深くなるほど抽象的な特徴を学習する。

目次

1. CNN と画像分類

深層学習の基礎。

  • 畳み込み層とプーリング層
  • LeNet, AlexNet, VGG
  • ResNet, DenseNet
  • 転移学習とファインチューニング

2. 物体検出

位置とクラスの同時推定。

  • R-CNN ファミリー
  • YOLO シリーズ(v3・v5・v8・v11)
  • SSD, RetinaNet
  • アンカーフリー検出器

3. セマンティックセグメンテーション

ピクセル単位の分類。

  • FCN (Fully Convolutional Network)
  • U-Net とエンコーダ-デコーダ
  • DeepLab シリーズ
  • インスタンスセグメンテーション

4. 画像生成モデル

新しい画像の生成。

  • VAE (変分オートエンコーダ)
  • GAN と DCGAN
  • StyleGAN, BigGAN
  • 拡散モデル (DDPM, Stable Diffusion)

5. Vision Transformer

Attention 機構の応用。

  • ViT の構造
  • パッチ埋め込み
  • CLIP, DINO
  • Swin Transformer

6. 医用画像処理

専門領域への応用。

  • CT/MRI 画像の前処理
  • 臓器セグメンテーション
  • 病変検出
  • 3D 画像処理

図解:物体検出

入力画像 YOLO グリッド分割 同時予測 高速・End-to-End 検出結果 cat 0.95 dog 0.88 car 0.91
図 2: 物体検出(YOLO) — 入力画像をグリッドに分割し、各セルでバウンディングボックス・クラス・信頼度を 1 回の順伝播で同時に予測する。end-to-end で高速な検出器。ラベルは枠上のタブに白抜きで示す。

図解:画像生成 (GAN)

ノイズ z N(0,1) Generator G Deconv layers 画像生成 生成画像 G(z) Discriminator D Conv layers 真偽判定 出力 Real? 0 or 1 本物画像
図 3: 画像生成(GAN) — 生成器 G はノイズ z から偽画像 G(z) を作り、識別器 D は G(z) と本物画像を見分ける。両者の敵対的学習を通じて、G は次第に本物らしい画像を生成できるようになる。

主要なモデル・損失関数

交差エントロピー損失(分類)

$\mathcal{L} = -\displaystyle\sum_{c=1}^{C} y_c \log(\hat{y}_c)$ ($C$: クラス数、$y$: 正解、$\hat{y}$: 予測)

IoU (Intersection over Union)

物体検出・セグメンテーションの評価指標: $\text{IoU} = \dfrac{|A \cap B|}{|A \cup B|}$

GAN の目的関数

$\min_G \max_D \mathbb{E}_{x}[\log D(x)] + \mathbb{E}_{z}[\log(1 - D(G(z)))]$

このレベルで理解できる応用

自動運転

物体検出、セグメンテーション、深度推定を統合した環境認識システム。

医療診断支援

CT/MRI からの病変検出、臓器セグメンテーション、病理画像解析。

画像生成・編集

Text-to-Image、画像修復、スタイル変換、超解像。

製造業の品質検査

欠陥検出、外観検査の自動化。異常検知による不良品判定。

副読本(読み物)

現代の画像処理・深層学習の要点を、図(3D図含む)で直感的に解説する読み物。

全変動(TV)正則化とノイズ除去

TV正則化が「データ整合+勾配のL1ペナルティ」でエッジを保つ仕組みを理解する。

圧縮センシングとスパース復元

スパース性とL1最小化により少ない観測から信号を復元できる原理を理解する。

最適輸送と画像

最適輸送が分布間の「運搬コスト最小化」で、Wasserstein距離を与えることを理解する。

ウェーブレット変換と多重解像度解析

ウェーブレットが「位置と尺度の両方に局所的」な多重解像度分解だと理解する。

残差接続と損失地形

残差接続が勾配を通しやすくし、損失地形を平滑にして学習を助けることを理解する。

転置畳み込みとアップサンプリング

転置畳み込みが「入力にカーネルをスタンプして拡大する」操作だと理解する。

拡散モデルのノイズスケジュール

拡散モデルが「加える順過程」と「予測して除く逆過程」からなることを理解する。

自己注意機構の図解

自己注意が「各トークンが全トークンを重み付きで参照する」操作だと理解する。

深度マップと3D点群

深度マップが各画素の距離であり、逆投影で3D点群に変換できることを理解する。

物体検出の評価: IoU・NMS・mAP

IoU・NMS・mAPがそれぞれ「正解判定・重複除去・総合評価」を担うことを理解する。

前提知識

  • 中級レベルの内容(形態学、特徴抽出、古典的物体検出)
  • 機械学習の基礎(損失関数、最適化、過学習)
  • Python, PyTorch / TensorFlow の基本
  • 線形代数、微積分、確率統計

よくある質問

上級の画像処理では何を学ぶか

深層学習による画像分類(CNN)、物体検出(YOLO・SSD・Faster R-CNN)、セマンティックセグメンテーション(U-Net・DeepLab)、GAN・拡散モデルによる画像生成、Vision Transformer、医用画像処理を扱う。加えて副読本で全変動最小化(TV)・圧縮センシング・最適輸送などの変分・スパースモデリングも解説する。

圧縮センシングとはどのような理論か

信号がスパース(多くの成分がほぼゼロ)であるとき、通常のサンプリング定理より少ない観測数から信号を正確に復元できるという理論である。L1最小化(Lasso型問題)で解を求め、MRIの高速スキャンなどに応用される。

全変動(Total Variation)最小化はどのような画像処理に使われるか

ノイズ除去(TV denoising)・画像復元・超解像に使われる。TV正則化はエッジ(不連続点)を保ちながら平坦な領域のノイズを除去する特性があり、医療画像・衛星画像処理で重要な役割を果たす。