チートシート

データセットのサイズ

アルゴリズムは、データセットのサイズによる影響を大きく受けます。50 MB 未満または 1 TB を超えるデータセットに使用すべきアルゴリズムを指定する絶対的な規則はありませんが、データ量を考慮し、サンプルデータセットのバランスが取れていると仮定した場合、まず次のアルゴリズムを試してみることをお勧めします。

  • 決定木
  • 線形モデル (ロジスティック回帰および線形判別を含む)

  • (非線形) SVM
  • 単純ベイズ
  • 最近傍
  • ニューラル ネットワーク (浅い)

  • ディープ ニューラル ネットワーク
  • アンサンブル

学習速度

学習速度とは、特定の計算リソースにおいて、新しいモデルの構築および学習を行うのにかかる時間のことです。特にアルゴリズムのアーキテクチャや複雑度などの要因が、モデルの学習速度に影響します。プロジェクトにおいて学習速度が非常に重要であり、アクセラレーション ハードウェアがない場合は、次のアルゴリズムを検討してください。

  • 決定木
  • 線形モデル (ロジスティック回帰および線形判別を含む)
  • 単純ベイズ

  • アンサンブル
  • 最近傍
  • ニューラル ネットワーク (浅い)

  • (非線形) SVM

  • ディープ ニューラル ネットワーク

解釈可能性

機械学習モデルは、直感的でなく、理解するのが難しい場合があります。解釈可能性とは、アルゴリズムの意思決定プロセスの透明性の高さを指します。ただし、多くの場合、解釈可能性は性能や精度とのトレードオフになります。また、産業分野やアプリケーションによって、解釈可能性に関する具体的な要件が異なる場合もあります。参考として、アルゴリズムの解釈のしやすさを示す大まかな評価を以下に示します。

  • 決定木
  • 線形モデル (ロジスティック回帰および線形判別を含む)

  • 最近傍
  • ニューラル ネットワーク (浅い)
  • 単純ベイズ

  • (非線形) SVM
  • アンサンブル
  • ディープ ニューラル ネットワーク

調整

調整とは、モデルで最良の結果を得るために、特定のモデルのパラメーターまたはハイパーパラメーターを最適化することです。アルゴリズムによっては、調整を前提としておらず、アプリケーションに合わせて最適化するために変更できるパラメーターまたはハイパーパラメーターの数が制限されています。学習させる特定のモデルのタイプを選択した後に、その性能に大きく影響するパラメーターを自動的に変更し、モデルを最適化できます。どの程度の調整を行えるようにしたいですか。

  • 線形モデル (ロジスティック回帰および線形判別を含む)
  • 最近傍

  • 決定木
  • (非線形) SVM
  • アンサンブル
  • 単純ベイズ
  • ニューラル ネットワーク (浅い)

  • ディープ ニューラル ネットワーク