マルテクテクBETA 生成AIパスポート
Overfitting
Overfitting

Overfitting(過学習(オーバーフィッティング))とは

ひとことで

機械学習モデルが学習データに過度に適合し、学習データでは高い精度を示すのに、未知のデータでは精度が落ちてしまう状態。汎化性能が低い状態ともいえる。

たとえると

過去問の答えを丸暗記した受験生のようなものです。同じ問題なら満点を取れますが、少し表現を変えた本番の問題には対応できません。本当に必要なのは、問題の「解き方」を身につけることです。

現場ではこう使う

需要予測のモデルを作ったデータ分析チームは、過去データでの予測精度がほぼ100%になり喜んでいました。ところが翌月の実データで試すと、予測が大きく外れました。モデルが過去データの偶然の変動まで覚え込んでいたためで、チームは学習に使わない検証用データで評価し、検証用データでの精度が下がり始めた時点で学習を止める(アーリーストッピング)ように改めました。

試験のポイント

EXAM POINT「学習データでは精度が高いが、未知のデータでは精度が低い」と出てきたら過学習です。反対に、未知のデータにも対応できる力を「汎化性能」と呼びます。対策として、データを増やす、モデルを単純にする、正則化やドロップアウト、アーリーストッピング、学習用と検証用にデータを分けて評価することが問われます。学習データでも精度が低い「未学習」と区別しましょう。

混同しやすい用語との違い

  • Hallucination生成AIがもっともらしい誤りを出力する現象。過学習は学習のさせ方に起因する、モデルの汎化の問題
  • Data Poisoning攻撃者が学習データを汚染する攻撃。過学習は攻撃がなくても学習のさせ方で起こる

関連用語

広告

Overfitting が出てくる 生成AIパスポート の問題に挑戦してみましょう。

無料で演習を始める