データ・DX
過学習とは?
読み: かがくしゅう英語: Overfitting更新日: 2026-06-26
過学習とは、学習データにはよく合うが、新しいデータへの予測性能が低くなる状態です。
DS検定G検定
関連表記: 過学習 / Overfitting / オーバーフィッティング
試験で問われるポイント
- 訓練データと検証データの性能差で気づくことがあります。
- 交差検証、正則化、データ分割、モデル複雑度の調整と関係します。
- DS検定やG検定では評価と汎化性能の文脈で問われやすいです。
具体例
過去データでは高精度なのに、実運用では予測が外れやすい状態です。
混同しやすい点
- 訓練データの正解率だけでモデルが良いと判断する。
- データを増やせば必ず過学習が解決すると考える。
関連問題で復習
DS検定データサイエンス
分類モデルAとBを同じ分割データで評価した。Aは学習データ99%、検証データ68%、Bは学習データ86%、検証データ83%だった。過学習の疑いが強いモデルはどれか。
生成AIパスポートAI(人工知能)
画像分類モデルの過学習を抑える対応として適切なものを3つ選べ。
生成AIパスポートAI(人工知能)
学習中に一部のノードをランダムに無効化し、過学習を抑える手法はどれか。
生成AIパスポートAI(人工知能)
過学習を抑えるための「重みへのペナルティ等を加える正則化」と「ドロップアウト」の説明として適切なものはどれか。
AWS AI PractitionerAI・機械学習の基礎
同じ時期に集めたデータを訓練用とテスト用に分離しました。複雑な分類モデルは訓練用で高精度ですが、テスト用では精度が大きく下がります。まず疑うべき状態はどれですか。
AWS AI Practitioner生成AIの基礎
生成AIの評価で、根拠資料と一致しない説明が自然な文章で出力され、同じ入力を繰り返すと表現や内容にも違いが見られました。観察結果に対応する制約を2つ選んでください。
AWS AI Practitioner責任あるAIの指針
分類モデルAは学習データでも評価用データでも誤りが多く、モデルBは学習データでは良好ですが評価用データで大きく悪化します。典型的な傾向の組み合わせとして適切なのはどれですか。
AWS AI PractitionerAI・機械学習の基礎
予測モデルの監視で、訓練時に少なかった年齢層の入力が増えていることが分かりました。現時点では新しい正解ラベルがなく、入力と正解の関係が変わったかは確認できません。直接確認できている変化はどれですか。