データ・DX
統計とは?
統計とは、データのばらつきや傾向を整理し、判断に使うための考え方です。
関連表記: 統計 / Statistics / 統計学
試験で問われるポイント
- 平均、分散、標準偏差、分布などの基本を押さえます。
- 推定・検定や機械学習の土台になります。
- DS検定では用語暗記だけでなく、結果の読み取りが重要です。
具体例
売上データの平均だけでなく、ばらつきや外れ値も見て判断します。
混同しやすい点
- 平均だけ見ればデータの特徴が分かると考える。
- 統計と機械学習を完全に別物として扱う。
関連問題で復習
記述統計の説明として、最も適切なものはどれか。
正規化手法と統計量を求める単位に関する次の記述のうち、適切なものの組合せはどれか。a. バッチ正規化は訓練時、同じ特徴をミニバッチ内の複数サンプルにわたって正規化する。b. レイヤー正規化は一つの画像の各チャンネルについて空間方向だけを正規化する。c. インスタンス正規化は一つのサンプルの各チャンネル内で空間方向の統計量を求める。d. グループ正規化はチャンネルを群に分けるが、各群の統計量はミニバッチ内の全サンプルで共有する。
ある施策のCVRはA案4.0%(対象100件)、B案3.8%(対象10,000件)だった。判断として最も適切なものはどれか。
複数事業のAI化を検討しています。十分なラベル付きデータと計算資源を用意できる場合、深層学習の表現学習の強みを特に生かしやすい対象はどれですか。
分類モデルAは学習データでも評価用データでも誤りが多く、モデルBは学習データでは良好ですが評価用データで大きく悪化します。典型的な傾向の組み合わせとして適切なのはどれですか。
外国人利用者を含む窓口業務の待ち時間を改善する。日本語を母語とする管理職だけで分析要件を決めようとしている。より適切な進め方はどれか。
施策AとBの平均に差がないという帰無仮説を、有意水準5%で検定したところp値は0.03だった。最も適切な判断はどれか。
二つの量的変数X、Yについて、平均からの偏差を用いた集計値が次のとおりだった。また、部署(名義尺度)と購入有無の関連も調べたい。量的変数のPearson相関係数と、部署・購入有無の関連に適した考え方の組合せはどれか。 ```text Σ(xi-x̄)(yi-ȳ)=24 Σ(xi-x̄)^2=36 Σ(yi-ȳ)^2=16 ```