マルテクテクBETA G検定
k-means
k-means Clustering

k-means(k平均法(k-means法))とは

ひとことで

データをあらかじめ決めたk個のグループ(クラスタ)に分ける教師なし学習の手法。各データを最も近いクラスタの中心に割り当て、中心を計算し直す処理を、変化がなくなるまで繰り返す。

たとえると

広場に散らばった人たちを、旗を持った3人のリーダーのもとに「一番近い旗に集まって」と呼びかけ、集まった人たちの真ん中に旗を立て直す作業を繰り返すようなものです。何度か繰り返すと、自然なグループに落ち着きます。

現場ではこう使う

小売チェーンのマーケティング担当者は、会員の購入金額や来店頻度のデータをk-means法で4つのグループに分けました。正解のラベルがないデータからでも「高頻度・少額」「低頻度・高額」などの顧客層が見えてきたため、グループごとに異なるキャンペーンを企画しました。

試験のポイント

EXAM POINT「データをk個のクラスタに分ける」「教師なし学習」「クラスタリング」と出てきたらk-means法です。kの値は人があらかじめ決める必要があり、最初の中心の選び方で結果が変わる点が問われます。名前の似たk近傍法(k-NN)は、近くのデータの多数決でクラスを決める教師あり学習の分類手法なので混同しないようにしましょう。

混同しやすい用語との違い

  • PCAデータの次元(項目数)を減らす教師なし学習。k-means法はデータをグループに分ける
  • SVM正解ラベルを使ってクラスの境界を学ぶ教師あり学習の分類手法

関連用語

広告

k-means が出てくる G検定 の問題に挑戦してみましょう。

無料で演習を始める