Word2Vec
Word2Vec
Word2Vec(Word2Vec(ワードツーベック))とは
ひとことで
単語を、意味の近さが反映された数値のベクトル(分散表現)に変換する手法。「似た文脈に現れる単語は似た意味を持つ」という分布仮説に基づき、浅いニューラルネットワークで学習する。2013年にGoogleのトマス・ミコロフらが発表した。
たとえると
「よく同じ人たちと一緒にいる人は、似た立場の人だろう」と推測して、全員の座席表を作るようなものです。いつも似た仲間と一緒に現れる単語どうしは、座席表でも近くに配置されます。
現場ではこう使う
ECサイトの検索担当者は、「ノートPC」で検索した人に「ラップトップ」の商品が出てこないことに悩んでいました。商品説明文からWord2Vecで単語のベクトルを学習させると、2つの単語が近いベクトルになったため、意味の近い語を検索の候補に加える仕組みを作りました。
試験のポイント
EXAM POINT「単語の分散表現」「分布仮説」と出てきたらWord2Vecです。周りの単語から中心の単語を予測するCBOWと、中心の単語から周りの単語を予測するskip-gramの2つの方式の区別がよく問われます。「王 − 男 + 女 ≒ 女王」のようにベクトルの足し引きで意味の関係を表せる点も有名です。1単語に1つのベクトルなので多義語を区別できず、文脈に応じた表現を作るBERTなどへ発展しました。
混同しやすい用語との違い
- Embedding単語や文章をベクトルに変換すること全般を指す。Word2Vecは単語の埋め込みを学習する具体的な手法
- BERT文脈によって同じ単語でも異なるベクトルになる。Word2Vecは1単語に1つの固定ベクトル