マルテクテクBETA 生成AIパスポート
Pre-training
Pre-training

Pre-training(事前学習)とは

ひとことで

大量のデータを使って、モデルに言語や世界についての幅広い知識やパターンを身につけさせる最初の学習段階。LLMでは、文章の続き(次のトークン)を予測する学習を大量に繰り返す。

たとえると

社会人になる前の「学校教育」のようなものです。特定の仕事のための訓練ではありませんが、読み書きや一般常識といった土台を幅広く身につけます。専門的な仕事の訓練(ファインチューニング)は、その土台の上に行います。

現場ではこう使う

社内でAI活用を推進する担当者が、「生成AIはなぜ自社の最新の規程を知らないのか」と質問を受けました。担当者は、モデルが知識を得る事前学習はある時点までに集めたデータで行われており、その後の情報や社内だけの情報は含まれていないと説明しました。そのうえで、最新の規程はRAGで検索してAIに渡す仕組みを導入しました。

試験のポイント

EXAM POINT「大量のデータで最初に行う学習」「次のトークン(単語)を予測する学習」と出てきたら事前学習です。その後に特定の用途や指示への応答に合わせるファインチューニング(追加学習)や、人の評価で調整するRLHFと、学習の段階の違いが問われます。事前学習のデータには時期の区切りがあるため、それ以降の情報は知らない点(知識のカットオフ)も押さえましょう。

混同しやすい用語との違い

  • Fine-tuning事前学習済みのモデルを、特定の用途向けのデータで追加学習させる
  • RLHF人の評価をもとに、応答を人の好みや安全性に沿うよう調整する
  • RAGモデルを学習させず、利用時に外部の資料を検索して渡す

関連用語

広告

Pre-training が出てくる 生成AIパスポート の問題に挑戦してみましょう。

無料で演習を始める