Token
Token
Token(トークン)とは
ひとことで
LLMが文章を処理するときの最小単位。単語や文字、単語の一部などに区切られ、利用料金や一度に扱える文章量(コンテキストウィンドウ)もトークン数で数えられることが多い。
たとえると
文章を、AIが扱いやすい大きさの「積み木」に切り分けたものです。英語ではおおむね単語やその一部が1つの積み木になり、日本語では1文字や数文字ごとに区切られることが多いです。AIはこの積み木を1つずつ並べて文章を組み立てます。
現場ではこう使う
情報システム部門が、生成AIのAPIを社内システムに組み込むための予算を見積もっていました。料金表は文字数ではなくトークン数あたりで示されており、試しに同じ内容の文書を日本語と英語で処理すると、トークン数が異なることがわかりました。そこで実際の業務文書でトークン数を計測してから、月々の利用料を見積もるようにしました。
試験のポイント
EXAM POINT「LLMがテキストを処理する単位」と出てきたらトークンです。LLMは次のトークンを予測することで文章を生成し、一度に扱える量(コンテキストウィンドウ)や利用料金もトークン数で数えられるのが一般的です。同じ内容でも言語によってトークン数が変わる点や、文字数・単語数とは一致しない点に注意しましょう。
混同しやすい用語との違い
- Context Window一度に入力・出力できるトークン数の上限。トークンはその数える単位
- Embeddingトークンや文章を、意味を表す数値のベクトルに変換したもの
- LLMトークンの並びを受け取り、次のトークンを予測して文章を生成するモデル。トークンはモデルではなく処理の単位