00 · まず3分で

答えは、3つの要点でわかる

  1. 1トークンは単語全体、単語の一部、記号、バイト列のことがあります。
  2. 2文字列は整数IDへ、IDは学習されたベクトルへ変換されます。
  3. 3トークン数は文脈長や費用に影響しますが、意味の個数ではありません。

01 · 文章を断片へ分ける

文章を断片へ分ける

語彙表には頻出する文字列やバイト列が登録されています。よくある表現は一つ、珍しい名前や綴りは複数のトークンになることがあります。

02 · 断片を番号へ変える

断片を番号へ変える

各トークンには整数IDがあり、モデルは対応するベクトルを参照します。番号そのものに自然な意味はなく、そのの語彙表の中だけで通用します。

FIG. 02仕組みを段階で追う
仕組みの関係を示す概念図です。特記のない形状・縮尺・時間は実測値ではありません。

03 · 区切りは設計上の選択

区切りは設計上の選択

サブワード方式はあらゆる単語を個別登録せずに済む一方、言語・表記・空白によって分割効率が変わります。同じ意味でも消費するトークン数は同じではありません。

04 · 次のトークンを選ぶ

次のトークンを選ぶ

モデルは文脈を処理し、語彙全体の確率分布を出します。そこから一つを選び、末尾へ足して同じ処理を繰り返すことで文章が伸びます。

05 · トークンは思考の単位ではない

トークンは思考の単位ではない

トークンは文字と計算の接続部です。一つが一概念を表すわけではなく、長い列だから議論が深いとも限りません。

06 · 出典と証拠

出典と証拠

主張を、基礎論文・標準文書、または更新記事の一次研究までたどれます。

  1. 01
    Neural Machine Translation of Rare Words with Subword Units

    この記事の仕組み・測定事実・確度の境界を支える資料です。

    一次研究
  2. 02
    SentencePiece: A simple and language independent subword tokenizer

    この記事の仕組み・測定事実・確度の境界を支える資料です。

    一次研究
更新履歴2026年8月29日 · 初回5言語版。仕組み・限界・図解・出典を確認。