00 · まず3分で
答えは、3つの要点でわかる
- 1トークンは単語全体、単語の一部、記号、バイト列のことがあります。
- 2文字列は整数IDへ、IDは学習されたベクトルへ変換されます。
- 3トークン数は文脈長や費用に影響しますが、意味の個数ではありません。
01 · 文章を断片へ分ける
文章を断片へ分ける
語彙表には頻出する文字列やバイト列が登録されています。よくある表現は一つ、珍しい名前や綴りは複数のトークンになることがあります。
02 · 断片を番号へ変える
断片を番号へ変える
各トークンには整数IDがあり、モデルは対応するベクトルを参照します。番号そのものに自然な意味はなく、そのの語彙表の中だけで通用します。
文章を断片へ分ける
語彙表には頻出する文字列やバイト列が登録されています。よくある表現は一つ、珍しい名前や綴りは複数のトークンになることがあります。
文字 → 断片断片を番号へ変える
各トークンには整数IDがあり、モデルは対応するベクトルを参照します。番号そのものに自然な意味はなく、そのトークナイザーの語彙表の中だけで通用します。
断片 → ID区切りは設計上の選択
サブワード方式はあらゆる単語を個別登録せずに済む一方、言語・表記・空白によって分割効率が変わります。同じ意味でも消費するトークン数は同じではありません。
ID → ベクトル次のトークンを選ぶ
モデルは文脈を処理し、語彙全体の確率分布を出します。そこから一つを選び、末尾へ足して同じ処理を繰り返すことで文章が伸びます。
確率 → 次の断片03 · 区切りは設計上の選択
区切りは設計上の選択
サブワード方式はあらゆる単語を個別登録せずに済む一方、言語・表記・空白によって分割効率が変わります。同じ意味でも消費するトークン数は同じではありません。
04 · 次のトークンを選ぶ
次のトークンを選ぶ
モデルは文脈を処理し、語彙全体の確率分布を出します。そこから一つを選び、末尾へ足して同じ処理を繰り返すことで文章が伸びます。
05 · トークンは思考の単位ではない
トークンは思考の単位ではない
トークンは文字と計算の接続部です。一つが一概念を表すわけではなく、長い列だから議論が深いとも限りません。
06 · 出典と証拠
出典と証拠
主張を、基礎論文・標準文書、または更新記事の一次研究までたどれます。
- 01Neural Machine Translation of Rare Words with Subword Units一次研究 ↗
この記事の仕組み・測定事実・確度の境界を支える資料です。
- 02SentencePiece: A simple and language independent subword tokenizer一次研究 ↗
この記事の仕組み・測定事実・確度の境界を支える資料です。
