00 · EN TROIS MINUTES

La réponse en trois idées

  1. 1Un token peut être un mot, un fragment, un signe ou une suite d’octets.
  2. 2Le texte devient des identifiants, puis des vecteurs appris.
  3. 3Le nombre influe sur le contexte et le coût, pas sur le nombre d’idées.

01 · DÉCOUPER LE TEXTE

Découper le texte

Un vocabulaire réutilise des suites fréquentes ; noms rares et certaines écritures exigent plusieurs fragments.

02 · NUMÉROTER LES FRAGMENTS

Numéroter les fragments

Chaque entrée a un ID associé à un vecteur ; le nombre n’a pas de sens naturel hors de ce vocabulaire.

FIG. 02Suivre les changements du système
Carte conceptuelle du mécanisme ; géométrie, échelle et durée ne sont pas mesurées sauf indication.

03 · LE DÉCOUPAGE EST CONÇU

Le découpage est conçu

Les sous-mots réduisent le vocabulaire mais segmentent langues, graphies et espaces de façon inégale.

04 · PRÉDIRE LE SUIVANT

Prédire le suivant

Le réseau produit des probabilités sur le vocabulaire, choisit un token, l’ajoute et recommence.

05 · UN TOKEN N’EST PAS UNE PENSÉE

Un token n’est pas une pensée

C’est une interface texte-calcul : un fragment n’équivaut pas à un concept.

06 · SOURCES ET ÉLÉMENTS DE PREUVE

Sources et éléments de preuve

Les affirmations remontent aux articles fondateurs, aux normes ou à l’étude primaire de la mise à jour.

  1. 01
    Neural Machine Translation of Rare Words with Subword Units

    Cette source étaye un mécanisme, une mesure ou une limite de preuve définie dans l’article.

    ÉTUDE PRIMAIRE
  2. 02
    SentencePiece: A simple and language independent subword tokenizer

    Cette source étaye un mécanisme, une mesure ou une limite de preuve définie dans l’article.

    ÉTUDE PRIMAIRE
HISTORIQUE29 août 2026 · Première édition en cinq langues ; mécanisme, limites, figures et sources vérifiés.