00 · EN TRES MINUTOS

La respuesta en tres ideas

  1. 1Un token puede ser palabra, fragmento, signo o secuencia de bytes.
  2. 2El texto pasa a identificadores y estos a vectores aprendidos.
  3. 3El recuento afecta contexto y coste, pero no mide conceptos.

01 · EL TEXTO SE DIVIDE

El texto se divide

Un vocabulario reutiliza secuencias frecuentes; nombres raros y algunas escrituras pueden necesitar varias piezas.

02 · LAS PIEZAS RECIBEN NÚMEROS

Las piezas reciben números

Cada entrada tiene un ID que apunta a un vector; el número no posee significado natural fuera de ese vocabulario.

FIG. 02Cómo cambia el sistema
Mapa conceptual del mecanismo; la geometría, la escala y el tiempo no son mediciones salvo indicación.

03 · LA DIVISIÓN ES UNA DECISIÓN

La división es una decisión

Los subwords reducen el vocabulario, a cambio de segmentaciones desiguales entre idiomas, ortografías y formatos.

04 · SE PREDICE OTRA PIEZA

Se predice otra pieza

La red produce una distribución sobre el vocabulario, elige un token, lo añade y repite el proceso.

05 · UN TOKEN NO ES UN PENSAMIENTO

Un token no es un pensamiento

Es una interfaz entre texto y cálculo: una pieza no equivale a un concepto ni más piezas implican mayor profundidad.

06 · FUENTES Y EVIDENCIAS

Fuentes y evidencias

Las afirmaciones se remontan a artículos fundamentales, normas o al estudio primario de la actualización.

  1. 01
    Neural Machine Translation of Rare Words with Subword Units

    Sustenta un mecanismo, una medición o un límite de evidencia definido en el artículo.

    ESTUDIO PRIMARIO
  2. 02
    SentencePiece: A simple and language independent subword tokenizer

    Sustenta un mecanismo, una medición o un límite de evidencia definido en el artículo.

    ESTUDIO PRIMARIO
HISTORIAL29 ago 2026 · Primera edición en cinco idiomas; revisados mecanismo, límites, figuras y fuentes.