Token
La unidad mínima de texto que procesa un modelo de lenguaje: en promedio, un token equivale a unos 3/4 de una palabra en inglés. Es la unidad de cobro de las APIs de LLM.
Un token es el fragmento de texto que un modelo de lenguaje (LLM) realmente ve. Antes de procesar cualquier frase, el modelo la divide en tokens con un *tokenizador*: las palabras comunes se convierten en un solo token, las largas o raras se parten en varios trozos, y la puntuación y los espacios también cuentan. En español, una palabra suele generar algo más de tokens que en inglés, porque los tokenizadores se entrenan mayoritariamente con texto en inglés.
Los tokens importan por dos razones prácticas:
- Costo: las APIs de LLM cobran por millón de tokens de entrada (lo que envías) y de salida (lo que el modelo genera). Estimar tokens es estimar la factura.
- Límite de contexto: cada modelo tiene un número máximo de tokens que puede considerar a la vez (la "ventana de contexto"). Los documentos más grandes deben resumirse o dividirse.
Ejemplo concreto: la frase "inteligencia artificial generativa" se convierte en unos 6 a 8 tokens según el tokenizador. Un contrato de 20 páginas puede superar los 15.000 tokens, lo que determina si cabe en la ventana del modelo y cuánto cuesta procesarlo.