Visualizador de Tokenización
Pega texto y ve exactamente en qué tokens lo parte un modelo de lenguaje, con sus IDs. Comprueba por qué el español cuesta más tokens que el inglés.
0
Tokens
104
Caracteres
13
Palabras
—
Caracteres por token
Cargando el tokenizador…
Por qué te importa esto si escribes en español
Los tokenizadores se entrenaron sobre todo con texto en inglés, así que las palabras inglesas frecuentes caben en un token y las españolas se parten en trozos. El mismo contenido cuesta más tokens en español que en inglés — y los tokens son lo que se factura. Pulsa los dos ejemplos de arriba y compara.
Tokenizador o200k_base, el de los modelos actuales de OpenAI. Los de Anthropic y Google usan el suyo, así que el conteo varía algo, pero el comportamiento que se ve aquí es el mismo.
Todo ocurre en tu navegador. El texto no se envía a ningún servidor.
Qué hace esta herramienta
Pegas texto y ves exactamente en qué tokens lo parte el modelo, cada uno con un color distinto y su identificador numérico. No es una estimación: es el mismo tokenizador que usan los modelos actuales de OpenAI, corriendo en tu navegador.
Si lo que necesitas es el coste en dinero, eso está en el contador de tokens. Esto es para entender por qué ese número es el que es.
Qué es un token, en concreto
Ni una letra ni una palabra: un fragmento frecuente que el tokenizador aprendió de su corpus de entrenamiento. Las reglas prácticas que se ven en cuanto empiezas a jugar:
- Una palabra inglesa común cabe en un solo token.
- Una palabra rara, técnica o en otro idioma se parte en varios.
- El espacio va pegado al principio del token siguiente, no al final del anterior. Por eso en la vista de texto verás
·palabracon el punto medio delante: ese espacio forma parte del token. - Los números largos, los identificadores y las URL se trocean sin piedad.
Esa última regla explica de golpe varias rarezas: un UUID que a ti te parece un dato corto puede costar veinte tokens, y un JSON con claves largas repetidas cientos de veces es mucho más caro de lo que aparenta.
El español cuesta más, y se ve
Este es el motivo principal de que la herramienta exista, y es fácil de comprobar: pulsa los dos botones de ejemplo y compara los contadores.
Los tokenizadores se entrenaron mayoritariamente con texto en inglés. La consecuencia es que las palabras inglesas frecuentes tienen su propio token, mientras que las españolas —con sus tildes, sus terminaciones largas y su menor presencia en el corpus— se parten en trozos.
Un ejemplo que verás en la propia herramienta: tokenización se parte en token + ización. prueba es un token entero, pero internacionalización son varios.
Traducido a factura: el mismo contenido en español consume más tokens que en inglés, y eso se paga dos veces —en el prompt que envías y en la respuesta que recibes—. Si estás construyendo algo con volumen sobre una API de pago, es una diferencia real, no una curiosidad.
No hay truco para esquivarlo del todo, pero saberlo cambia decisiones: dónde recortar contexto, si merece la pena resumir antes de enviar, y qué tan optimista es tu estimación de coste si la calculaste con texto en inglés.
Por qué los modelos fallan contando letras
La pregunta clásica —«¿cuántas erres tiene ferrocarril?»— se responde mal con sorprendente frecuencia, y aquí se ve el motivo: el modelo nunca vio las letras sueltas. Vio dos o tres fragmentos. Pedirle que cuente caracteres es pedirle que razone sobre algo que no está en su representación de entrada.
Lo mismo pasa con invertir palabras, contar sílabas o hacer juegos de letras. No es que el modelo sea tonto en eso: es que está mirando otra cosa.
Qué tokenizador es este
o200k_base, el de los modelos actuales de OpenAI. El conteo es exacto para ellos.
Anthropic y Google usan tokenizadores propios y no publican una implementación local equivalente, así que sus cifras varían algo —el contador de tokens aplica un factor de ajuste para esos casos y lo dice—. Pero el comportamiento que se observa aquí es común a todos: qué se parte y qué no, el espacio pegado por delante, y que el español sale más caro.
Lo que no hace
- No llama a ninguna API. El tokenizador se descarga a tu navegador y el cálculo ocurre ahí; puedes comprobarlo en la pestaña de red.
- No calcula precios. Eso es el contador de tokens, que además mantiene la tabla de tarifas.
- No cuenta tokens de imágenes ni de audio. Los modelos multimodales los tarifan aparte y con otra lógica.
Preguntas frecuentes
¿Qué es exactamente un token?
Es la unidad en la que un modelo lee y escribe. No son ni letras ni palabras: son fragmentos frecuentes que el tokenizador aprendió de su corpus de entrenamiento. Una palabra común suele caber en un token, una rara se parte en varios, y los espacios normalmente van pegados al principio del token siguiente. Por eso el conteo no coincide ni con caracteres ni con palabras.
¿Por qué el español gasta más tokens que el inglés?
Porque los tokenizadores se entrenaron sobre todo con texto en inglés, así que las palabras inglesas frecuentes tienen su propio token y las españolas se trocean. Traducido a factura: el mismo contenido en español cuesta más que en inglés, tanto en el prompt como en la respuesta. Puedes comprobarlo con los dos botones de ejemplo de la herramienta.
¿Sirve para Claude y Gemini o solo para OpenAI?
El tokenizador que se usa aquí es o200k_base, el de los modelos actuales de OpenAI, así que el conteo es exacto para ellos. Anthropic y Google usan tokenizadores propios y no publican una implementación local equivalente, de modo que sus números varían algo. El comportamiento que se observa —qué se parte y qué no, y que el español cuesta más— es el mismo en todos.
¿Para qué me sirve ver los tokens y no solo contarlos?
Para entender de dónde sale el coste y por qué a veces un modelo se comporta raro. Ver que un identificador, una URL o un JSON se parten en diez tokens explica por qué un prompt aparentemente corto es caro. También aclara los fallos clásicos de contar letras o de partir palabras: el modelo nunca vio las letras sueltas, vio esos fragmentos.
¿Se envía mi texto a algún servidor?
No. El tokenizador se descarga a tu navegador y todo el cálculo ocurre ahí. No hay ninguna llamada a la API de OpenAI ni a ninguna otra, cosa que puedes comprobar en la pestaña de red de las herramientas de desarrollo.
Reseñas y valoraciones
Aún no hay reseñas. ¡Sé la primera persona en opinar!
Guías relacionadas
Tutoriales del blog donde esta herramienta resulta útil.
Herramientas relacionadas
Otras del catálogo que se usan bien junto a esta.