Un token es un fragmento de texto, no una palabra
Un token es un pequeño fragmento de texto que el modelo lee o escribe — a veces una palabra completa, a veces parte de una, a veces un solo signo de puntuación. Como regla general aproximada para texto en inglés simple, caracteres ÷ 4 ≈ tokens — la misma estimación que usa la propia calculadora de T9, precisa aproximadamente al ±10–15% para prosa en inglés típica. Otros idiomas pueden tokenizar de forma menos eficiente: el texto en portugués o español suele necesitar más tokens que el mismo significado expresado en inglés.
Solo una ilustración, no es la salida exacta de un tokenizador — "Summarize this meeting." dividido en fragmentos del tamaño de un token, como podría hacerlo un tokenizador de subpalabras. Los proveedores reales pueden dividir el mismo texto de forma distinta.
"Summarize this meeting." tiene 23 caracteres. Usando la estimación caracteres ÷ 4 de arriba: 23 ÷ 4 ≈ 6 tokens. Un tokenizador real puede quedar un token por encima o por debajo — esto es una estimación de planificación, no un conteo exacto.
Tokens de entrada frente a tokens de salida
Los proveedores cuentan y cobran estas dos direcciones por separado:
Tokens de entrada
Todo lo que tu aplicación envía al modelo en una llamada dada: el mensaje del usuario, el system prompt, cualquier contexto de base de conocimiento recuperado y (en un chat de varios turnos) el historial de la conversación reenviado como contexto.
Tokens de salida
El texto que el modelo genera como respuesta. La salida suele facturarse a una tarifa notablemente más alta que la entrada, así que una respuesta extensa cuesta más que una concisa de longitud aparentemente similar.
¿Qué es una ventana de contexto?
La ventana de contexto de un modelo es el número máximo de tokens — entrada más salida combinados — que puede manejar en una sola llamada. Una ventana más grande te permite enviar más historial o más contenido de documentos recuperados, pero cada token que pones en ella es un token que pagas; una ventana más grande no hace que los tokens sean gratis, solo eleva el límite de cuánto puedes enviar a la vez.
Por qué importa el historial de la conversación
En un chat de varios turnos, la mayoría de las API no tienen estado: tu aplicación tiene que reenviar toda la conversación hasta ese momento como entrada en cada nuevo mensaje, no solo la última línea. Eso significa que una conversación de cinco mensajes no cuesta cinco veces un mensaje — cuesta notablemente más, porque cada mensaje anterior se paga de nuevo en cada turno posterior.
El system prompt y el contexto de base de conocimiento también cuentan
Otras dos cosas se suman silenciosamente a los tokens de entrada en cada llamada: el system prompt (las instrucciones fijas que tu aplicación envía antes del propio mensaje del usuario, en cada solicitud), y cualquier contexto de base de conocimiento o recuperado que tu aplicación inyecte para una respuesta con recuperación aumentada (RAG). Ambos son fáciles de subestimar porque son invisibles para el usuario final, pero ambos se facturan como cualquier otro token de entrada.
Júntalo todo
Una vez que puedas ver los tokens de entrada, los tokens de salida, el historial, el system prompt y el contexto como piezas separadas y sumables, podrás razonar sobre el costo en lugar de adivinarlo. Cada calculadora de este sitio convierte esas piezas en una estimación de costo de la misma forma:
Costo estimado = (tokens de entrada ÷ 1.000.000) × precio de entrada + (tokens de salida ÷ 1.000.000) × precio de salida Mira el desarrollo completo — fuentes de precios, supuestos y ejemplos calculados — en nuestra metodología.