Um token é um pedaço de texto, não uma palavra

Um token é um pequeno pedaço de texto que o modelo lê ou escreve — às vezes uma palavra inteira, às vezes parte de uma, às vezes um único sinal de pontuação. Como regra geral aproximada para texto em inglês simples, caracteres ÷ 4 ≈ tokens — a mesma estimativa usada pela própria calculadora do T9, precisa em aproximadamente ±10–15% para prosa típica em inglês. Outros idiomas podem tokenizar de forma menos eficiente: texto em português ou espanhol costuma precisar de mais tokens do que o mesmo significado expresso em inglês.

Summarize this meeting.

Apenas ilustração, não é a saída exata de um tokenizador — "Summarize this meeting." dividido em pedaços do tamanho de tokens, do jeito que um tokenizador de subpalavras poderia dividir. Provedores reais podem dividir o mesmo texto de forma diferente.

Exemplo

"Summarize this meeting." tem 23 caracteres. Usando a estimativa caracteres ÷ 4 acima: 23 ÷ 4 ≈ 6 tokens. Um tokenizador real pode ficar um token a mais ou a menos — isto é uma estimativa de planejamento, não uma contagem exata.

Tokens de entrada vs. tokens de saída

Os provedores contam e precificam essas duas direções separadamente:

Tokens de entrada

Tudo que sua aplicação envia ao modelo em uma chamada: a mensagem do usuário, o system prompt, qualquer contexto de base de conhecimento recuperado e (em um chat de múltiplos turnos) o histórico da conversa reenviado como contexto.

Tokens de saída

O texto que o modelo gera como resposta. A saída costuma ser cobrada a uma taxa consideravelmente mais alta que a entrada, então uma resposta mais longa custa mais que uma concisa de comprimento aparentemente parecido.

O que é uma janela de contexto?

A janela de contexto de um modelo é o número máximo de tokens — entrada mais saída combinados — que ele consegue processar em uma única chamada. Uma janela maior permite incluir mais histórico ou mais conteúdo de documentos recuperados, mas cada token que você coloca nela é um token que você paga; uma janela maior não torna os tokens gratuitos, ela só eleva o teto de quanto você pode enviar de uma vez.

Por que o histórico da conversa importa

Em um chat de múltiplos turnos, a maioria das APIs não guarda estado: sua aplicação precisa reenviar toda a conversa até aquele ponto como entrada a cada nova mensagem, não apenas a última linha. Isso significa que uma conversa de cinco mensagens não custa cinco vezes uma mensagem — custa consideravelmente mais, porque cada mensagem anterior é paga de novo em cada turno posterior.

System prompt e contexto de base de conhecimento também contam

Outras duas coisas se somam silenciosamente aos tokens de entrada em cada chamada: o system prompt (as instruções fixas que sua aplicação envia antes da própria mensagem do usuário, em cada requisição), e qualquer base de conhecimento ou contexto recuperado que sua aplicação injete para uma resposta com recuperação aumentada (RAG). Ambos são fáceis de subestimar porque são invisíveis para o usuário final, mas ambos são cobrados como qualquer outro token de entrada.

Juntando tudo

Uma vez que você consegue ver tokens de entrada, tokens de saída, histórico, system prompt e contexto como peças separadas e somáveis, você pode raciocinar sobre o custo em vez de chutá-lo. Toda calculadora deste site transforma essas peças em uma estimativa de custo da mesma forma:

Custo estimado = (tokens de entrada ÷ 1.000.000) × preço de entrada + (tokens de saída ÷ 1.000.000) × preço de saída

Veja o passo a passo completo — fontes de preço, premissas e exemplos calculados — na nossa metodologia.

Leitura relacionada