Estime o custo de perguntas sobre documentos com IA antes que ele se acumule

Informe quantas perguntas seu assistente de perguntas sobre documentos responde por mês para obter uma faixa de custo mensal Baixo / Esperado / Alto. Tudo é calculado localmente no seu navegador — nenhum dado é enviado a um servidor.

  • Sem login
  • Sem cartão de crédito
  • Sem chamadas de API
  • Apenas uma estimativa

Configure suas perguntas sobre documentos

Custo mensal estimado

Isto estima o custo de inferência do modelo para responder a uma pergunta depois que o texto relevante já foi recuperado. Não inclui a ingestão de documentos, OCR, embeddings, hospedagem de banco de dados vetorial ou infraestrutura de recuperação — esses custos são cobrados separadamente pelas ferramentas que você usa para montar a etapa de recuperação.

Custo mensal esperado$1.01Faixa estimada: $0.6450$1.50
Custo por pergunta
Baixo$0.001290Esperado$0.002025Alto$0.003000
Contexto recuperado / pergunta
Baixo300Esperado500Alto700
Tokens de entrada / pergunta
Baixo520Esperado900Alto1.3K
Tokens de saída / pergunta
Baixo200Esperado300Alto450
Total de tokens mensais
Baixo360KEsperado600KAlto875K

Isto é uma estimativa, não uma garantia de cobrança real. O custo real depende do tokenizador do seu provedor, do tamanho real da recuperação e do seu plano de faturamento.

Entenda e confie nestes números Metodologia O que são tokens de IA? Por que a conta te surpreende Calculadora de resumo de documentos

Como esta estimativa funciona

Entrada — o que você envia
  • Instrução / system prompt
  • A pergunta do usuário
  • Contexto de documento recuperado
Modelo

Lê a pergunta e as passagens recuperadas, e então escreve uma resposta.

Saída — o que você recebe

Uma resposta baseada no texto recuperado.

"RAG" (geração aumentada por recuperação) significa simplesmente: encontrar os trechos mais relevantes dos seus documentos para uma pergunta e depois pedir ao modelo que responda usando apenas esse texto recuperado. Esta calculadora começa a contar o custo depois que essa etapa de recuperação já aconteceu.

O que não está incluído: a infraestrutura de recuperação

Esta calculadora estima o custo de inferência do modelo para responder a uma pergunta depois que o texto relevante já foi recuperado — não inclui a ingestão de documentos, OCR, embeddings, hospedagem ou busca em bancos de dados vetoriais, reordenação (reranking) ou qualquer outra infraestrutura de recuperação.

Essas etapas são cobradas separadamente pelo modelo de embeddings, banco de dados vetorial e serviço de recuperação que você usa para montar o pipeline de recuperação, e não fazem parte desta estimativa.

Baixo / Esperado / Alto explicados

Baixo

Recuperação focada, pergunta curta, resposta curta.

Esperado

Profundidade de recuperação padrão e tamanho típico de pergunta/resposta. Planeje com este número.

Alto

Recuperação ampla, pergunta longa, resposta longa. Faça o orçamento com este número.

Reduza seu custo

1
Recupere menos. Uma janela de recuperação mais estreita e relevante costuma ser a maior alavanca de custo.
2
Mantenha a instrução enxuta. Ela se repete em cada pergunta.
3
Combine o modelo com a tarefa. Perguntas de rotina raramente precisam de um modelo de ponta.

Exemplos de custo mensal

Estes exemplos práticos usam as mesmas premissas padrão da calculadora acima — perguntas e respostas de tamanho médio, profundidade de recuperação padrão, uma instrução padrão — com GPT-5.4 Mini. Apenas o número de perguntas por mês muda entre as linhas. Use a calculadora acima para modelar seu próprio uso ou um modelo diferente.

Nível de usoPerguntas / mêsBaixoEsperadoAlto
Uso leve 100 $0.1290 $0.2025 $0.3000
Uso típico 500 $0.6450 $1.01 $1.50
Uso intenso 2,000 $2.58 $4.05 $6.00

Ressalvas

  • Estas estimativas usam as mesmas faixas de tokens de referência da calculadora de chatbot do site para o tamanho de perguntas e respostas, com precisão de ± 10–15% para texto em inglês simples.
  • Cada provedor usa um tokenizador diferente. A contagem real de tokens pode variar ±5–10% entre OpenAI, Anthropic, Google, Mistral e DeepSeek para o mesmo conteúdo.
  • O custo da infraestrutura de recuperação (embeddings, banco de dados vetorial, reranking) não está incluído. Esta ferramenta estima apenas o custo da própria chamada de geração de resposta do modelo.
  • Os preços exibidos foram verificados manualmente na página oficial de preços de cada provedor em 2026-09-08. Os preços dos provedores de IA mudam com frequência — verifique na página oficial de preços do seu provedor antes de tomar decisões de orçamento.
  • "Focada"/"padrão"/"ampla" são rótulos descritivos próprios deste projeto para tamanhos típicos de contexto recuperado, não uma afirmação de terminologia padrão da indústria — use "Personalizado" e informe uma contagem exata de tokens para a estimativa mais precisa.
  • O aviso sobre a janela de contexto acima aparece quando os tokens combinados do cenário Alto ultrapassam 80% da janela de contexto do modelo selecionado — uma margem de segurança antes do risco de truncamento ou falha, não um limite rígido em 100%.

Isto é uma estimativa, não uma garantia de cobrança real. Sempre confirme no painel de uso do seu provedor e nos preços oficiais antes de comprometer um orçamento.