Estime o custo de perguntas sobre documentos com IA antes que ele se acumule
Informe quantas perguntas seu assistente de perguntas sobre documentos responde por mês para obter uma faixa de custo mensal Baixo / Esperado / Alto. Tudo é calculado localmente no seu navegador — nenhum dado é enviado a um servidor.
- Sem login
- Sem cartão de crédito
- Sem chamadas de API
- Apenas uma estimativa
Configure suas perguntas sobre documentos
Custo mensal estimado
Isto estima o custo de inferência do modelo para responder a uma pergunta depois que o texto relevante já foi recuperado. Não inclui a ingestão de documentos, OCR, embeddings, hospedagem de banco de dados vetorial ou infraestrutura de recuperação — esses custos são cobrados separadamente pelas ferramentas que você usa para montar a etapa de recuperação.
Isto é uma estimativa, não uma garantia de cobrança real. O custo real depende do tokenizador do seu provedor, do tamanho real da recuperação e do seu plano de faturamento.
Como esta estimativa funciona
- Instrução / system prompt
- A pergunta do usuário
- Contexto de documento recuperado
Lê a pergunta e as passagens recuperadas, e então escreve uma resposta.
Uma resposta baseada no texto recuperado.
"RAG" (geração aumentada por recuperação) significa simplesmente: encontrar os trechos mais relevantes dos seus documentos para uma pergunta e depois pedir ao modelo que responda usando apenas esse texto recuperado. Esta calculadora começa a contar o custo depois que essa etapa de recuperação já aconteceu.
O que não está incluído: a infraestrutura de recuperação
Esta calculadora estima o custo de inferência do modelo para responder a uma pergunta depois que o texto relevante já foi recuperado — não inclui a ingestão de documentos, OCR, embeddings, hospedagem ou busca em bancos de dados vetoriais, reordenação (reranking) ou qualquer outra infraestrutura de recuperação.
Essas etapas são cobradas separadamente pelo modelo de embeddings, banco de dados vetorial e serviço de recuperação que você usa para montar o pipeline de recuperação, e não fazem parte desta estimativa.
Baixo / Esperado / Alto explicados
Recuperação focada, pergunta curta, resposta curta.
Profundidade de recuperação padrão e tamanho típico de pergunta/resposta. Planeje com este número.
Recuperação ampla, pergunta longa, resposta longa. Faça o orçamento com este número.
Reduza seu custo
Exemplos de custo mensal
Estes exemplos práticos usam as mesmas premissas padrão da calculadora acima — perguntas e respostas de tamanho médio, profundidade de recuperação padrão, uma instrução padrão — com GPT-5.4 Mini. Apenas o número de perguntas por mês muda entre as linhas. Use a calculadora acima para modelar seu próprio uso ou um modelo diferente.
| Nível de uso | Perguntas / mês | Baixo | Esperado | Alto |
|---|---|---|---|---|
| Uso leve | 100 | $0.1290 | $0.2025 | $0.3000 |
| Uso típico | 500 | $0.6450 | $1.01 | $1.50 |
| Uso intenso | 2,000 | $2.58 | $4.05 | $6.00 |
Ressalvas
- Estas estimativas usam as mesmas faixas de tokens de referência da calculadora de chatbot do site para o tamanho de perguntas e respostas, com precisão de ± 10–15% para texto em inglês simples.
- Cada provedor usa um tokenizador diferente. A contagem real de tokens pode variar ±5–10% entre OpenAI, Anthropic, Google, Mistral e DeepSeek para o mesmo conteúdo.
- O custo da infraestrutura de recuperação (embeddings, banco de dados vetorial, reranking) não está incluído. Esta ferramenta estima apenas o custo da própria chamada de geração de resposta do modelo.
- Os preços exibidos foram verificados manualmente na página oficial de preços de cada provedor em 2026-09-08. Os preços dos provedores de IA mudam com frequência — verifique na página oficial de preços do seu provedor antes de tomar decisões de orçamento.
- "Focada"/"padrão"/"ampla" são rótulos descritivos próprios deste projeto para tamanhos típicos de contexto recuperado, não uma afirmação de terminologia padrão da indústria — use "Personalizado" e informe uma contagem exata de tokens para a estimativa mais precisa.
- O aviso sobre a janela de contexto acima aparece quando os tokens combinados do cenário Alto ultrapassam 80% da janela de contexto do modelo selecionado — uma margem de segurança antes do risco de truncamento ou falha, não um limite rígido em 100%.
Isto é uma estimativa, não uma garantia de cobrança real. Sempre confirme no painel de uso do seu provedor e nos preços oficiais antes de comprometer um orçamento.