Quanto custa usar um LLM como juiz?

Estime o custo de usar um LLM para avaliar respostas geradas — comparação de modelos, testes de regressão, execuções de benchmark, pontuação QA, avaliação baseada em rubrica, comparação de respostas par a par e revisão de qualidade de saída em produção. Informe seu volume de avaliações, quantas respostas candidatas cada avaliação compara e a complexidade da rubrica para obter uma estimativa mensal Baixo / Esperado / Alto. Tudo roda localmente no seu navegador — nenhum dado é enviado a nenhum servidor.

  • Sem login
  • Sem cartão de crédito
  • Sem chamadas de API
  • Apenas uma estimativa

Configure sua carga de avaliação

Custo mensal estimado

Isto estima apenas o custo de inferência do próprio modelo juiz. Não inclui o custo de gerar as respostas candidatas avaliadas (precificado pela calculadora que corresponde a essa carga de trabalho) nem custos de hospedagem ou ferramentas de benchmark/avaliação.

Custo mensal esperado$0.9300Faixa estimada: $0.5550$1.44
Custo por avaliação
Baixo$0.000555Esperado$0.000930Alto$0.001440
Chamadas de API por avaliação
Baixo1Esperado1Alto1
Tokens de entrada / avaliação
Baixo620Esperado1.0KAlto1.5K
Tokens de saída / avaliação
Baixo20Esperado40Alto70
Total de tokens mensais
Baixo640KEsperado1.0MAlto1.6M

Isto é uma estimativa, não uma garantia de cobrança real. O custo real depende do tokenizador do seu provedor, dos seus prompts e respostas reais, e do seu plano de faturamento.

Entenda e confie nestes números Metodologia O que são tokens de IA? Por que a conta te surpreende Calculadora de agente de IA

Como esta estimativa funciona

Entrada — você envia
  • Rubrica/instruções do juiz
  • O prompt/contexto original
  • Uma ou mais respostas candidatas
Modelo juiz

Lê a rubrica, o contexto e as candidatas, e produz um veredito.

Saída — você recebe

Um score, um veredito estruturado, ou um veredito com uma breve explicação.

Isto deliberadamente não é um chatbot: a(s) resposta(s) candidata(s) avaliada(s) já são texto gerado enviado como ENTRADA, não escrito novamente como saída. Esta calculadora calcula o preço apenas do próprio custo de inferência do juiz — não o custo de gerar as respostas avaliadas.

Quanto custa avaliar 100 mil respostas de IA?

Nas tarifas atuais de GPT-5.4 Mini, pontuar 100.000 respostas individuais contra uma rubrica padrão (pontuação QA de resposta única, saída apenas de pontuação) resulta em um custo mensal Esperado de $56.10 (faixa $33.30–$85.50). Use a calculadora acima para modelar seu próprio volume, número de candidatas e modelo.

Conjunta vs. independente: como as candidatas chegam ao juiz

Ao comparar múltiplas respostas candidatas, elas podem chegar ao juiz de duas formas genuinamente diferentes. Conjunta: uma chamada vê todas as candidatas juntas e retorna um único veredito comparativo (o padrão comum para comparação par a par ou múltipla — "qual resposta é melhor"). Independente: uma chamada separada por candidata, cada uma produzindo seu próprio veredito (o padrão para avaliar muitas respostas uma de cada vez contra uma rubrica fixa). Elas têm formas de custo diferentes — a conjunta paga o overhead de rubrica/contexto uma vez e empilha os tokens das candidatas em uma chamada maior; a independente paga esse overhead uma vez por chamada, com os tokens de apenas uma candidata a cada vez.

Por que mais candidatas aumentam a entrada do juiz

Se 2 respostas candidatas são comparadas, ambas contribuem com seus próprios tokens para a entrada do juiz — nunca apenas uma. Mais candidatas, seja conjunta ou independente, significa mais tokens totais que o juiz precisa ler.

Por que a complexidade da rubrica e o modo explicação importam

Uma rubrica simples de aprovado/reprovado custa pouco para especificar. Uma rubrica detalhada com âncoras de pontuação e exemplos adiciona tokens de entrada reais em cada chamada. No lado da saída, um score simples custa quase nada; pedir ao juiz para explicar seu veredito adiciona uma saída significativamente maior, embora ainda muito menor que uma resposta escrita completa.

Baixo / Esperado / Alto explicado

Baixo

Um prompt curto, resposta(s) candidata(s) curta(s), uma rubrica mínima, saída apenas de pontuação.

Esperado

Comprimentos típicos de prompt e resposta, uma rubrica padrão. Planeje com base neste número.

Alto

Um prompt longo, resposta(s) candidata(s) longa(s), uma rubrica detalhada, saída veredito+explicação. Orce com base neste.

Reduza seu custo

1
Use o modo conjunto para comparações. Uma chamada comparando N candidatas é mais barata que N chamadas independentes quando você só precisa de um veredito relativo.
2
Apenas pontuação para execuções grandes. Reserve o modo explicação para verificações pontuais ou falhas, não para cada avaliação em uma execução de 100 mil respostas.
3
Combine o modelo com a tarefa. Um modelo menor costuma ser um juiz perfeitamente capaz para avaliação rotineira.

Exemplos de custo mensal de avaliação LLM

Estes exemplos usam as mesmas premissas padrão da calculadora acima — comparação par a par (2 candidatas, modo conjunto), prompt e respostas de comprimento médio, uma rubrica padrão, saída de veredito estruturado — com GPT-5.4 Mini. Apenas o número de avaliações por mês muda entre as linhas.

Nível de usoAvaliações / mêsBaixoEsperadoAlto
Uso leve 100 $0.0555 $0.0930 $0.1440
Uso típico 1,000 $0.5550 $0.9300 $1.44
Uso intenso 10,000 $5.55 $9.30 $14.40

E aqui está o custo por avaliação para três tipos de avaliação comuns — pontuação QA de resposta única, comparação de modelos par a par e uma grande execução de avaliação múltipla — com GPT-5.4 Mini, cada uma com seu próprio número de candidatas e modo de saída:

Tipo de avaliaçãoBaixoEsperadoAlto
Pontuação QA de resposta única (10 mil respostas) $0.000333 $0.000561 $0.000855
Comparação de modelos par a par $0.000555 $0.000930 $0.001440
Execução de avaliação múltipla grande $0.001455 $0.002550 $0.004162

Ressalvas

  • Estas estimativas usam as mesmas faixas de tokens de referência para prompt e comprimento de resposta da calculadora de chatbot do site, com precisão de ±10–15% para texto em inglês simples.
  • As cifras de tokens de saída do juiz (pontuação / veredito estruturado / veredito+explicação) são uma premissa descritiva própria deste projeto, não uma cifra publicada por qualquer provedor — nenhum provedor publica um tamanho de tokens para um veredito de juiz, já que depende da rubrica e esquema de veredito exatos.
  • Cada provedor usa um tokenizador diferente. A contagem real de tokens pode variar ±5–10% entre provedores para o mesmo conteúdo.
  • Isto estima apenas o custo de inferência do próprio modelo juiz. Não inclui o custo de gerar as respostas candidatas avaliadas, nem custos de hospedagem ou ferramentas de benchmark/avaliação.
  • Os preços mostrados são verificados manualmente contra a página oficial de preços de cada provedor a partir de 2026-09-08. Os preços dos provedores de IA mudam com frequência — verifique na página oficial de preços do seu provedor antes de tomar decisões de orçamento.
  • O nível de preço de contexto longo, quando o modelo selecionado tem um, é resolvido contra o próprio tamanho de entrada de cada chamada, nunca um agregado mensal.
  • O aviso de janela de contexto acima aparece quando os tokens combinados de uma chamada excedem 80% da janela de contexto do modelo selecionado — uma margem de segurança antes do risco de truncamento ou falha, não um limite rígido em 100%.

Isto é uma estimativa, não uma garantia de cobrança real. Sempre confirme no painel de uso do seu provedor e nos preços oficiais antes de comprometer um orçamento.