Quanto custa usar um LLM como juiz?
Estime o custo de usar um LLM para avaliar respostas geradas — comparação de modelos, testes de regressão, execuções de benchmark, pontuação QA, avaliação baseada em rubrica, comparação de respostas par a par e revisão de qualidade de saída em produção. Informe seu volume de avaliações, quantas respostas candidatas cada avaliação compara e a complexidade da rubrica para obter uma estimativa mensal Baixo / Esperado / Alto. Tudo roda localmente no seu navegador — nenhum dado é enviado a nenhum servidor.
- Sem login
- Sem cartão de crédito
- Sem chamadas de API
- Apenas uma estimativa
Configure sua carga de avaliação
Custo mensal estimado
Isto estima apenas o custo de inferência do próprio modelo juiz. Não inclui o custo de gerar as respostas candidatas avaliadas (precificado pela calculadora que corresponde a essa carga de trabalho) nem custos de hospedagem ou ferramentas de benchmark/avaliação.
Isto é uma estimativa, não uma garantia de cobrança real. O custo real depende do tokenizador do seu provedor, dos seus prompts e respostas reais, e do seu plano de faturamento.
Como esta estimativa funciona
- Rubrica/instruções do juiz
- O prompt/contexto original
- Uma ou mais respostas candidatas
Lê a rubrica, o contexto e as candidatas, e produz um veredito.
Um score, um veredito estruturado, ou um veredito com uma breve explicação.
Isto deliberadamente não é um chatbot: a(s) resposta(s) candidata(s) avaliada(s) já são texto gerado enviado como ENTRADA, não escrito novamente como saída. Esta calculadora calcula o preço apenas do próprio custo de inferência do juiz — não o custo de gerar as respostas avaliadas.
Quanto custa avaliar 100 mil respostas de IA?
Nas tarifas atuais de GPT-5.4 Mini, pontuar 100.000 respostas individuais contra uma rubrica padrão (pontuação QA de resposta única, saída apenas de pontuação) resulta em um custo mensal Esperado de $56.10 (faixa $33.30–$85.50). Use a calculadora acima para modelar seu próprio volume, número de candidatas e modelo.
Conjunta vs. independente: como as candidatas chegam ao juiz
Ao comparar múltiplas respostas candidatas, elas podem chegar ao juiz de duas formas genuinamente diferentes. Conjunta: uma chamada vê todas as candidatas juntas e retorna um único veredito comparativo (o padrão comum para comparação par a par ou múltipla — "qual resposta é melhor"). Independente: uma chamada separada por candidata, cada uma produzindo seu próprio veredito (o padrão para avaliar muitas respostas uma de cada vez contra uma rubrica fixa). Elas têm formas de custo diferentes — a conjunta paga o overhead de rubrica/contexto uma vez e empilha os tokens das candidatas em uma chamada maior; a independente paga esse overhead uma vez por chamada, com os tokens de apenas uma candidata a cada vez.
Por que mais candidatas aumentam a entrada do juiz
Se 2 respostas candidatas são comparadas, ambas contribuem com seus próprios tokens para a entrada do juiz — nunca apenas uma. Mais candidatas, seja conjunta ou independente, significa mais tokens totais que o juiz precisa ler.
Por que a complexidade da rubrica e o modo explicação importam
Uma rubrica simples de aprovado/reprovado custa pouco para especificar. Uma rubrica detalhada com âncoras de pontuação e exemplos adiciona tokens de entrada reais em cada chamada. No lado da saída, um score simples custa quase nada; pedir ao juiz para explicar seu veredito adiciona uma saída significativamente maior, embora ainda muito menor que uma resposta escrita completa.
Baixo / Esperado / Alto explicado
Um prompt curto, resposta(s) candidata(s) curta(s), uma rubrica mínima, saída apenas de pontuação.
Comprimentos típicos de prompt e resposta, uma rubrica padrão. Planeje com base neste número.
Um prompt longo, resposta(s) candidata(s) longa(s), uma rubrica detalhada, saída veredito+explicação. Orce com base neste.
Reduza seu custo
Exemplos de custo mensal de avaliação LLM
Estes exemplos usam as mesmas premissas padrão da calculadora acima — comparação par a par (2 candidatas, modo conjunto), prompt e respostas de comprimento médio, uma rubrica padrão, saída de veredito estruturado — com GPT-5.4 Mini. Apenas o número de avaliações por mês muda entre as linhas.
| Nível de uso | Avaliações / mês | Baixo | Esperado | Alto |
|---|---|---|---|---|
| Uso leve | 100 | $0.0555 | $0.0930 | $0.1440 |
| Uso típico | 1,000 | $0.5550 | $0.9300 | $1.44 |
| Uso intenso | 10,000 | $5.55 | $9.30 | $14.40 |
E aqui está o custo por avaliação para três tipos de avaliação comuns — pontuação QA de resposta única, comparação de modelos par a par e uma grande execução de avaliação múltipla — com GPT-5.4 Mini, cada uma com seu próprio número de candidatas e modo de saída:
| Tipo de avaliação | Baixo | Esperado | Alto |
|---|---|---|---|
| Pontuação QA de resposta única (10 mil respostas) | $0.000333 | $0.000561 | $0.000855 |
| Comparação de modelos par a par | $0.000555 | $0.000930 | $0.001440 |
| Execução de avaliação múltipla grande | $0.001455 | $0.002550 | $0.004162 |
Ressalvas
- Estas estimativas usam as mesmas faixas de tokens de referência para prompt e comprimento de resposta da calculadora de chatbot do site, com precisão de ±10–15% para texto em inglês simples.
- As cifras de tokens de saída do juiz (pontuação / veredito estruturado / veredito+explicação) são uma premissa descritiva própria deste projeto, não uma cifra publicada por qualquer provedor — nenhum provedor publica um tamanho de tokens para um veredito de juiz, já que depende da rubrica e esquema de veredito exatos.
- Cada provedor usa um tokenizador diferente. A contagem real de tokens pode variar ±5–10% entre provedores para o mesmo conteúdo.
- Isto estima apenas o custo de inferência do próprio modelo juiz. Não inclui o custo de gerar as respostas candidatas avaliadas, nem custos de hospedagem ou ferramentas de benchmark/avaliação.
- Os preços mostrados são verificados manualmente contra a página oficial de preços de cada provedor a partir de 2026-09-08. Os preços dos provedores de IA mudam com frequência — verifique na página oficial de preços do seu provedor antes de tomar decisões de orçamento.
- O nível de preço de contexto longo, quando o modelo selecionado tem um, é resolvido contra o próprio tamanho de entrada de cada chamada, nunca um agregado mensal.
- O aviso de janela de contexto acima aparece quando os tokens combinados de uma chamada excedem 80% da janela de contexto do modelo selecionado — uma margem de segurança antes do risco de truncamento ou falha, não um limite rígido em 100%.
Isto é uma estimativa, não uma garantia de cobrança real. Sempre confirme no painel de uso do seu provedor e nos preços oficiais antes de comprometer um orçamento.