Estima el costo de preguntas sobre documentos con IA antes de que se acumule
Indica cuántas preguntas responde tu asistente de preguntas sobre documentos cada mes para obtener un rango de costo mensual Bajo / Probable / Alto. Todo se calcula localmente en tu navegador — no se envían datos a ningún servidor.
- Sin inicio de sesión
- Sin tarjeta de crédito
- Sin llamadas a la API
- Solo una estimación
Configure sus preguntas sobre documentos
Costo mensual estimado
Esto estima el costo de inferencia del modelo para responder una pregunta una vez que el texto relevante ya fue recuperado. No incluye la ingesta de documentos, OCR, embeddings, alojamiento de bases de datos vectoriales ni infraestructura de recuperación; esos costos los cobran por separado las herramientas que use para construir el paso de recuperación.
Esto es una estimación, no una garantía de facturación real. El costo real depende del tokenizador de su proveedor, el tamaño real de la recuperación y su plan de facturación.
Cómo funciona esta estimación
- Instrucción / system prompt
- La pregunta del usuario
- Contexto de documento recuperado
Lee la pregunta y los pasajes recuperados, y luego escribe una respuesta.
Una respuesta basada en el texto recuperado.
"RAG" (generación aumentada por recuperación) simplemente significa: encontrar las partes más relevantes de tus documentos para una pregunta y luego pedirle al modelo que responda usando solo ese texto recuperado. Esta calculadora empieza a contar el costo después de que ese paso de recuperación ya ocurrió.
Lo que no incluye: la infraestructura de recuperación
Esta calculadora estima el costo de inferencia del modelo para responder una pregunta una vez que el texto relevante ya fue recuperado — no incluye la ingesta de documentos, OCR, embeddings, alojamiento o búsqueda en bases de datos vectoriales, reordenamiento (reranking) ni ninguna otra infraestructura de recuperación.
Esos pasos los cobra por separado el modelo de embeddings, la base de datos vectorial y el servicio de recuperación que uses para construir el pipeline de recuperación, y no forman parte de esta estimación.
Bajo / Probable / Alto explicados
Recuperación enfocada, pregunta corta, respuesta corta.
Profundidad de recuperación estándar y longitud típica de pregunta/respuesta. Planifica con este número.
Recuperación amplia, pregunta larga, respuesta larga. Presupuesta con este número.
Reduce tu costo
Ejemplos de costo mensual
Estos ejemplos prácticos usan los mismos supuestos predeterminados que la calculadora de arriba — preguntas y respuestas de longitud media, profundidad de recuperación estándar, una instrucción estándar — con GPT-5.4 Mini. Solo cambia el número de preguntas al mes entre filas. Usa la calculadora de arriba para modelar tu propio uso o un modelo diferente.
| Nivel de uso | Preguntas / mes | Bajo | Probable | Alto |
|---|---|---|---|---|
| Uso ligero | 100 | $0.1290 | $0.2025 | $0.3000 |
| Uso típico | 500 | $0.6450 | $1.01 | $1.50 |
| Uso intensivo | 2,000 | $2.58 | $4.05 | $6.00 |
Advertencias
- Estas estimaciones usan los mismos rangos de tokens de referencia que la calculadora de chatbot del sitio para la longitud de preguntas y respuestas, con una precisión de ±10–15% para texto en inglés simple.
- Cada proveedor usa un tokenizador diferente. El conteo real de tokens puede variar ±5–10% entre OpenAI, Anthropic, Google, Mistral y DeepSeek para el mismo contenido.
- El costo de la infraestructura de recuperación (embeddings, base de datos vectorial, reranking) no está incluido. Esta herramienta solo estima el costo de la llamada de generación de respuesta del modelo en sí.
- Los precios mostrados fueron verificados manualmente frente a la página oficial de precios de cada proveedor el 2026-09-08. Los precios de los proveedores de IA cambian con frecuencia — verifica en la página oficial de precios de tu proveedor antes de tomar decisiones de presupuesto.
- "Enfocado"/"estándar"/"amplio" son etiquetas descriptivas propias de este proyecto para tamaños típicos de contexto recuperado, no una afirmación de terminología estándar de la industria — usa "Personalizado" e introduce un conteo exacto de tokens para la estimación más precisa.
- La advertencia sobre la ventana de contexto de arriba aparece cuando los tokens combinados del escenario Alto superan el 80% de la ventana de contexto del modelo seleccionado — un margen de seguridad antes del riesgo de truncamiento o fallo, no un límite estricto al 100%.
Esto es una estimación, no una garantía de facturación real. Confirma siempre con el panel de uso de tu proveedor y sus precios oficiales antes de comprometer un presupuesto.