Un agente puede gastar poco en una llamada y dejarte media hora de correcciones. También puede consumir más y producir un resultado que apenas necesita cambios. Para comparar esos casos hace falta definir qué significa terminar la tarea.
La unidad que proponemos es el resultado aceptado. Un informe cuya fuente principal no abre todavía necesita trabajo. Una exportación que duplica filas tampoco cuenta como terminada por haber creado un archivo. Antes de calcular costes, escribe qué debe cumplir la salida.
Separa las partidas
Distingue consumo del modelo, herramientas externas, infraestructura y revisión humana. Una búsqueda de pago o el procesamiento de una imagen puede facturarse aparte del texto. Si utilizas una suscripción, registra su cuota y lo que permita observar; no inventes un precio por tarea que el producto no muestra.
En APIs con precios por , usa las cantidades realmente facturadas y la tarifa aplicable a cada categoría. El contexto de entrada, la salida y la entrada reutilizada pueden tener tratamientos distintos. La documentación de prompt caching de OpenAI explica la reutilización de prefijos; no conviene asumir que todo el contexto recibirá siempre ese tratamiento.
La fórmula básica es sumar cada cantidad por su precio unitario y añadir los demás conceptos. Conserva moneda y periodo: mezclar una factura mensual en euros con consumos en dólares sin explicar la conversión produce una precisión engañosa.
Un ejemplo numérico, deliberadamente hipotético
Supongamos una tarea con 100.000 tokens de entrada y 20.000 de salida. Para mostrar el cálculo, inventamos tarifas de 2 USD y 20 USD por millón, respectivamente. Son supuestos didácticos, no precios de un proveedor ni una recomendación de modelo.
La entrada costaría 0,20 USD y la salida 0,40 USD. Si añadimos 0,04 USD de herramientas, el consumo directo sería 0,64 USD. Con treinta minutos de revisión valorados, también como supuesto, a 25 USD por hora, el total imputado sería 13,14 USD.
La lectura útil del ejemplo es identificar qué partida domina bajo esos supuestos. No demuestra que todos los agentes sean baratos ni que toda revisión dure treinta minutos. Cambia las cantidades por tus registros antes de usarlo para decidir.
Un reintento debe verse en la cuenta
Si repites exactamente el consumo directo del ejemplo y mantienes la revisión total en treinta minutos, obtienes 1,28 USD de consumo y 13,78 USD en conjunto. Si además necesitas más revisión, esa diferencia se añade por separado.
No todos los fallos justifican repetir la solicitud completa. Puede bastar con corregir una salida o resolver un problema de acceso. Antes de reenviar una operación que cobra o escribe datos, comprueba si la primera llegó a completarse. Una respuesta que se perdió por red no demuestra que la operación fuera gratuita ni que no se ejecutara.
Guarda el identificador, el estado y el importe observado de cada intento. Cuando el resultado sea incierto, mantenlo como pendiente hasta contrastarlo. Borrarlo del registro solo mejora la apariencia del presupuesto.
Coste por resultado aceptado
En una muestra de tareas comparables, suma el gasto de todos los intentos, incluidos los fallidos, y divídelo entre los resultados aceptados. Si no aceptaste ninguno, no existe un coste por éxito útil: necesitas corregir el proceso antes de extrapolar.
Acompaña esa cifra de la tasa de aceptación y del criterio utilizado. Bajar el coste retirando comprobaciones puede hacer que aceptes salidas peores. Cambiar la definición de éxito a mitad de la comparación también invalida la lectura.
No mezcles tareas sencillas y complejas sin separarlas. Un resumen breve y una migración de software no son unidades equivalentes, aunque ambos aparezcan como una ejecución en el historial.
Presupuestar con límites claros
Empieza por una muestra pequeña, conserva los resultados y decide qué gasto máximo tiene sentido antes de automatizar. Incluye qué ocurrirá cuando se alcance el límite: detener, pedir revisión o reducir el alcance de una tarea futura.
Separa el gasto de suscripción de las demás partidas con nuestra guía para elegir entre Claude Pro y ChatGPT Plus.
En programación, puedes definir el encargo con los criterios de la comparación de Claude Code y Codex.
Nuestra calculadora de costes puede ayudarte a explorar escenarios. El cálculo sigue necesitando datos y supuestos adecuados a tu caso. Si quieres medir un proceso real antes de ampliarlo, cuéntanos qué resultado necesitas obtener.