14 septiembre 2026 EN ES
The Startup Bench

The operating side of a young company

Decisiones

La auditoría semanal de gasto en agentes que reduce la factura sin dañar el rendimiento

Una auditoría semanal que vincula tokens a clientes, agentes, usuarios y elecciones de modelo puede reducir el gasto en IA sin frenar el trabajo.

Illustration: The weekly agent-spend audit that cuts the bill without hurting performance

La factura de IA llega antes que la explicación. OpenAI redujo el precio estándar de la API para GPT-5.6 Sol a $4 por millón de tokens de entrada y $20 por millón de tokens de salida, frente a los $5 y $30 anteriores. Para un equipo pequeño que paga por agentes, la primera pregunta es qué cliente, agente y usuario generaron el cargo. Si el gasto se atribuye, se revisa semanalmente y la elección de modelo se asigna por tarea, la factura puede bajar sin degradar el rendimiento. La auditoría convierte una factura de proveedor en una decisión operativa.

Los cambios de precio convierten el enrutamiento en un problema semanal

El gasto en agentes parece una línea de servicios públicos hasta que alguien pregunta quién lo usó. Un agente de soporte, un asistente de ventas y un flujo de investigación pueden llamar al mismo modelo y generar costes muy distintos. El modelo fija el precio; la tarea fija el uso. El mismo modelo puede ser barato para una tarea y caro para otra.

OpenAI declaró que su precio promocional para GPT-5.6 Sol seguiría disponible al menos hasta el 21 de noviembre de 2026. El precio introductorio de Claude Sonnet 5 de Anthropic, de $2 por millón de tokens de entrada y $10 por millón de tokens de salida, expira el 31 de agosto de 2026, con el precio estándar subiendo a $3 y $15 el 1 de septiembre de 2026. Esos movimientos cambian qué modelo es el más barato para una tarea dada. Las fechas importan porque un modelo que es el más barato hoy puede ser más caro el mes siguiente. Un equipo que no vuelva a verificar el enrutamiento seguirá pagando por la suposición del mes anterior.

La atribución convierte el gasto en un control

Antes de los límites, el equipo necesita una vista. Cada solicitud debe llevar suficiente metadatos para responder qué cliente, qué agente y qué usuario. Sin eso, el panel muestra el gasto total y oculta la causa. La vista debe ser lo suficientemente simple para revisarla en una reunión semanal. Separe el trabajo de pago del trabajo experimental. Un agente orientado al cliente tiene una tolerancia al desperdicio distinta a la de un experimento interno. Si el equipo no puede distinguir la diferencia, el límite castigará lo equivocado.

Separe los tokens de los dólares en la vista. Los tokens explican el uso. Los dólares explican la factura. Un modelo barato puede seguir siendo caro si se usa en una tarea larga y repetitiva. Un modelo más caro puede ser la elección correcta si termina en menos turnos. Esa distinción evita que el equipo optimice el número equivocado.

El trabajo determinista es el lugar más fácil para ahorrar. La clasificación, la extracción, el formato y la redacción rutinaria a menudo pueden ejecutarse en un modelo más barato si la salida sigue pasando las comprobaciones del equipo. El conjunto de pruebas actúa como barandilla. Debe ser pequeño, actual y vinculado a la tarea, no al modelo.

Los límites por departamento son el siguiente control. Un límite necesita un responsable con poder para detener ejecuciones no urgentes, redirigir una tarea o solicitar un límite más alto con un motivo. El responsable responde por el equilibrio entre coste y calidad.

La auditoría semanal decide qué cambia

La lista de verificación debe ser lo suficientemente corta para ejecutarse en una reunión periódica. Es la parte de la semana que convierte el gasto en una decisión. Mantenga el mismo panel y la misma lista de responsables ante el equipo.

  • Etiquete cada solicitud con cliente, agente, usuario y tarea antes de que salga de la aplicación.
  • Sumar los tokens y los dólares por cliente, agente y usuario en un panel antes de la revisión semanal.
  • Dirija el trabajo determinista al modelo más barato que supere el conjunto de pruebas de la tarea.
  • Establezca un límite semanal estricto por departamento y detenga las ejecuciones no urgentes cuando se alcance.
  • Designe un responsable para la elección de modelo por tarea y registre el motivo de cada cambio.
  • Recalcule el gasto de la semana anterior tras cualquier cambio de precio o modelo.

Termine la reunión con una decisión: si un cliente justifica el gasto, qué agente está desperdiciando tokens y qué se detiene cuando un departamento se acerca a su límite. Nombre la próxima comprobación. Un cliente por encima del límite necesita una pausa, una renegociación o un traslado del trabajo; un cambio de modelo en prueba necesita un resultado declarado que justifique mantenerlo.

Publicidad