El consumo de tokens por agentes en OpenRouter se ha multiplicado por 14 desde febrero. Suena a factura disparada, pero el coste real sube mucho menos gracias a las respuestas cacheadas. Para autónomos y pymes, la pregunta no es si usar agentes de IA, sino cómo no pagar de más y lograr que funcionen a la primera.

80%
Según datos del propio OpenRouter, más del 80% de los tokens de algunos proveedores se sirven desde caché,…
50%
El coste por token cacheado suele ser entre un 50% y un 90% menor que el de un token normal, dependiendo…
70%
Un autónomo que use un agente para responder emails puede ahorrar más del 70% en coste de tokens solo con…

Aquí tienes una guía práctica: qué es la caché de prompts, cómo ahorrar con ella, y por qué menos skills bien estructuradas valen más que una biblioteca gigante. Con datos de uso real y conclusiones de un estudio de Princeton y UC San Diego.

¿Qué está pasando con el coste de los agentes de IA?

OpenRouter, uno de los principales agregadores de acceso a modelos de lenguaje, ha visto un aumento brutal en el uso de tokens por parte de agentes. Un 14x desde febrero. Si tu negocio ya usa asistentes virtuales o automatizaciones con IA, esto te afecta directamente.

Pero hay un matiz importante: el coste no crece en la misma proporción. ¿La razón? La caché de prompts. Muchas de esas llamadas se están sirviendo desde caché, lo que reduce drásticamente el precio por token. Según datos del propio OpenRouter, más del 80% de los tokens de algunos proveedores se sirven desde caché, con descuentos de hasta el 90% sobre el precio normal.

Es la diferencia entre asustarse con los gráficos y entender que la automatización con agentes sigue siendo viable económicamente. Si optimizas el uso de caché, el coste por interacción puede ser de céntimos.

¿Qué es la caché de prompts y cómo te ahorra dinero?

La caché de prompts es un mecanismo que almacena los prefijos comunes de tus peticiones al modelo. Si envías prompts similares una y otra vez, el sistema no tiene que procesarlos desde cero: recupera la parte cacheada y solo paga por la parte nueva.

Para un agente de atención al cliente, por ejemplo, el prompt de sistema con las instrucciones y el contexto de la empresa se repite en cada interacción. Con caché activa, ese prefijo se procesa una vez y luego se reutiliza. El coste por token cacheado suele ser entre un 50% y un 90% menor que el de un token normal, dependiendo del proveedor.

¿Cómo aprovecharla al máximo?

  • Reutiliza prompts base: mantén un prompt de sistema fijo y bien redactado. No lo cambies en cada llamada.
  • Conversaciones cortas y coherentes: si el contexto se alarga con divagaciones, se pierde la ventaja de la caché. Mantén el historial solo con lo esencial.
  • Evita variaciones innecesarias: no cambies el orden de las instrucciones ni añadas información aleatoria. La caché funciona mejor con prefijos estables.

Un autónomo que use un agente para responder emails puede ahorrar más del 70% en coste de tokens solo con estas prácticas.

¿Por qué las skills de un agente pueden ser un arma de doble filo?

Un estudio reciente de Princeton y UC San Diego analizó cómo las "skills" (habilidades o capacidades específicas) afectan al rendimiento de los agentes de IA. La conclusión clave: las skills mejoran a los agentes sobre todo mediante flujos de trabajo estructurados, no por añadir conocimiento nuevo.

Es decir, no se trata de meter más documentación o más funciones. Se trata de definir pasos claros que el agente pueda seguir. Cuando una skill está bien diseñada, el agente sabe exactamente qué hacer en cada situación.

Pero hay un riesgo: una biblioteca demasiado grande hace que el agente elija mal. Si le das 20 skills, aumenta la probabilidad de que seleccione la incorrecta o que mezcle pasos de varias. El estudio señala que el rendimiento cae cuando el agente tiene que elegir entre muchas opciones similares.

La lección para pymes: menos es más. Empieza con 2 o 3 skills muy bien definidas y ve ampliando solo si es necesario.

Estrategia práctica: pocas skills, flujos claros y medición

Para controlar costes y asegurar que tu agente funcione, sigue estos pasos:

  1. Limita inicialmente a 2-3 skills: identifica las tareas más repetitivas de tu negocio. Por ejemplo: consultar estado de pedidos, información de envío, iniciar devolución.
  2. Diseña flujos paso a paso: para cada skill, escribe una secuencia clara de acciones. Incluye qué datos necesita, qué debe responder y cuándo derivar a un humano.
  3. Activa y optimiza la caché: usa un prompt de sistema estable y mantén las conversaciones enfocadas. Si tu proveedor lo permite, configura la caché explícitamente.
  4. Mide el coste por tarea: registra cuántos tokens y cuánto dinero consume cada interacción. Así sabrás si una skill es rentable o necesita ajustes.

Con esta estrategia, un agente de atención al cliente puede costar céntimos por interacción. Nada que ver con la imagen de gasto descontrolado.

Ejemplo concreto: asistente de atención al cliente low-cost

Imagina una tienda online pequeña. Quieren automatizar las consultas más frecuentes para no contratar a otra persona. Diseñan un agente con caché activa y solo tres skills:

SkillDescripciónCoste estimado por interacción*
Consulta de pedidosRecomendadoEl agente pide el número de pedido y devuelve estado y fecha estimada.0,01 €, 0,03 €
Información de envíoExplica plazos, costes y cómo rastrear el paquete.0,01 €, 0,02 €
DevolucionesGuía al cliente por el proceso y genera etiqueta si procede.0,02 €, 0,05 €
← Desliza para ver toda la tabla →

*Estimación basada en precios medios de modelos como GPT-4o mini o Claude Haiku con caché activa y conversaciones de 2-3 turnos. Puede variar según proveedor y longitud.

Con un volumen de 500 consultas al mes, el coste total estaría entre 5 y 25 euros. Una ganga comparado con horas de trabajo manual.

El prompt de sistema se mantiene fijo, así que la caché se aprovecha al máximo. Las skills están tan bien definidas que el agente rara vez se equivoca. Y si algo se sale de lo previsto, deriva a un humano.

¿Merece la pena automatizar con agentes de IA en 2025?

Sí, si lo haces con cabeza. Los datos de OpenRouter muestran que el uso se dispara, pero también que la caché está amortiguando el coste. El estudio de Princeton confirma que el diseño importa más que la cantidad.

Nuestra recomendación: empieza con un agente sencillo, con 2-3 skills críticas, caché activa y medición constante. No compres una plataforma cara con cientos de funciones. Usa APIs o herramientas low-code que te den control sobre el prompt y el coste.

La automatización low-cost no es un mito. Es cuestión de optimizar dos cosas: cuánto pagas por token y cómo de bien elige tu agente.