Escalar agentes de IA: latencia, concurrencia y límites de tasa
El primer pico de tráfico enseña a todos lo mismo. Tus servidores están casi ociosos, la base de datos va bien y todo es lento — porque cada petición son varias llamadas de segundos a un proveedor con cuota, y a las cuotas no les importa cuántos contenedores levantaste.
Escalar agentes es, por tanto, teoría de colas y gestión de expectativas, más algo de planificación de capacidad. La buena noticia: las técnicas son conocidas y ninguna exige reescribir el agente.
Sabe cuál de los tres límites te pega#
| Síntoma | Límite probable | Solución |
|---|---|---|
| 429 del proveedor | Peticiones o tokens por minuto | Cola, backoff, reparto entre claves o regiones |
| Lento pero sin errores | Llamadas seriadas por ejecución | Paralelizar pasos independientes; acortar el bucle |
| Memoria o conexiones agotadas | Tu propio servicio | Trabajo de capacidad normal |
| Lento solo en pico | Contención de cuota compartida | Cola con prioridad; descartar lo poco valioso |
Encola todo lo no interactivo#
Divide el tráfico en dos clases desde el primer día. Lo interactivo — alguien espera — recibe plazo corto, tope estricto de pasos y un modelo rápido donde la calidad lo permita. Lo de fondo — clasificación por lotes, enriquecimiento, procesos nocturnos — va a una cola con la concurrencia que tú controlas y es lo primero que estrangulas. Sin esa división, un lote lanzado a las nueve se convierte en una caída para quien usa el producto.
Haz la espera más corta, con honestidad#
- Transmite la respuesta según se produce en vez de esperar al último token.
- Muestra el paso actual en lenguaje llano: `consultando tu pedido`, no solo un girador.
- Al llegar a un tope, devuelve el resultado parcial útil y di qué falta.
- Saca del camino crítico todo lo que no bloquee y entrégalo después.
La percepción de latencia es tanto producto como ingeniería. Cinco segundos con progreso visible ganan a tres con pantalla en blanco.
Diseña el modo degradado antes de necesitarlo#
Decide de antemano qué hace el agente cuando el proveedor va lento, sin cuota o caído, y constrúyelo con calma. Una escalera sensata: agente completo, modelo alternativo más barato, respuesta solo por recuperación sin herramientas, y una disculpa honesta con traspaso a una persona. Ponlo tras un interruptor que la guardia pueda accionar en segundos.
Planificación con dos números#
Llamadas por tarea completada y tokens por tarea completada. Multiplica por tareas por minuto en pico, compara con tu cuota y sabrás si necesitas una ampliación antes del lanzamiento y no durante. Recalcula cuando el agente cambie de forma: añadir un pase crítico o un segundo especialista puede duplicar las llamadas por tarea sin avisar.
Preguntas frecuentes
¿Varias cuentas o regiones?
Para escala o resiliencia reales, sí: repartir entre claves, regiones o proveedores es práctica estándar. Hazlo tras una interfaz interna y fija versiones por ruta para que el comportamiento no dependa de quién sirvió.
¿Cómo mantengo aceptable la latencia interactiva?
Topes duros de pasos, pasos simples a modelo rápido, paralelizar llamadas independientes y transmitir. Si la tarea necesita diez pasos, deja de llamarla interactiva y muestra progreso.
¿Qué se rompe primero al crecer?
Casi siempre los límites del proveedor, y después la API interna de tu herramienta más usada. Haz pruebas de carga también a la capa de herramientas.
escalar agentes ialímites de tasa llmlatencia de agentescolas para llmmodo degradado