Mettre des agents IA à l'échelle : latence, concurrence et quotas
Le premier pic de trafic enseigne la même leçon à toutes les équipes. Vos serveurs s'ennuient, la base va bien, et tout est lent — car chaque requête, ce sont plusieurs appels de plusieurs secondes vers un fournisseur avec un quota, et les quotas se moquent du nombre de conteneurs démarrés.
Mettre des agents à l'échelle, c'est donc surtout de la théorie des files et de la gestion des attentes, plus un peu de planification de capacité. Bonne nouvelle : les techniques sont connues et aucune n'exige de réécrire l'agent.
Savoir laquelle des trois limites vous frappe#
| Symptôme | Limite probable | Correctif |
|---|---|---|
| 429 du fournisseur | Requêtes ou tokens par minute | File, backoff, répartition sur clés ou régions |
| Lent sans erreurs | Appels sériés par exécution | Paralléliser les étapes indépendantes ; raccourcir la boucle |
| Mémoire ou connexions épuisées | Votre propre service | Travail de capacité classique |
| Lent seulement aux pics | Contention de quota partagé | File prioritaire ; délester le peu utile |
Mettez en file tout ce qui n'est pas interactif#
Séparez le trafic en deux classes dès le premier jour. L'interactif — quelqu'un attend — reçoit un délai court, un plafond d'étapes strict et un modèle rapide quand la qualité le permet. Le travail de fond — classification par lots, enrichissement, traitements nocturnes — passe dans une file dont vous contrôlez la concurrence et qui est la première à être bridée. Sans cette séparation, un lot lancé à neuf heures devient une panne pour les utilisateurs.
Raccourcir l'attente, honnêtement#
- Diffusez la réponse au fil de sa production plutôt qu'après le dernier token.
- Montrez l'étape en cours en clair : `vérification de votre commande`, pas un simple sablier.
- Au plafond, renvoyez le résultat partiel utile et dites ce qui manque.
- Sortez du chemin critique tout ce qui ne bloque pas et livrez-le ensuite.
La perception de la latence est autant produit qu'ingénierie. Cinq secondes avec progression visible battent trois secondes d'écran vide.
Concevez le mode dégradé avant d'en avoir besoin#
Décidez à l'avance ce que fait l'agent quand le fournisseur est lent, hors quota ou indisponible — et construisez-le au calme. Une échelle raisonnable : agent complet, puis modèle alternatif moins cher, puis réponse par recherche seule sans outils, puis excuse honnête et passage à un humain. Placez cela derrière un interrupteur actionnable en quelques secondes.
Planifier la capacité avec deux chiffres#
Appels de modèle par tâche terminée et tokens par tâche terminée. Multipliez par les tâches par minute au pic, comparez à votre quota, et vous saurez avant la mise en ligne s'il faut une augmentation. Recalculez quand l'agent change de forme : ajouter une passe critique ou un second spécialiste peut doubler les appels par tâche sans prévenir.
Questions fréquentes
Plusieurs comptes ou régions ?
Pour l'échelle ou la résilience, oui : répartir sur des clés, des régions ou des fournisseurs est une pratique courante. Faites-le derrière une interface interne et épinglez les versions par route.
Comment garder la latence interactive acceptable ?
Plafonds stricts d'étapes, étapes simples vers un modèle rapide, appels indépendants parallélisés et diffusion. Si la tâche exige dix étapes, cessez de la dire interactive et affichez une progression.
Qu'est-ce qui casse en premier ?
Presque toujours les quotas du fournisseur, puis l'API interne de votre outil le plus sollicité. Testez la charge de la couche d'outils aussi.
mise à l'échelle des agentsquotas llmlatence des agentsfiles d'attente llmmode dégradé