# Latence

> Délai qui s'écoule entre le moment où une donnée est soumise à l'IA et le moment où elle fournit sa réponse.

- Page ZoneIA : https://zoneia.fr/glossaire/latence
- Type : Définition du glossaire IA
- Catégories : [Code & Développement](https://zoneia.fr/outils/categorie/code-developpement-ia), [Chatbots & Support Client](https://zoneia.fr/outils/categorie/chatbots-support-client)
- Publié le : 2026-03-04
- Mis à jour le : 2026-05-22

La latence correspond au **temps d’attente** entre une action (ex. envoyer une requête) et la réception du résultat. En IA, elle désigne souvent le délai entre l’envoi d’un prompt ou d’une donnée (image, audio, texte) et la génération de la réponse par le modèle.

## D’où vient ce délai ?
La latence est la somme de plusieurs étapes :
- **Réseau** : aller-retour entre client, API et serveurs (RTT, débit, congestion).
- **File d’attente** : attente due à la charge (rate limiting, quotas, burst).
- **Calcul** : temps d’inférence du modèle (taille du modèle, GPU/CPU, batch).
- **Traitements annexes** : tokenisation, post-traitement, filtrage, logs.

On distingue parfois la **latence “time-to-first-token” (TTFT)** (premier token reçu) et le **temps total** (réponse complète). Le streaming peut réduire la latence perçue.

## Pourquoi c’est important ?
Une faible latence améliore l’expérience utilisateur, surtout pour :
- chatbots et assistants
- recherche augmentée (RAG)
- traduction, sous-titrage, transcription
- systèmes temps réel (voix, robots, monitoring)

## Exemples concrets
- Un assistant qui répond en 300 ms semble “instantané”.
- Une API qui met 8 s peut être acceptable pour un batch, mais pas pour une interface interactive.

---

Source : ZoneIA, annuaire francophone des outils IA (https://zoneia.fr/glossaire/latence)
