Volet 1
63 appels décortiqués
Ce que les gens demandent vraiment à une IA au téléphone — et le chiffre inconfortable qu’on assume.
Données terrain
Publié par l’équipe Décroche.ai · · 8 min · Corrigé le (deux mesures de blancs audio étaient présentées comme une seule ; chaque chiffre porte son effectif) · réécrit le , chiffres inchangés
Deuxième volet de nos données terrain — le premier volet regardait ce que demandent les appelants ; celui-ci mesure combien de temps notre agent met à leur répondre. Entre le 7 et le 13 août, notre ligne de démonstration publique a produit 113 appels tracés, dont 96 portent une mesure exploitable (n = 96 appels, 578 tours de parole analysés). On mesure le silence entre la dernière phrase de l’appelant et le premier mot de l’agent, à la sortie de notre serveur — pas jusqu’à l’oreille de qui appelle, ce trajet-là s’ajoute encore.
Vue rapide
Réponse médiane — 1 822 ms sur les tours précédés d’une vraie question de l’appelant (n = 578 tours, 96 appels, 7→13 août). C’est un plancher : la mesure s’arrête à la sortie de notre serveur.
Les cas lents — part des tours où l’agent met plus de 3 secondes à répondre. À l’autre bout, 15,4 % répondent en moins d’une seconde.
Avant le premier mot — 574 ms pour ouvrir la connexion vers l’agent vocal (n = 113), 428 ms pour générer la première réponse (n = 111).
Interruptions — 35,4 % des appels contiennent au moins une coupure de l’appelant (40 sur 113) ; 12,9 % des phrases de l’agent sont interrompues (91 sur 704 tours).
21,9 % des tours mesurés sont sous 500 ms (154 sur n = 704). Ce n’est pas de la rapidité : ce sont très majoritairement des prises de parole de l’agent sans question de l’appelant — l’accueil, une relance — qui n’ont rien d’un « temps de réponse ». Les compter tire la médiane brute vers le bas de façon artificielle : un chiffre qu’on écarte volontairement plutôt que de le publier tel quel.
En ne gardant que les tours où l’appelant a vraiment parlé avant la réponse (578 tours), la médiane remonte à 1 822 ms. Sur les appelants occasionnels (une à trois visites) : 1 738 ms (n = 271 tours). Sur notre petit échantillon de contrôle côté commerçants réels : 1 773 ms (n = 51 tours, trop mince pour être publié seul). Les trois convergent vers 1,7-1,8 seconde — c’est ce qui nous fait dire que le chiffre est robuste, pas un artefact de calcul.
Sur ces n = 578 tours — sous 1 s : 15,4 % · sous 1,5 s : 35,3 % · sous 2 s : 58,3 % · au-delà de 3 s : 17,8 %. Il reste aussi 12,5 % de tours sous 500 ms (72 tours) malgré une vraie question — une anomalie qu’on n’explique pas encore, qu’on préfère signaler plutôt qu’ignorer.
Autre effet mesuré : plus un appel dure, plus la réponse ralentit. Moins d’une minute : médiane à 1 651 ms (n = 70 tours) ; au-delà de deux minutes : 1 829 ms (n = 318 tours), soit environ 11 % de plus. Modeste, mais réel. (La tranche « moins de 30 secondes » repose sur moins de cinq appels : on ne la publie pas.)
Le chiffre qu’on assume
+40 % de latence en cinq jours — et on ne sait pas encore pourquoi.
Le 7 août, la réponse médiane était de 1 412 ms (n = 147 tours, 21 appels). Le 12 août, 1 964 ms (n = 64 tours, 15 appels) — environ 40 % de plus. Seuls les jours à au moins cinq appels sont ventilés. L’ouverture de connexion suit la même tendance, de 512 ms à un pic autour de 627 ms. On ne cache pas cette dégradation : c’est précisément pour la voir qu’on s’est mis à mesurer.
On n’a pas encore identifié la cause — charge côté fournisseur vocal, longueur du prompt, changement de modèle : on ne tranche rien tant qu’on n’a pas vérifié. Et on ne dira jamais que « nos optimisations ont fait gagner du temps » : notre relevé ne commence qu’après le dernier changement d’architecture, aucune comparaison avant/après n’est vérifiable avec cette donnée.
Ce qu’on en fait, concrètement :
Entre le décroché et la connexion établie avec l’agent vocal : 574 ms en médiane (n = 113 appels, jusqu’à 1 450 ms dans les pires cas). Entre cette connexion prête et la première trame audio : encore 428 ms (n = 111 appels — deux traces n’ont pas les deux tops, et une durée à laquelle il manque un top n’est pas publiée). Total : 1 016 ms avant le premier mot — et 574 + 428 = 1 002 ms, à 14 ms du total mesuré : la somme boucle.
Autrement dit, il faut une seconde pour que l’agent dise « bonjour », et 56 % de cette seconde part dans l’établissement de la connexion, avant la moindre syllabe. C’est la seule décomposition que notre donnée autorise aujourd’hui.
40 appels sur n = 113 (35,4 %) contiennent au moins une interruption de l’appelant ; sur les n = 704 tours du corpus, 91 (12,9 %) portent la marque « interrompu ». Ce qu’on ne dira pas, c’est que l’agent se tait « en 0 ms » : notre mesure s’arrête à notre propre tampon mémoire — l’audio déjà confié à l’opérateur continue de jouer, et ce délai-là n’est mesuré nulle part encore.
Résultat négatif honnête, au passage : on pensait qu’une interruption coûtait cher en temps de réponse. Non confirmé — un tour interrompu répond même un peu plus vite (1 493 ms, n = 91) qu’un tour qui ne l’est pas (1 684 ms, n = 613), et sur le tour suivant l’écart reste faible. On préfère l’écrire plutôt que laisser vivre une intuition fausse.
Nos journaux comptent n = 316 écarts d’au moins 300 ms entre deux arrivées d’audio consécutives depuis le 1ᵉʳ juin — une mesure qui ressemble à des coupures. En réalité, 5 seulement (1,6 %) sont tombés réserve de lecture vide ; pour les 98,4 % restants, l’appareil avait de quoi jouer et personne n’a rien entendu. On avait pourtant ajouté un petit mot de remplissage (un « Mmh ») sur la foi de cette mauvaise métrique.
La bonne mesure regarde l’épuisement de la réserve : n = 32 silences réellement entendus sur la même période (médiane 294 ms, 19,9 s cumulées, 3 seulement au-dessus d’une seconde), tous les 4 et 5 août — des appels de banc, avant notre cohorte publique — et aucun depuis. Ces 32 silences décrivent une leçon de méthode, pas l’état actuel du service.
On a changé de moteur vocal en cours de route (6 août), et perdu au passage un détail qu’on avait avant : à l’intérieur des 1,8 seconde, on ne sait plus dire combien part à comprendre que vous avez fini de parler, combien à préparer la réponse, combien à la prononcer. Cette information n’existe sur aucun des 132 appels tracés de ce lot ; le chiffre technique qui survit dans nos journaux n’est pas fiable (sur certains appels il dépasse la durée du tour entier, ce qui est impossible).
On préfère l’écrire plutôt qu’inventer un partage plausible. C’est un vrai angle mort qu’on travaille à combler pour le prochain volet.
Volet 1
Ce que les gens demandent vraiment à une IA au téléphone — et le chiffre inconfortable qu’on assume.
Guide
Pourquoi le temps de réponse n’est qu’une des conditions d’une conversation qui tient debout.
Essayez maintenant
Parlez à Décroche dans votre navigateur, ou appelez la ligne de démonstration au 09 39 24 93 84 : il décroche, comme il le fera pour vos clients.
Nom, activité, volume d’appels ou blocage concret suffisent. Le message part automatiquement vers l’équipe Décroche.