Stratégie & Transformation Digitale

Agent vocal IA : le coût par appel et le seuil de rentabilité

Reconnaissance vocale, modèle, synthèse, téléphonie, plateforme et développement : le coût réel d'un appel traité par un agent vocal IA à 200, 1 000 et 5 000 appels par mois, comparé à un accueil humain.

Alexandre Hachet
Alexandre Hachet

Chargé d’affaires IA, JUWA

9 octobre 20268 min de lecture
Agent vocal IA : le coût par appel et le seuil de rentabilité

Résumer avec

Un appel de 3 minutes traité par un agent vocal IA coûte entre 0,08 et 0,20 € en consommation technique (reconnaissance vocale, modèle de langage, synthèse vocale, téléphonie), mais entre 0,50 et 12 € une fois le développement, la plateforme et la supervision amortis, selon le volume mensuel. Face à un accueil humain qui revient à 2 à 3 € par appel traité, le seuil de rentabilité d'un agent sur mesure se situe autour de 850 appels par mois. Les prix cités sont ceux publiés par les fournisseurs à la date de rédaction, septembre 2026.

De quoi se compose le coût d'un appel traité par un agent vocal ?

Six postes, dont quatre variables (facturés à la minute, au token ou au caractère) et deux fixes (plateforme et développement). Les fournisseurs communiquent sur les postes variables, qui pèsent quelques centimes ; le budget réel se joue sur les deux autres.

Le tableau applique les prix publics, en dollars tels que publiés, à un appel de 3 minutes où l'appelant et l'agent parlent chacun la moitié du temps.

PosteUnité de facturationPrix public (sept. 2026)Coût sur un appel de 3 min
Reconnaissance vocale (STT)Minute d'audioOpenAI GPT-Transcribe 0,0045 $ ; Deepgram Nova-3 multilingue 0,0058 $ ; Google Speech-to-Text V2 0,016 $0,014 à 0,048 $
Modèle de langage (LLM)Million de tokensOpenAI, modèle d'entrée de gamme : 0,20 $ en entrée, 1,20 $ en sortie0,005 à 0,015 $ (10 tours, contexte cumulé d'environ 25 000 tokens)
Synthèse vocale (TTS)Million de caractèresDeepgram Aura-2 30 $ ; ElevenLabs Flash 50 $0,04 à 0,07 $ (environ 1 400 caractères prononcés)
TéléphonieMinute entrante + numéroTwilio France 0,01 $ la minute entrante, 1,35 $ par mois le numéro0,03 $
Plateforme et supervisionForfait mensuelHébergement, journalisation, tableau de bord, écoute d'échantillons150 à 400 € par mois, à répartir sur le volume
Développement et TMAProjet + forfait annuel25 000 à 60 000 € de construction, 15 à 20 % par an de maintenance1 200 à 2 500 € par mois amortis sur 24 mois

Sources : grille OpenAI, grille Deepgram, grille Google Speech-to-Text, grille Twilio France. Prix à l'usage ; Google descend à 0,004 $ la minute au-delà de deux millions de minutes, hors de portée d'une PME.

Combien coûte un appel de 3 minutes en consommation pure ?

Entre 0,09 et 0,17 $ avec une architecture en trois briques (STT, LLM, TTS), soit 0,08 à 0,15 €, et jusqu'à 0,20 € avec une reconnaissance vocale ou une voix de synthèse haut de gamme. Le poste le plus lourd n'est pas le modèle de langage mais la synthèse vocale, 40 à 50 % de la consommation d'un appel.

Le coût du LLM reste faible parce qu'un modèle d'entrée de gamme suffit pour un accueil cadré. Il grimpe vite avec un modèle premium ou un prompt système de plus de 3 000 tokens, renvoyé à chaque tour.

Une architecture « speech-to-speech » (le modèle écoute et parle directement, sans STT ni TTS séparés) réduit la latence mais se facture en tokens audio : OpenAI affiche 10 $ le million en entrée et 20 $ en sortie pour sa version mini, 32 et 64 $ pour la version complète. À ces tarifs, un appel de 3 minutes ressort trois à cinq fois plus cher qu'avec les trois briques séparées. On réserve cette voie aux cas où la réactivité prime sur le coût.

Combien coûte un agent vocal IA par mois à 200, 1 000 et 5 000 appels ?

Entre 1 800 et 2 700 € par mois tout compris pour un agent sur mesure, quel que soit le volume dans cette fourchette. Le coût par appel, lui, passe de 9 € à 0,50 € : les postes fixes écrasent tout sous 500 appels et pèsent peu au-delà de 3 000.

Main utilisant une calculatrice à côté d'un ordinateur portable sur un bureau

Hypothèses : développement de 30 000 € amorti sur 24 mois (1 250 € par mois), TMA à 15 % par an (375 €), plateforme de 150 à 400 €, consommation de 0,12 € par appel.

  • 200 appels par mois : 24 € de consommation, environ 1 800 € au total, soit 7 à 12 € par appel. À ce niveau, un abonnement SaaS à quelques centaines d'euros par mois fait mieux qu'un projet sur mesure.
  • 1 000 appels par mois : 120 € de consommation, environ 2 000 € au total, soit 1,50 à 3 € par appel. C'est la zone où le sur mesure commence à se défendre, à condition que l'agent traite au moins 70 % des appels sans transfert.
  • 5 000 appels par mois : 600 € de consommation, environ 2 600 € au total, soit 0,45 à 0,80 € par appel. Chaque appel supplémentaire coûte 12 à 15 centimes.

Chaque nouveau scénario (une prise de rendez-vous ajoutée à une FAQ) ajoute 3 000 à 8 000 € de développement et relance l'amortissement sur cette part. La méthode générale, avec les indicateurs à suivre, est dans notre guide pour calculer le retour sur investissement d'un agent IA.

Combien coûte un appel traité par une personne ?

Entre 2 et 3 € pour un appel de 3 minutes, temps de traitement après raccrochage compris. C'est moins flatteur pour l'IA que ce qu'on lit ailleurs, mais c'est le chiffre qui tient devant un DAF.

Conseillers d'un standard téléphonique avec casque, prenant des notes pendant un appel

Le calcul part du salaire net moyen d'un employé du secteur privé en équivalent temps plein, 1 941 € par mois en 2024 selon l'Insee (2 733 € tous salariés confondus). Cotisations salariales et patronales ajoutées, le coût chargé approche 3 500 € par mois. Sur 130 heures réellement passées au téléphone (le reste part en pauses, réunions, tâches administratives), l'heure revient à environ 27 €. Un appel de 3 minutes suivi de 2 minutes de saisie coûte donc 2,25 €.

Ce coût monte par paliers : au-delà de 1 200 à 1 500 appels par mois, il faut un second poste. Mais il ne comporte ni développement ni dérive technique, d'où notre conseil d'éviter l'agent vocal sous quelques centaines d'appels mensuels.

À partir de quel volume l'agent vocal devient-il rentable ?

Autour de 850 appels par mois pour un projet sur mesure à 30 000 €, et dès 150 à 200 appels avec une plateforme en abonnement. Le seuil se calcule simplement : coûts fixes mensuels de l'agent divisés par l'économie unitaire (coût humain de 2,25 € moins consommation de 0,12 €), soit 1 800 / 2,13, environ 850 appels.

La durée moyenne joue en sens inverse de ce qu'on imagine. L'humain coûte environ 0,45 € par minute de conversation, l'agent 0,03 à 0,05 €. Plus les appels sont longs, plus l'écart se creuse en faveur de l'IA, tant que l'appel aboutit. Le seuil de durée qui compte est ailleurs : au-delà de 6 à 7 minutes, un appel automatisé traduit presque toujours un scénario mal borné, et il coûte alors les deux, l'IA puis la personne.

D'où le paramètre qui décide de tout : le taux de traitement sans transfert. À 90 %, l'économie est de 1,90 € par appel. À 60 %, elle tombe à 1,25 €, et le seuil de volume passe de 850 à près de 1 500 appels. Sur le copilote conversationnel déployé chez SuperHote, l'assistant traite 95 % de 2 millions de messages mensuels et passe la main à un humain sous un seuil de confiance. C'est ce mécanisme, plus que la qualité de la voix, qui tient l'économie d'un agent vocal.

Qu'est-ce qui fait exploser la facture d'un agent vocal ?

Quatre choses, dans l'ordre où on les rencontre en mission : les transferts ratés, les appels longs, la latence et la téléphonie sortante. Aucune n'apparaît dans une grille tarifaire.

Le transfert raté est le plus coûteux. L'agent tente trois minutes, échoue, transfère, et la personne reprend depuis le début parce que le contexte n'a pas suivi. On paie alors 0,12 € d'IA, 2,25 € d'humain, et on récupère un client agacé. Un transfert avec résumé écrit poussé dans l'outil du conseiller coûte quelques centimes de plus et ramène le temps de reprise sous 2 minutes.

Les appels longs coûtent de façon non linéaire côté modèle. À chaque tour, l'historique complet est renvoyé : un appel de 10 minutes et 30 tours consomme non pas trois fois mais six à huit fois plus de tokens qu'un appel de 3 minutes. La parade : un résumé glissant de l'historique à partir du dixième tour et un prompt système court.

La latence ne coûte rien en facture et tout en rentabilité. Passé une seconde environ entre la fin de la phrase de l'appelant et le début de la réponse, les gens raccrochent ou parlent par-dessus l'agent, d'où des tours supplémentaires et des transferts. C'est la raison de choisir un STT en flux continu plutôt qu'en lot, même si Google affiche 0,003 $ la minute en traitement différé contre 0,016 $ en temps réel.

Enfin, les rappels sortants. Twilio facture l'appel vers un mobile français 0,0404 $ la minute, quatre fois le tarif entrant. Un agent qui rappelle chaque appel manqué double son poste téléphonie. Les pièges côté organisation sont traités dans notre article sur l'accueil téléphonique automatisé en PME, et le cadrage d'ensemble dans le guide de l'IA vocale pour le standard téléphonique.

Ce que JUWA chiffre avant de lancer un agent vocal

Un chiffrage sur les appels réels du client, pas sur un appel type. Les deux premières semaines de l'audit de quatre semaines servent à écouter un échantillon d'appels et à mesurer durée réelle, part de motifs simples, taux de transfert attendu et coût humain poste par poste. On rend ensuite un coût par appel à trois volumes et un seuil de rentabilité en mois, avant d'écrire une ligne de code.

Si le seuil dépasse 18 mois, on le dit et on oriente vers une plateforme en abonnement ou un autre chantier. Sinon, la solution d'IA vocale sur mesure est mise en production en 4 à 8 semaines, avec le transfert sous seuil de confiance dès la première version, l'hébergement en France quand les enregistrements l'exigent, un chef de projet joignable en direct et un point hebdomadaire sur trois indicateurs (coût par appel réel, taux de traitement sans transfert, durée moyenne). Ce sont eux qui décident si l'agent reste en ligne.

FAQ

Questions fréquentes

L'essentiel de cet article, repris en questions-réponses.

Entre 1 800 et 2 700 € par mois pour un agent sur mesure traitant 200 à 5 000 appels, développement amorti sur 24 mois et maintenance comprise. La consommation technique (reconnaissance vocale, modèle, synthèse, téléphonie) ne pèse que 0,08 à 0,20 € par appel de 3 minutes. Une plateforme en abonnement coûte quelques centaines d'euros par mois mais limite la personnalisation.

En consommation pure, 0,08 à 0,20 € pour un appel de 3 minutes aux prix publics de septembre 2026. Tout compris, avec développement, plateforme et supervision, il descend de 7 à 12 € à 200 appels par mois à 0,45 à 0,80 € à 5 000 appels par mois. Le volume est le premier facteur de coût.

Autour de 850 appels par mois pour un projet sur mesure d'environ 30 000 €, face à un coût humain de 2 à 3 € par appel traité. Avec une plateforme en abonnement, le seuil tombe à 150 à 200 appels mensuels. Le taux de traitement sans transfert change tout : à 60 % de traitement, le seuil du sur mesure passe à près de 1 500 appels.

Parce que l'historique complet de la conversation est renvoyé au modèle de langage à chaque tour de parole. Un appel de 10 minutes consomme six à huit fois plus de tokens qu'un appel de 3 minutes, pas trois fois. Un résumé glissant de l'historique et un prompt système court limitent cette dérive.

Partager

Heineken
BlaBlaCar
DataBird
HelloSafe

Un projet IA en tête ? Parlons-en