Google I/O 2026 s'est déroulé les 19 et 20 mai. Google y a annoncé Gemini Omni, Gemini 3.5 Flash et de nouvelles fonctions agentiques. Pour une PME suisse, la conclusion utile n'est pas que les bots téléphoniques peuvent soudain remplacer toute conversation. Le progrès concret est que des modèles temps réel réagissent plus vite, traitent plusieurs types d'entrées et utilisent des outils pendant l'échange.
Plusieurs couches techniques et organisationnelles séparent cependant une démonstration de keynote d'un appel client fiable. Examiner uniquement le modèle revient à ignorer la connexion téléphonique, la qualité audio, les interruptions, le calendrier, la récupération d'erreur et le transfert vers un collaborateur.
Ce que Google a réellement présenté
La collection officielle Google I/O 2026 réunit les annonces sur les modèles et les expériences agentiques. Pour la voix, la documentation de la Gemini Live API est particulièrement pertinente. Google décrit un service en preview pour des interactions bidirectionnelles en temps réel avec audio, image et texte, incluant interruption, outils, transcription et conversation multilingue.
Le statut preview n'est pas un détail. Un service de préversion peut évoluer et nécessite sa propre surveillance, des solutions de repli et un contrôle des versions. Pour une PME, il représente une possibilité de pilote, pas une garantie de production.
Six endroits où l'expérience téléphonique peut se dégrader
- Téléphonie : l'appel est transformé en flux audio puis reconverti.
- Détection du tour de parole : une pause naturelle ne doit pas être confondue avec la fin de la demande.
- Interprétation : le modèle comprend intention, contexte et détails prononcés.
- Outils : calendrier, CRM et base de connaissances peuvent répondre lentement ou échouer.
- Voix de sortie : le timbre, le rythme et la prononciation influencent la confiance.
- Transfert : en cas d'incertitude, le collaborateur doit recevoir le motif et le contexte déjà capturé.
Une première réponse en deux secondes peut sembler naturelle. La même architecture paraît lente si la consultation du calendrier ajoute trois secondes. La latence doit donc être mesurée par couche plutôt qu'en une moyenne globale par appel.
Le suisse allemand ne se résume pas à une langue cochée
Google documente une large prise en charge multilingue. Cela n'indique pas comment un système donné reconnaît les noms, communes et dialectes de Berne, Zurich ou Bâle sur une ligne compressée. Le français romand et l'italien tessinois exigent également leurs propres jeux de tests.
Un jeu dialectal utile contient au moins 30 formulations courtes du processus cible : noms de famille, localités, heures, plaques, produits et corrections fréquentes. L'équipe évalue à la fois la transcription et l'action finale. Une faute d'orthographe peut être bénigne ; un rendez-vous enregistré au mauvais moment ne l'est pas.
L'appelant doit pouvoir interrompre, corriger et quitter
Les personnes ne parlent pas comme des champs de formulaire. Elles se corrigent, interrompent et changent de sujet. La Live API prévoit le barge-in, mais l'application décide encore de la suite. Une réservation commencée est-elle annulée ? Les données déjà confirmées restent-elles valides ? Le système clarifie-t-il lorsque deux heures sont mentionnées ?
Chaque action a besoin d'une limite transactionnelle. Lire présente moins de risque qu'écrire. Annoncer un créneau libre présente moins de risque que le réserver. Dans un premier pilote, l'assistant recueille les données et prépare l'action ; la confirmation définitive vient après une répétition explicite ou une validation humaine.
Scénario de pilote pour une équipe de service
Une entreprise artisanale peut recueillir les demandes de rappel en dehors des heures de bureau. L'assistant demande nom, téléphone, commune, type de problème et créneau préféré. Il ne promet ni rendez-vous ni prix. Les urgences, réclamations existantes et situations de sécurité incertaines sont transférées vers un numéro ou une file définie.
Avant le lancement, l'équipe prépare 50 scénarios : personne parlant doucement, dialecte, bruit de fond, interruption, numéro incomplet ou demande immédiate d'un humain. Le pilote ne traite qu'une petite part des appels réels tant que les transferts critiques ne fonctionnent pas de manière constante.
Confidentialité et enregistrement sont des choix d'architecture
Le PFPDT explique que la LPD s'applique aux traitements IA et exige une information transparente. Le système doit donc annoncer simplement qu'une IA répond et pourquoi les données demandées sont traitées.
Une transcription, un enregistrement audio et une note CRM sont trois objets distincts. Chacun nécessite une finalité, une durée de conservation et un groupe d'accès. Si l'audio n'est pas indispensable au contrôle qualité, il ne doit pas être conservé indéfiniment. Les contenus sensibles ne sont pas copiés sans filtre dans les journaux analytiques.
Tableau de bord sur deux semaines
| Mesure | Ce qu'elle révèle | Signal d'arrêt |
|---|---|---|
| Délai avant la première réponse compréhensible | Réactivité perçue | Pauses longues ou très variables |
| Achèvement de la tâche | Demande de rappel ou rendez-vous complète | Fausse confirmation |
| Récupération après interruption | Correction correctement mémorisée | Données perdues ou dupliquées |
| Transfert avec contexte | Continuation sans recommencer | Transfert sans résumé |
| Erreur dialectale ayant un effet | Impact réel de la reconnaissance | Erreur de lieu, heure ou identité |
Ces mesures conviennent à un assistant téléphonique IA pour PME suisses. Elles montrent où le flux peut être étendu en sécurité, contrairement au simple nombre d'appels traités.
Questions à poser avant de choisir un fournisseur
- Quelle version du modèle et de l'API fonctionne en production, et comment les changements sont-ils testés ?
- Où audio, transcriptions et logs d'outils sont-ils traités et stockés ?
- Que se passe-t-il si calendrier, CRM, modèle ou opérateur téléphonique tombe en panne ?
- L'appelant peut-il demander une personne à tout moment ?
- Comment annuler une action erronée et qui reçoit l'alerte ?
- Quels dialectes ont été testés avec la véritable clientèle cible ?
Documents primaires pour la vérification
- Google : actualités et annonces I/O 2026
- Google AI for Developers : Gemini Live API
- PFPDT : IA et protection des données
La Voice AI est devenue plus capable autour de Google I/O 2026, mais pas automatiquement prête pour l'exploitation. L'étape raisonnable est un pilote étroit, avec de vrais dialectes, une latence mesurée, des droits restreints et un transfert humain qui fonctionne encore un lundi matin chargé.
FAQ
Un modèle plus rapide garantit-il de meilleurs appels ?
Non. La qualité dépend aussi de la téléphonie, du traitement audio, des appels d'outils, des interruptions, de la voix de sortie et du transfert humain.
La Voice AI comprend-elle correctement le suisse allemand ?
Il faut le vérifier avec des appels réels de la région cible. Une liste générale de langues ne remplace pas un test de dialectes, d'accents et de bruit.
Quelle mission convient à un premier pilote ?
Une tâche étroite avec transfert clair, par exemple recueillir une demande de rappel, expliquer les horaires ou structurer une demande de rendez-vous.
Faut-il informer l'appelant qu'il parle à une IA ?
Oui, la transparence est essentielle. Le PFPDT demande que la finalité, le fonctionnement et les sources des traitements IA soient présentés clairement.