Google I/O 2026 si è svolto il 19 e 20 maggio. Google ha annunciato Gemini Omni, Gemini 3.5 Flash e nuove funzioni agentiche. Per una PMI svizzera la conclusione utile non è che i bot telefonici possano improvvisamente gestire ogni conversazione. Il cambiamento concreto è che i modelli real-time reagiscono più rapidamente, elaborano più tipi di input e usano strumenti durante il dialogo.
Tra una demo sul palco e una chiamata cliente affidabile esistono comunque diversi livelli tecnici e organizzativi. Valutare solo il modello significa ignorare connessione telefonica, qualità audio, interruzioni, accesso al calendario, recupero dagli errori e trasferimento al personale.
Che cosa ha annunciato davvero Google
La raccolta ufficiale Google I/O 2026 presenta i nuovi modelli e le esperienze agentiche. Per la voce è rilevante anche la documentazione della Gemini Live API. Google descrive un servizio in preview per interazioni bidirezionali in tempo reale con audio, immagini e testo, con interruzione, tool, trascrizione e conversazioni multilingue.
La parola preview è importante. Un servizio preliminare può cambiare e richiede monitoraggio indipendente, fallback e controllo delle versioni. Per una PMI è una nuova opzione di pilot, non una garanzia produttiva.
Sei punti in cui la qualità di una telefonata può perdersi
- Telefonia: la chiamata viene trasformata in uno stream audio e riconvertita.
- Rilevamento del turno: una pausa naturale non deve sembrare la fine della richiesta.
- Interpretazione: il modello comprende intenzione, contesto e dettagli pronunciati.
- Strumenti: calendario, CRM e knowledge base possono essere lenti o indisponibili.
- Voce in uscita: timbro, ritmo e pronuncia influenzano la fiducia.
- Handover: se la confidenza è bassa, il collaboratore deve ricevere motivo e contesto già acquisito.
Una risposta iniziale in due secondi può sembrare naturale. La stessa architettura appare lenta se il calendario aggiunge altri tre secondi. La latenza va quindi misurata per ogni livello, non come media dell'intera conversazione.
Lo svizzero tedesco non è una casella in un elenco
Google documenta un ampio supporto multilingue. Questo non dice come il sistema concreto riconoscerà nomi, comuni e dialetti di Berna, Zurigo o Basilea attraverso una linea compressa. Anche il francese della Romandia e l'italiano del Ticino richiedono test dedicati.
Un set utile contiene almeno 30 frasi brevi del processo target: cognomi, località, orari, targhe, nomi di prodotti e correzioni tipiche. Il team valuta sia la trascrizione sia l'azione finale. Un errore ortografico può essere innocuo; un appuntamento registrato all'ora sbagliata non lo è.
Il chiamante deve poter interrompere, correggere e uscire
Le persone non parlano come campi di un modulo. Si correggono, interrompono e cambiano argomento. La Live API documenta il barge-in, ma l'applicazione decide cosa accade dopo. Una prenotazione iniziata viene annullata? I dati confermati restano? Il sistema chiarisce quando sono stati citati due orari?
Ogni azione necessita di un confine transazionale. Leggere è meno rischioso che scrivere. Comunicare uno slot libero è meno rischioso che prenotarlo. Nel primo pilot l'assistente può raccogliere dati e preparare un'azione; la conferma definitiva avviene dopo una ripetizione esplicita o un'approvazione umana.
Un pilot realistico per un team di servizio
Un'impresa artigiana può raccogliere richieste di richiamata fuori orario. L'assistente chiede nome, telefono, comune, tipo di problema e fascia preferita. Non promette né appuntamento né prezzo. Emergenze, reclami esistenti e situazioni di sicurezza poco chiare vengono trasferiti a un numero o a una coda definita.
Prima del lancio il team prepara 50 scenari: voce bassa, dialetto, rumore, interruzione, numero incompleto o richiesta immediata di un operatore. Il pilot gestisce solo una piccola quota di chiamate reali finché gli handover critici non funzionano con costanza.
Privacy e registrazione sono scelte architetturali
L'IFPDT spiega che la LPD si applica ai trattamenti AI e richiede informazioni trasparenti. Il sistema dovrebbe quindi dichiarare in modo semplice che risponde un'AI e per quale scopo vengono raccolti i dati.
Trascrizione, registrazione audio e nota CRM sono tre oggetti distinti. Ognuno necessita di scopo, periodo di conservazione e gruppo di accesso. Se l'audio non serve al controllo qualità, non va conservato indefinitamente. I contenuti sensibili non vengono copiati senza filtro nei log analitici o nei prompt.
Scorecard di due settimane
| Misura | Che cosa rivela | Segnale di stop |
|---|---|---|
| Tempo alla prima risposta comprensibile | Reattività percepita | Pause lunghe o molto variabili |
| Completamento del compito | Richiamata o appuntamento raccolti interamente | Conferma errata |
| Recupero dopo interruzione | Correzioni mantenute correttamente | Dati persi o duplicati |
| Handover con contesto | Continuazione senza ricominciare | Trasferimento senza riepilogo |
| Errore dialettale con impatto | Effetto operativo del riconoscimento | Errore di luogo, ora o identità |
Queste metriche sono adatte a un assistente telefonico AI per PMI svizzere. Mostrano dove estendere il flusso in sicurezza, a differenza del semplice conteggio delle chiamate.
Domande prima di scegliere il fornitore
- Quale versione del modello e dell'API funziona in produzione e come vengono testati i cambiamenti?
- Dove sono elaborati e conservati audio, trascrizioni e log dei tool?
- Che cosa accade se calendario, CRM, modello o provider telefonico non risponde?
- Il chiamante può chiedere una persona in qualsiasi momento?
- Come si annulla un'azione errata e chi riceve l'allarme?
- Quali dialetti sono stati testati con il vero pubblico dell'azienda?
Materiale primario per la verifica
- Google: notizie e annunci I/O 2026
- Google AI for Developers: Gemini Live API
- IFPDT: IA e protezione dei dati
La Voice AI è diventata più capace intorno a Google I/O 2026, ma non automaticamente pronta per la produzione. Il passo sensato è un pilot ristretto, con dialetti reali, latenza misurata, permessi limitati e un handover umano che funzioni anche il lunedì mattina.
FAQ
Un modello più veloce produce automaticamente telefonate migliori?
No. La qualità dipende anche da telefonia, trattamento audio, chiamate ai tool, interruzioni, sintesi vocale e passaggio a una persona.
La Voice AI capisce in modo affidabile lo svizzero tedesco?
Va verificato con chiamate reali della regione. Un elenco generale di lingue non sostituisce test di dialetto, accento e rumore.
Quale compito è adatto al primo pilot?
Un compito ristretto con handover chiaro, come raccogliere una richiamata, spiegare gli orari o strutturare una richiesta di appuntamento.
Il chiamante deve sapere che sta parlando con un'AI?
La trasparenza è essenziale. L'IFPDT richiede che scopo, funzionamento e fonti del trattamento AI siano comunicati chiaramente.