Intermédiaire·2 min·16 septembre 2026

Gemini Live : Google sort son IA vocale temps réel

🎧 Résumé audio0:00 / 0:00
Google lance Gemini 3.8 Live : une IA qui te parle en temps réel, directement dans ton navigateur.
Gemini Live : Google sort son IA vocale temps réel

Pourquoi ça compte pour toi

Tu peux enfin discuter avec une IA par la voix sans application mobile, sans SDK complexe. C'est du speech-to-speech natif, comme ChatGPT Live d'OpenAI, mais chez Google. Si tu construis une application avec voix, tu as maintenant deux géants qui te proposent ça prêt à l'emploi.

Ce qu'il faut retenir

  • 1.Deux modèles lancés : Gemini 3.8 Live et 3.8 Live Extended Thinking (réflexion approfondie)
  • 2.Fonctionne directement en WebSocket, pas de lib externe — moins de dépendances
  • 3.Tu peux interrompre le modèle pendant qu'il parle (interruption en temps réel)
  • 4.Prompt système personnalisable + choix de voix avant de démarrer la conversation

Tu galères avec le jargon ?

Lis la version réécrite en mode débutant — toutes les idées, sans le jargon.

Comment ça marche en coulisses

Gemini Live, c'est du speech-to-speech : tu parles, l'IA répond vocalement. Zéro latence importante si tout est bien branché.

Sous le capot, c'est une WebSocket brute qui se branche sur wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent?key=... — rien de compliqué, pas de surcouche npm lourde.

Pour l'audio (capture et lecture), ça utilise la Web Audio API native (AudioContext). Donc : pas de dépendance à TensorFlow.js, pas de lib audio bizarre. Du standard web.

Deux modèles, deux usages

Gemini 3.8 Live : la version rapide. Répond en temps réel, sans hésitation.

Gemini 3.8 Live Extended Thinking : le modèle qui réfléchit avant de répondre. Utile si tu lui poses une question complexe (maths, code, logique).

Pourquoi c'est pertinent pour toi

Si tu es dev ou startup :

  • C'est un <script> + WebSocket + boom, tu as une voix dans ton application.
  • Pas besoin de télécharger un modèle local (sauf si tu veux).
  • Google facture à l'usage (comme OpenAI).

Si tu testes des agents IA :

  • La voix, c'est l'interface du futur pour les assistants (pourquoi taper si tu peux parler ?).
  • Gemini Live Extended Thinking est intéressant : réflexion en temps réel, pas juste des générations tokens rapides.

L'interruption, c'est clé

Un détail qui change tout : tu peux couper l'IA en pleine phrase. "Attends, reprends depuis le début." L'IA comprend et repart. C'est nettement plus naturel qu'une conversation où tu dois attendre la fin de chaque réplique.

Et concrètement pour toi ?

Choisis ton profil — la lecture de l'article change selon qui tu es.

🔭 Curieux

Pour toi, écoute une démo où quelqu'un interrompt Gemini en pleine phrase : tu verras la vraie différence entre un bot qui parle et une conversation naturelle. C'est le signal que l'IA vocale devient mainstream, pas juste gadget.

Newsletters Noésis

3 minutes d'IA dans ta boîte mail, chaque matin.

Rejoins les francophones qui comprennent, essaient et progressent avec l'IA. Choisis ce que tu veux recevoir. Désabonnement en 1 clic.

Explorer les thèmes de cet article :