Google place la barre plus haut en matière d’IA conversationnelle avec Gemini 3.8 Live et Live Extended Thinking

Quelques semaines après l’annonce des modèles 3.8 Flash et 3.8 Cyber ​​​​et trois semaines après l’annonce du modèle 3.5 Transcribe, Google a annoncé une avancée importante dans le segment de l’intelligence artificielle conversationnelle en présentant les nouveaux modèles Gemini 3.8 Live et 3.8 Live Extended Thinking.

Les deux nouveaux venus sont conçus pour rendre les interactions vocales extrêmement fluides et naturelles, et pour piloter des agents capables de gérer des tâches complexes en temps réel sans interrompre le dialogue de l’utilisateur. Avec 3.5 Transcribe et d’autres modèles annoncés précédemment, les nouveaux modèles constituent la suite définitive permettant aux développeurs de créer leurs applications vocales en temps réel les plus avancées. Découvrons tous les détails.

Suivez Comparatel.fr sur Google Discover

Google a annoncé deux nouveaux modèles d’IA conversationnelle

Comme prévu au début, à travers un article sur le blog officiel, Google a annoncé les nouveaux modèles d’IA conversationnelle Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, définis comme « les modèles de dialogue en direct les plus avancés jamais créés ».

Ces nouveaux modèles, nets du rapport coût/performance habituel des modèles de la série Flash, peuvent se vanter d’importantes améliorations en termes d’intelligence et de raisonnement parallèle qui en font la base idéale pour des agents vocaux fiables.

Gémeaux 3.8 en direct

Le nouveau Gemini 3.8 Live a été développé pour offrir une efficacité opérationnelle élevée et un dialogue naturel. Il combine l’intelligence conversationnelle et la compréhension du contexte visuel avec le traitement des entrées en temps réel et la reconnaissance automatique de 97 langues et accents différents (et une commutation dynamique entre chacune d’elles).

L’une des particularités de ce modèle est sa capacité à exécuter des outils de manière asynchrone et à appeler des API en arrière-plan. Grâce à cela, il peut continuer à parler et interagir avec l’utilisateur tout en effectuant des opérations en dehors de la session.

Exemple 1

Gemini 3.8 Live guide l’intégration des nouveaux employés en temps réel, en utilisant un contexte visuel pour répondre aux questions en temps réel.

Exemple 2

Regardez Gemini 3.8 Live jouer aux échecs en temps quasi réel, en tirant parti du contexte visuel, du raisonnement et du flux naturel des conversations.

Gemini 3.8 Live Pensée étendue

Toutefois, pour les tâches très complexes, Google a développé Gemini 3.8 Live Pensée étendueun modèle conçu pour effectuer un raisonnement avancé en plusieurs étapes tout en conservant la fluidité de la parole.

La particularité de ce modèle est sa capacité à combiner traitement simultané et synthèse vocale : au lieu de rester silencieux pendant le raisonnement et le traitement en arrière-plan, cela prend du temps comme n’importe qui le ferait avec des phrases « spontanées » (par exemple « Laissez-moi vérifier »).

Cette approche permet au modèle de vous guider à travers des flux de travail complexes, de la génération de code à la création d’interface, d’un brouillon à la planification commerciale.

Exemple 1

Regardez Gemini 3.8 Live Extended Thinking transformer des ébauches et des commentaires vocaux en temps quasi réel en composants React fonctionnels.

Exemple 2

Regardez Gemini 3.8 Live créer des plans d’affaires complets et des boîtes à outils marketing personnalisées en temps réel, en utilisant un langage naturel.

Performances des nouveaux modèles

En termes de performances, le modèle Gémeaux 3.8 en direct a pris la deuxième place dans le Arène des agents de parole (la plateforme compare les modèles d’IA voix à voix dans des conversations réelles) et fait preuve d’une grande précision dans le traitement des données alphanumériques (telles que les codes de vérification ou les numéros de cas).

Quant à Gemini 3.8 Live Pensée étendueles benchmarks confirment son efficacité : le modèle a obtenu la première place globale dans l’indice de qualité Speech to Speech d’Artificial Analysis et montre d’excellents résultats dans l’exécution des tâches de l’agence.

Disponibilité de nouveaux modèles

Les nouveaux modèles d’IA conversationnelle que Google vient de présenter sont déjà distribués dès aujourd’hui auprès des développeurs, des entreprises et des utilisateurs grand public.

  • Gémeaux 3.8 en direct
    • Développeurs – dans l’API Gemini et Google AI Studio
    • Entreprises – bientôt disponible sur Gemini Enterprise (aperçu privé)
    • Utilisateurs grand public – en Recherche en direct de la Mode IA
  • Gemini 3.8 Live Pensée étendue
    • Développeurs – dans l’API Gemini et Google AI Studio
    • Entreprises – bientôt disponible sur Gemini Enterprise (en avant-première privée), sur Gemini Enterprise pour l’expérience client et pour les clients Google Workspace
    • Utilisateurs grand public – pour tous Gémeaux en directpour les abonnés à n’importe quel forfait Google AI en Rester en direct Et Rester en directpour les abonnés aux forfaits Google AI Pro et AI Ultra Documents en direct.

Suivez Google sur Telegram, recevez en premier les actualités et les offres

La suite « Gemini Audio » mise à jour est déjà disponible pour les développeurs

Avec les nouveaux modèles Gémeaux 3.8 en direct Et 3.8 Réflexion étendue en directcomme le raconte un autre article du blog officiel, Google a essentiellement mis à disposition de la communauté des développeurs une suite complète qui peut également compter sur :

  • Gémeaux 3.5 Transcription (un modèle voix-texte capable de fonctionner dans plus de 85 langues)
  • Gemini 3.5 Traduction en direct (annoncé en juin, il s’agit d’un modèle de traduction vocale dans plus de 70 langues)
  • Lyrie 3.5 (annoncé fin juillet, il s’agit du modèle de génération musicale le plus avancé de l’entreprise)

Tous ces modèles sont disponibles aujourd’hui dans l’API Gemini et dans Google AI Studio pour permettre aux développeurs de créer des expériences de produits vocales en temps réel, c’est-à-dire toute une série d’agents capables d’effectuer des tâches d’assistance et d’observation, voire d’interagir avec des personnes parlant différentes langues.

Suivez-nous sur :Google DécouverteGoogle, comme source préféréeFacebookYouTubeInstagramTik Tok