C’est quoi, concrètement ?
C’est un modèle de Google qui transforme la parole en texte écrit, avec un niveau de précision inédit pour la firme.
Google l’a présenté le 26 août 2026, dans la foulée de Gemini 3.5 Live Translate, son modèle de traduction. Il appartient à la famille Gemini Audio et succède à Chirp 3, l’ancien modèle de transcription de la maison. Le progrès se mesure : un taux d’erreur de 5,5 % en transcription en direct, le plus bas jamais annoncé par Google, et un traitement plus rapide que chez son prédécesseur.
Ce lancement illustre la stratégie de la firme : décliner la gamme Gemini en modèles dédiés à un usage précis, plutôt que de tout concentrer dans un seul produit. Gemini 3.5 Pro, annoncé mais pas encore sorti, devra patienter.
En quoi c’est mieux qu’une dictée classique ?
Parce qu’il ne se contente pas d’écrire les mots. Il nettoie, sépare et comprend.
Une dictée classique retranscrit tout ce qui sort de votre bouche, hésitations comprises. Là, les euh, les ah et les mots de remplissage disparaissent du texte final. Le modèle gère aussi les auto-corrections : si vous reprenez une phrase pour la corriger, seule la version corrigée est conservée, pas les deux.
Pour une réunion à plusieurs, il distingue les voix les unes des autres. Chaque intervenant est identifié et le compte rendu indique qui a dit quoi.
Il reconnaît enfin le vocabulaire personnalisé : les termes métier, les noms propres, le jargon de l’entreprise. Le modèle s’adapte au style de parole naturel et cherche à comprendre l’intention, pas seulement à transcrire des sons.
À quoi ça sert dans une petite entreprise ?
À gagner du temps sur tout ce qui se dit au lieu de s’écrire.
Le cas le plus parlant est le compte rendu de réunion. Un téléphone posé sur la table suffit : la réunion se déroule normalement et, à la sortie, le texte est déjà propre, prêt à être partagé. La même logique vaut pour la dictée : un devis, une réponse à un client, une idée à ne pas perdre, tout se dicte entre deux rendez-vous. Le sous-titrage, enfin, concerne les vidéos du site et des réseaux sociaux : les sous-titres se posent sans heures de saisie.
Le gain se mesure en trois points : moins de temps passé à taper, moins d’erreurs qu’avec une dictée classique, et des documents de travail utilisables tout de suite. C’est le cœur de l’intérêt pour une TPE : la transcription sert directement, elle ne finit pas dans un fichier à corriger.
Où est-ce qu’on le trouve ?
Dans les outils Google du quotidien, et dans l’API pour les développeurs.
Gemini 3.5 Transcribe est déjà actif dans Gboard Rambler, la saisie vocale d’Android. Google l’annonce dans Google Chrome et dans l’application Gemini sur macOS. Google Keep, de son côté, intègre des fonctions de prise de notes vocale appuyées sur le modèle.
Côté développeurs, le modèle est accessible via l’API Gemini. Les éditeurs d’applications de réunion, de logiciels métier ou d’outils de sous-titrage peuvent donc l’intégrer à leurs produits, et l’on verra la transcription arriver dans des outils qui n’en avaient pas.
Pour la TPE, le point d’entrée est l’outillage Google de tous les jours, et rien à acheter : un smartphone ou un ordinateur avec un micro suffit pour commencer.
Quelles sont les limites à connaître ?
La transcription vaut ce que vaut l’audio, et elle ne remplace pas une relecture.
La prise de son d’abord. Dans une salle calme, avec un micro correct, le résultat est excellent. Dans un atelier bruyant ou une pièce qui résonne, la qualité baisse : le modèle fait de son mieux avec ce que le micro capte.
Les langues ensuite. La liste des langues supportées évolue après un lancement. Le français est géré, mais vérifiez que votre usage précis est couvert avant de réorganiser vos habitudes autour du modèle.
Le statut du texte produit, enfin. Pour un devis signé, un contrat ou un document officiel, la transcription seule ne suffit pas : elle reste un brouillon intelligent à relire. Elle sert à gagner du temps, pas à remplacer le jugement humain.
Au fond, la question n’est pas de savoir si le modèle est impressionnant. Elle est de savoir s’il vous fait gagner du temps, à vous. La réponse se vérifie en cinq minutes, avec votre voix, sur un usage réel : un bout de réunion, une dictée, un enregistrement quelconque. Si le gain est là, le modèle trouvera sa place dans votre organisation. Sinon, vous n’aurez rien perdu à l’essai.