Sommaire
La révolution audio de Google Gemini
Une nouvelle dimension pour l’IA de Gemini
Google Gemini, l’assistant intelligent de Google, vient de se doter d’une fonctionnalité qui va changer la donne : la prise en charge des fichiers audio.
En effet, vous pouvez désormais télécharger des fichiers audio via le web ou les applications mobiles, pour obtenir des transcriptions, des résumés et les points clés.
Pour ceux qui redoutent de revoir un enregistrement de réunion ou qui laissent des mémos vocaux prendre la poussière dans leur téléphone, cette mise à jour promet d’être une révélation, semblable à l’embauche d’un assistant personnel pour prendre des notes.
Utilisation et limites actuelles
Notons cependant que la fonctionnalité est limitée à 10 minutes d’audio par session. Vous pouvez sélectionner les fichiers audio depuis les options habituelles de téléchargement. Contrairement aux capacités vocales en temps réel de Gemini Live, cette fonctionnalité traite les données de manière plus approfondie et change radicalement la façon dont l’information est traitée.
Josh Woodward, le vice-président de Gemini chez Google, souligne que le téléchargement de fichiers audio est la fonctionnalité la plus demandée par les utilisateurs.
Évolution de l’IA audio
“Problème résolu : Vous pouvez désormais télécharger n’importe quel fichier sur @GeminiApp. Y compris la demande numéro 1 : les fichiers audio sont désormais pris en charge !”
Une fois testée avec des sketches humoristiques et une conversation téléphonique, l’IA s’est montrée efficace pour transcrire et extraire les éléments clés, bien qu’il y ait eu quelques erreurs mineures liées aux noms propres. Cette nouveauté montre une évolution des outils IA en réponse à notre façon de sauvegarder des informations vocales, souvent via des logiciels externes.
En parallèle, Google a déjà intégré Gemini dans d’autres applications et en a enrichi l’interface utilisateur via une approche visuelle par cartes. La possibilité de traiter les fichiers audio s’inscrit dans cette dynamique d’amélioration.
Comparaison avec d’autres IA
Même si d’autres assistants, tels que ChatGPT avec son modèle Whisper, offrent également des transcriptions, l’offre de Google se démarque pour son usage quotidien. Claude d’Anthropic et Perplexity traitent aussi des fichiers audio mais se concentrent souvent sur des usages différents, comme l’extraction de données de vidéos YouTube.
Gemini va plus loin qu’une simple transcription. On peut lui demander de simplifier le langage, d’extraire les commentaires d’un interlocuteur, de générer des questions ou même de créer un guide d’étude à partir d’une discussion en classe. Malgré la limite des 10 minutes, ces capacités enrichissent encore plus notre quotidien technologique.
Limites d’utilisation et tarifs
A ce jour, Google n’a pas annoncé de tarifs spécifiques pour le traitement des volumes élevés de fichiers audio.
La fonctionnalité reste incluse dans le quota régulier de Gemini, ce qui incite à gérer prudemment l’utilisation pour des besoins extensifs.
