Blog

L’IA Qui Cria AAAAAAHHH!

L'IA Qui Cria AAAAAAHHH!
Ecrit par Mathieu

L’introduction de voix plus humaines dans l’IA

Frustration technologique
Souvent, les voix artificielles cherchent à imiter une convivialité réaliste, s’inspirant de personnalités détendues et amicales.

Cependant, un nouveau modèle open-source nommé Dia explore un éventail plus large d’émotions, y compris la possibilité de crier intensément.

Chez Nari Labs, les créateurs de Dia, bien que peu nombreux, ont apporté à ces voix une dimension théâtrale, capable de rires réalistes, de tousser, de raclement de gorge, de reniflements, et bien sûr, de hurlements.

Si à première vue, crier peut sembler insignifiant pour une IA, il s’agit en fait d’une compétence complexe. Ce n’est pas simplement une question de volume; c’est une toute autre forme de discours.

La communication émotionnelle : une lacune comblée

Le discours expressif manque à la plupart des voix IA actuelles. Bien que nombreuses soient capables de lire une histoire pour endormir un enfant, très peu savent reproduire la tonalité d’une réaction choquée ou d’une tentative de calmer un ami. Les modèles commerciaux tendent à atténuer la voix pour éviter le ton robotique, ce qui les prive de l’asymétrie nécessaire à l’expression émotionnelle.

Dia intègre la communication non verbale comme un élément essentiel de sa performance. Elle sait qu’un “tousse” ne doit pas être ignoré ou lu littéralement. Elle reconnaît que crier n’est pas simplement parler plus fort. Son exécution repose sur des réglages précis de timing, de modulation de la hauteur et de contrôle de la respiration, rendant ces éléments plus authentiques.

Un utilisateur a même utilisé ce modèle pour recréer un extrait célèbre du sketch Leroy Jenkins réalisé sur World of Warcraft.

Comparaisons et perspectives

Cela ne signifie pas que OpenAI, ElevenLabs, Google, Sesame, et consorts n’ont pas développé d’excellents modèles vocaux. Par exemple, on peut personnaliser le Advanced Voice Mode d’OpenAI pour exprimer diverses émotions. ElevenLabs excelle dans l’interprétation de la ponctuation pour ajuster le discours, mais cela ne se compare pas à une exclamation de surprise ou à un rire étouffé.

Sesame parvient à imiter et réagir de manière quasi réaliste, mais ses modèles tendent vers une attitude positive et enjouée.

Bien sûr, le réalisme reste subjectif. Vous pourriez percevoir rapidement que Dia est une voix IA. Toutefois, il en va de même pour les faux éclats de rire et cris, qui restent humainement crédibles dans le bon contexte.

Deux étudiants de premier cycle. L’un toujours dans l’armée. Zéro financement. Un objectif fou : créer un modèle TTS qui rivalise avec NotebookLM Podcast, ElevenLabs Studio, et Sesame CSM. D’une manière ou d’une autre… nous y sommes arrivés. Voici comment 👇

L’émotion dans l’IA : un enjeu majeur

L’apprentissage des cris par des IA ne se réduit pas à un simple “tour de passe-passe” ; cela présage une évolution plus large. Nous entrons dans une ère où il ne suffira plus à un assistant de dire la bonne chose, mais de la dire de la bonne manière.

Imaginez des chatbots de support client qui paraissent réellement désolés, des enseignants encourageants plutôt qu’uniquement instructifs, et des personnages de jeux vidéo transmettant la sincérité.

Bien sûr, doter l’IA de compétences émotionnelles convaincantes la rend plus persuasive et potentiellement plus manipulatrice. Si le discours émotionnel devient un outil à part entière de l’IA, quelques personnes pourraient ressentir le besoin de crier elles-mêmes.

Néanmoins, l’idée d’écrire une histoire de fantômes pour qu’elle ne soit pas simplement lue mais “jouée” par Dia, cris inclus, paraît particulièrement amusante.

No. 4
La boîte Intelligence...
  • La boîte d'intelligence artificielle
  • Type de produit : Livre Abis
  • Marque: Marabout

A propos de l'auteur.

Mathieu

Laisser un commentaire.