Créer, interpréter, mettre en scène et produire des voix artificielles dans plusieurs langues, jusqu’à la réalisation complète de dialogues et de livres audio.

🧪 Projet personnel et expérimental — non commercialisé

IA-VoiceDub est un projet personnel développé autour de la synthèse vocale, du traitement audio et de l’intelligence artificielle.

À l’origine, l’objectif était relativement simple : pouvoir générer du texte dans plusieurs langues tout en conservant l’identité d’une même voix.

Le projet a progressivement évolué bien au-delà de cette première idée.

Aujourd’hui, IA-VoiceDub est devenu un véritable studio vocal local, capable de gérer plusieurs profils de voix, plusieurs langues, différentes expressions, des dialogues multi-personnages, des projets de fiction structurés en chapitres, des ambiances sonores, des bruitages, une timeline et même l’assemblage d’un livre audio complet.

Le projet n’est actuellement ni commercialisé ni distribué en open source. Il est présenté ici dans le cadre de mon portfolio afin d’illustrer mes travaux en développement logiciel, intelligence artificielle, traitement audio et création d’outils spécialisés.


🎙️ Un studio de synthèse vocale multilingue

IA-VoiceDub repose sur un moteur de synthèse vocale utilisant Coqui XTTS v2.

À partir d’enregistrements de référence, l’application permet de construire des profils vocaux réutilisables puis de générer de nouveaux contenus avec ces voix.

Une même voix peut être utilisée dans plusieurs langues tout en conservant une identité vocale commune.

Le projet prend actuellement en charge notamment :

français • anglais • allemand • espagnol • russe • chinois • japonais • coréen

Il est possible de sélectionner directement une langue ou d’utiliser un mode automatique multilingue.

Dans ce mode, le texte est découpé en plusieurs segments, la langue de chaque partie est détectée, puis les différents segments sont générés avant d’être réunis dans un seul fichier audio.

Des indications manuelles peuvent également être ajoutées lorsque l’utilisateur souhaite imposer une langue précise à une partie du texte.


👤 Plusieurs profils vocaux totalement indépendants

IA-VoiceDub n’est pas limité à une seule voix.

L’application permet de créer plusieurs profils correspondant à différentes personnes ou différents personnages.

Chaque profil dispose de ses propres données, références audio, langues disponibles et réglages.

Les enregistrements importés peuvent provenir de nombreux formats courants, notamment WAV, MP3, M4A, AAC, FLAC, OGG, WEBM, MP4 ou MOV.

Ils sont ensuite préparés automatiquement dans un format adapté au moteur vocal.

Le profil construit peut être réutilisé ultérieurement sans avoir à retraiter systématiquement les enregistrements d’origine.


🌍 Un conditionnement vocal différent selon la langue

Une des évolutions importantes du projet a été de ne plus considérer une voix multilingue comme un simple profil unique appliqué indistinctement à toutes les langues.

Pour une même personne, IA-VoiceDub peut conserver des références et des conditionnements différents selon la langue.

Cela permet par exemple d’utiliser des enregistrements français pour la génération française et des références coréennes pour la génération coréenne, tout en conservant la même identité générale.

Lorsqu’une langue spécifique n’est pas disponible dans le profil, le système peut utiliser une langue de référence comme solution de repli.

Cette architecture permet de construire progressivement des profils vocaux réellement multilingues.


😊 Des expressions vocales propres à chaque personnage

Le projet ne se limite plus à reproduire une voix neutre.

Des enregistrements spécifiques peuvent être préparés pour différentes expressions vocales, notamment :

voix naturelle, souriante, rire, colère, tristesse, calme ou chuchotement.

Chaque expression peut disposer de références différentes selon la langue.

Lors de la génération, l’utilisateur peut choisir l’expression souhaitée et même régler son intensité.

À faible intensité, la génération reste proche du conditionnement vocal général.

À forte intensité, elle utilise davantage les caractéristiques de l’expression enregistrée.

L’objectif est de disposer d’une voix capable non seulement de prononcer un texte, mais également d’en modifier progressivement l’interprétation.


🎚️ Contrôler l’interprétation de la voix

Plusieurs paramètres permettent d’affiner le résultat généré.

IA-VoiceDub propose notamment différents styles de lecture tels que :

Naturel • Calme • Narration • Expressif • Énergique

L’utilisateur peut également agir sur différents paramètres comme la cadence, l’expressivité, la stabilité ou l’énergie.

L’idée n’est pas seulement de choisir une voix, mais de pouvoir adapter sa manière de parler au contexte : narration posée, dialogue plus vivant, scène dramatique, passage énergique, etc.


⚖️ Comparer plusieurs interprétations

Le studio contient également un système de comparaison A/B.

À partir du même texte et de la même voix, deux interprétations différentes peuvent être générées puis comparées directement.

L’utilisateur peut écouter les deux résultats, modifier les réglages et ne régénérer que la version qu’il souhaite retravailler.

Cette fonction permet d’expérimenter rapidement plusieurs directions vocales sans repartir de zéro.


🔤 Un dictionnaire de prononciation personnalisé

Certaines expressions, noms propres, sigles ou mots particuliers peuvent poser problème aux moteurs vocaux.

IA-VoiceDub intègre donc un dictionnaire de prononciation local.

Des règles peuvent être créées indépendamment pour chaque langue afin de préciser comment certains termes doivent être prononcés.

Par exemple, un sigle ou un nom propre peut être automatiquement remplacé par une écriture phonétiquement plus adaptée avant la génération.

Les règles peuvent être ajoutées, modifiées, désactivées ou supprimées.


🔬 Analyse des enregistrements de référence

La qualité d’une synthèse vocale dépend fortement de la qualité des sons utilisés pour construire le profil.

IA-VoiceDub contient donc des outils permettant d’analyser techniquement les fichiers de référence.

L’application peut notamment examiner la durée des enregistrements, le niveau sonore, les silences ou les risques de saturation.

Elle peut ensuite aider à identifier les références les plus adaptées avant la construction d’un profil vocal.

Les références restent organisées indépendamment par langue et expression, afin que l’utilisateur garde le contrôle sur la matière utilisée pour créer chaque conditionnement.


📦 Des VoicePacks transportables

Un profil vocal construit dans IA-VoiceDub peut être exporté dans un format spécifique appelé VoicePack.

Ce fichier contient les données nécessaires à la réutilisation du profil, ainsi que ses métadonnées et informations de compatibilité.

Les enregistrements audio bruts utilisés pour créer le profil ne sont volontairement pas inclus.

Cela permet de transporter ou sauvegarder un profil vocal sans devoir systématiquement déplacer tous les enregistrements sources.


🎭 Dialogues et scènes multi-personnages

Le projet a ensuite évolué vers la création de véritables scènes audio.

Dans le mode Dialogue / Scène, chaque réplique peut utiliser indépendamment :

un personnage, une langue, un style vocal, une expression, une cadence et une durée de pause.

Les répliques peuvent être ajoutées, déplacées, dupliquées ou supprimées avant d’être assemblées automatiquement dans un fichier audio final.

Une même scène peut donc mélanger plusieurs personnages et plusieurs langues.


🎬 Jusqu’à deux voix simultanément dans une réplique

Le Studio Fiction va encore plus loin.

Une seule réplique peut contenir une ou deux voix simultanées.

Chaque voix possède alors ses propres réglages.

Il est notamment possible d’ajuster séparément le volume, le placement gauche/droite dans l’espace stéréo ou encore un léger décalage temporel.

Cette fonction permet de créer des scènes particulières : deux personnages parlant ensemble, cris simultanés, voix superposées ou effets narratifs.


🎞️ Plusieurs prises pour chaque réplique

Comme dans un véritable travail d’enregistrement, une réplique ne se limite pas forcément à une seule génération.

IA-VoiceDub peut conserver plusieurs prises d’une même réplique.

L’utilisateur peut les écouter puis sélectionner celle qui sera utilisée dans le montage final.

Les autres prises restent disponibles tant qu’elles sont rattachées au projet.

Cela permet de tester plusieurs interprétations sans perdre les versions précédentes.


📖 Studio Fiction — projets, casting et chapitres

Une partie importante d’IA-VoiceDub est désormais consacrée à la production de fictions audio.

Un projet peut mémoriser :

son nom, son narrateur, son casting permanent et ses différents chapitres.

Chaque chapitre conserve ses propres répliques, personnages, réglages et prises audio.

Une génération interrompue peut également reprendre en conservant les répliques déjà produites lorsque leurs paramètres n’ont pas changé.

Cela évite de régénérer inutilement tout un chapitre lorsqu’une seule partie doit être corrigée.


📄 Importer directement un scénario ou un chapitre

Pour éviter de construire chaque scène manuellement, IA-VoiceDub dispose également d’un système d’import de scripts texte.

Un fichier .txt ou un texte copié dans l’application peut utiliser des indications simples comme :

[NARRATEUR]

[Personnage][énervé]

[Personnage A + Personnage B][souriant]

[PAUSE 1200]

Le programme interprète alors ces indications et transforme automatiquement le texte en répliques.

Certaines indications peuvent également agir sur l’expression, le style, la cadence ou l’énergie.

Pour les projets longs, cela permet de passer beaucoup plus rapidement d’un chapitre écrit à une structure audio exploitable.


🎧 Ambiances et bruitages

Une fiction audio ne repose pas uniquement sur les voix.

IA-VoiceDub permet donc d’importer une bibliothèque personnelle de sons.

Ces fichiers peuvent ensuite être utilisés comme :

ambiances, pouvant accompagner une scène sur une durée importante, ou bruitages, déclenchés à un instant précis.

Un projet peut ainsi intégrer une pluie de fond, une porte qui s’ouvre, une ambiance de restaurant, des sons de déplacement ou tout autre élément nécessaire à la scène.


🕒 Une véritable timeline visuelle

Le Studio Fiction intègre une timeline permettant de visualiser les différents éléments d’un chapitre.

Elle peut représenter les répliques, les pauses, les ambiances et les bruitages.

Les éléments peuvent être déplacés pour modifier leur position ou leur ordre.

La timeline permet également d’ajuster le niveau de zoom et d’obtenir une vision d’ensemble du chapitre.

L’objectif est d’aller progressivement vers un fonctionnement proche d’un petit studio de montage audio spécialisé dans la fiction.


🎚️ Mixage et rendu stéréo

Les différentes voix et pistes peuvent être combinées dans un rendu final.

Lorsque plusieurs voix sont utilisées, le système peut conserver leur placement stéréo.

Le rendu final d’une scène peut ensuite être exporté en WAV.

Une conversion en MP3 est également disponible lorsque FFmpeg est installé ou fourni avec l’environnement utilisé.


📚 Produire un livre audio complet

IA-VoiceDub ne s’arrête pas à la production d’un seul chapitre.

Les chapitres déjà finalisés peuvent être ordonnés dans une section dédiée à la production du livre audio.

L’application peut ensuite :

assembler les chapitres, insérer une pause définie entre eux, harmoniser légèrement leurs niveaux sonores et produire un fichier audio complet.

Le résultat principal est généré en WAV.

Une version MP3 peut également être créée lorsque FFmpeg est disponible.

Autrement dit, le projet peut aujourd’hui aller de quelques enregistrements de référence jusqu’à l’assemblage d’un livre audio complet.


💾 Sauvegarder entièrement un projet de fiction

Les projets Studio Fiction peuvent être exportés dans une archive portable dédiée.

Cette sauvegarde peut contenir les informations du projet, les chapitres, les prises encore disponibles, les rendus finaux, les sons réellement utilisés ainsi que les VoicePacks nécessaires au narrateur et aux personnages.

Les enregistrements vocaux bruts utilisés à l’origine pour construire les profils ne sont pas inclus.

Lors de la restauration, l’application peut réutiliser les profils déjà présents ou reconstruire les profils manquants à partir des VoicePacks contenus dans la sauvegarde.

L’objectif est de pouvoir transporter ou archiver un projet complexe sans écraser les données déjà présentes sur la machine.


🕘 Historique et réutilisation des réglages

Les générations réalisées peuvent être conservées dans un historique local.

Celui-ci permet de retrouver une production, de la réécouter, de récupérer ses paramètres ou de relancer une génération à partir de réglages précédents.

Un système de nettoyage limite également l’accumulation inutile de fichiers tout en protégeant les sons encore utilisés dans les scènes, chapitres et projets actifs.


🔒 Une architecture pensée pour fonctionner localement

IA-VoiceDub est conçu avant tout comme une application locale.

Les profils vocaux, enregistrements, projets, historiques et fichiers audio restent par défaut sur la machine de l’utilisateur.

Le moteur XTTS peut également être préparé localement pour permettre un fonctionnement hors ligne.

Cette approche permet notamment de conserver les données vocales et les projets personnels en dehors d’un service cloud externe.


🪟 Préparation d’une version Windows autonome

Le projet dispose aujourd’hui d’un travail spécifique pour Windows.

Il peut être préparé sous la forme d’une version portable intégrant son environnement de fonctionnement et son moteur vocal local.

Une procédure de construction d’un installateur MSI est également prévue.

Le système peut embarquer localement XTTS et FFmpeg afin de réduire la dépendance à une connexion Internet pour l’utilisation quotidienne.


🍎 Compatibilité macOS en cours de préparation

Une adaptation spécifique à macOS est également en cours.

IA-VoiceDub dispose d’un environnement Python séparé pour Mac ainsi que d’une détection d’Apple Metal / MPS sur les machines Apple Silicon.

Lorsque le moteur rencontre une opération incompatible avec MPS, un retour automatique vers le processeur peut être utilisé.

La version actuelle prépare cette compatibilité et permet des tests directement sur macOS.

Le packaging final en application .app ou .dmg n’est cependant pas encore terminé.

Je garderais cette précision sur la page : elle montre le travail multiplateforme sans prétendre que la version Mac est déjà finalisée.


☀️🌙 Une interface adaptée à l’utilisation quotidienne

L’interface propose désormais plusieurs thèmes :

Jour • Nuit • Auto

Le mode automatique suit les préférences du système.

Le choix est mémorisé localement.

Un travail spécifique a également été réalisé sur la lisibilité de l’interface sous Safari et macOS, notamment en mode sombre.


🧠 Un projet qui mélange IA, développement et création

IA-VoiceDub est intéressant pour moi parce qu’il réunit plusieurs domaines dans une seule application.

Il m’a permis de travailler autour de la synthèse vocale, des modèles d’intelligence artificielle, du traitement audio, de la conception d’interfaces, de la gestion de données locales, de la sauvegarde de projets complexes, du multilingue, du packaging logiciel et de la création d’outils adaptés à des usages très spécifiques.

Il constitue également un terrain d’expérimentation autour d’une question simple :

jusqu’où peut-on transformer un moteur de synthèse vocale en véritable environnement de création audio ?

Au fil de son développement, IA-VoiceDub est ainsi passé d’un générateur vocal multilingue à un studio capable de gérer des voix, des personnages, des scènes, des chapitres et des productions audio complètes.


🧪 Statut du projet

Projet personnel et expérimental

IA-VoiceDub n’est actuellement :

ni commercialisé, ni proposé au téléchargement public, ni distribué en open source.

Cette fiche est publiée dans mon portfolio afin de présenter le projet, son évolution et les compétences techniques mobilisées pour sa conception.

Le projet peut continuer à évoluer au fil de mes expérimentations et de mes besoins personnels.


🔙 Découvrir mes autres projets

← Retour au portfolio