Quelqu'un a déjà testé la transcription audio en texte pour des enregistrements ?

Questions sur le matériel (Alimentations, Leds, drivers ...)
Questions about hardware (Power supply, Leds, drivers ...)
Répondre
SofiaPearl
Messages : 1
Enregistré le : lun. 13 juil. 2026 11:42

Quelqu'un a déjà testé la transcription audio en texte pour des enregistrements ?

Message par SofiaPearl »

Salut tout le monde, je travaille sur un projet qui mélange un micro branché sur un Arduino Uno et un petit traitement côté PC. L'idée de base c'est d'enregistrer des commandes vocales courtes (démarrer, stop, valider) via le micro, récupérer le flux audio en série, et ensuite côté logiciel faire une transcription audio en texte pour déclencher des actions dans un script Python.
Le truc c'est que j'ai bien la partie acquisition qui tourne à peu près correctement (y'a encore des bruits parasites que j'arrive pas à filtrer proprement, mais c'est un autre problème) et j'ai testé quelques libs Python pour la reconnaissance vocale. Whisper d'OpenAI, notamment, que j'ai installé en local. Les résultats sont honnêtement pas mal pour de l'anglais, mais en français avec des termes techniques ou des mots inventés pour des commandes personnalisées... c'est beaucoup moins fiable. i vous avez des retours d'expérience sur d'autres approches? Est-ce que quelqu'un ici a fait tourner de la transcription audio en texte en temps quasi-réel avec une latence acceptable ? Parce que moi pour l'instant j'ai genre 2 à 3 secondes de délai entre la fin de la commande vocale et le déclenchement de l'action, ce qui est franchement trop long pour quelque chose d'interactif.
J'ai aussi regardé du côté de Vosk qui semble plus léger et tourne offline sans problème, mais je l'ai pas encore vraiment testé sur du matériel contraint.
Jacques
Messages : 335
Enregistré le : dim. 31 oct. 2021 19:37

Re: Quelqu'un a déjà testé la transcription audio en texte pour des enregistrements ?

Message par Jacques »

De mon côté, je travaille avec quelqu’un qui utilise vosk pour de la commande vocale.
C'est assez bluffant, très efficace sans traitement particulier. La latence est limité, de l'ordre d'une seconde.
Pas de souci avec le Français.
louiseravot
Messages : 14
Enregistré le : dim. 27 juil. 2025 14:59

Re: Quelqu'un a déjà testé la transcription audio en texte pour des enregistrements ?

Message par louiseravot »

Ton projet est intéressant, surtout le fait de séparer l’acquisition sur Arduino et le traitement côté PC. Pour ce type d’usage (commandes vocales courtes), je pense que la transcription complète type Whisper n’est peut-être pas forcément la meilleure approche.

Whisper est excellent pour de la transcription générale, mais il est plutôt conçu pour comprendre des phrases longues et son objectif n’est pas vraiment le temps réel. Les quelques secondes de latence que tu observes sont assez normales selon le modèle utilisé et la puissance de la machine.

Pour des commandes fixes comme "démarrer", "stop", "valider", une approche de reconnaissance de mots-clés (keyword spotting) peut être beaucoup plus efficace. Des solutions comme Vosk, PocketSphinx ou même des modèles TensorFlow Lite spécialisés peuvent être intéressantes parce qu’ils travaillent directement sur un petit vocabulaire et peuvent répondre presque instantanément.

Une autre piste serait aussi de faire un petit prétraitement audio avant la reconnaissance : réduction du bruit, normalisation du volume, détection du début/fin de parole (VAD). Souvent les erreurs viennent autant de la qualité du signal que du modèle.

Pour les mots personnalisés ou commandes techniques, certains moteurs permettent aussi d’adapter le vocabulaire ou de faire un modèle spécialisé plutôt que d’espérer qu’un modèle général reconnaisse des mots inventés.

Je serais curieux de savoir quelle configuration tu utilises côté PC (CPU/GPU, modèle Whisper utilisé, fréquence d’échantillonnage du micro), car ça joue énormément sur la latence.
le numérique une nouvelle dimension
Répondre