← Retour aux ressources

Handy — dicter localement dans le champ actif

Handy est une application de dictée locale qui transcrit la voix dans le champ actif, avec plusieurs modèles et un vocabulaire personnalisable.

RESSOURCE / FICHE

Pourquoi on s’en sert

Handy réduit la friction liée à la saisie de textes longs en insérant directement une transcription à l’endroit où se trouve le curseur.

Dans le contexte testé au DDLP Lab, il sert principalement à dicter des prompts pour des outils d’IA, puis à produire de la documentation, des comptes rendus et des journaux de modifications. Il est utile lorsque le texte doit être exploitable directement, sans reformulation ultérieure par un LLM.

L’expérience observée sous Windows montre que des corrections manuelles restent nécessaires, mais qu’elles sont moins fréquentes qu’avec la dictée native de Windows. Cette comparaison correspond à un retour d’usage et non à une mesure générale de performance.

Présentation de l’outil

Handy est une application de bureau pilotée par un raccourci clavier. L’utilisateur place son curseur dans un champ de texte, déclenche l’enregistrement, parle, puis arrête l’enregistrement. Le segment audio est transcrit localement et le résultat est collé dans le champ actif — navigateur, éditeur, messagerie ou autre application acceptant la saisie de texte.

Plusieurs familles de modèles peuvent être téléchargées et sélectionnées, notamment Parakeet, Whisper et Canary. Le choix dépend surtout de l’usage : cherche-t-on un texte très précis, ou simplement un résultat plus fiable que la dictée native de Windows ? Dans le contexte du Lab, Parakeet reste le choix principal, car il est perçu comme à la fois très performant et très rapide.

Une liste de mots personnalisés permet aussi de corriger des noms, du jargon ou des termes techniques régulièrement mal reconnus.

Le post-traitement par IA est optionnel. Dans la configuration décrite ici, il n’est pas activé : le texte inséré correspond donc à la transcription du modèle sélectionné, sans correction ni reformulation par un LLM. Une activation volontaire d’un fournisseur cloud, ou l’utilisation d’un endpoint local compatible, constitue un autre mode à documenter séparément.

Ce qu’il faut vérifier avant usage

Handy est présenté comme une application gratuite et open source, distribuée sous licence MIT. Le projet cible Windows, macOS et Linux ; les paquets et les permissions disponibles doivent être vérifiés sur la page officielle au moment de l’installation.

Les modèles doivent être téléchargés avant leur utilisation et occupent un espace variable sur le disque. Leur vitesse dépend du modèle et du matériel disponible. La documentation indique que Whisper peut utiliser l’accélération GPU (Metal sur macOS, Vulkan sous Windows et Linux), tandis que les autres familles indiquées fonctionnent actuellement sur le processeur.

Dans la configuration présentée ici, Handy est utilisé exclusivement sous Windows et le post-traitement expérimental par IA n’est pas activé. La transcription est donc produite localement par le modèle sélectionné, sans envoi à un fournisseur de LLM. Les modèles, le raccourci et l’accès au microphone restent à contrôler sur la machine réellement utilisée.

Limites à garder en tête

Handy ne transcrit actuellement que l’entrée du microphone. Il ne capture pas directement le son du système, d’une vidéo ou d’un appel.

La transcription n’est pas un sous-titrage continu en temps réel : Handy enregistre d’abord un segment, puis le transcrit lorsqu’il est terminé.

L’ajout de vocabulaire personnalisé repose sur une correction approximative des termes similaires et peut produire des correspondances incorrectes. Une relecture reste nécessaire pour les noms propres, le vocabulaire métier, les nombres et les contenus destinés à être publiés.

Sans post-traitement par IA, Handy ne corrige pas systématiquement la grammaire, la structure ou la mise en forme du texte. Cette absence de reformulation évite toutefois de faire appel à un LLM lorsque la transcription brute est suffisante.

Points encore ouverts

  • Le compromis entre rapidité et qualité se décide selon l’usage : viser une précision maximale ou simplement faire mieux que la dictée Windows.
  • Parakeet est le modèle principalement retenu dans l’usage actuel, pour son bon niveau de performance et sa rapidité perçue.
  • La réduction des corrections par rapport à la dictée Windows repose sur une expérience personnelle, complétée par un petit protocole comparatif dans un éditeur de texte : plusieurs séries de dictées ont été réalisées en changeant de modèle, avec un résultat effectivement meilleur qu’avec Windows.

Sources officielles :