Votre voix.
Votre machine.
Vos règles.
Transcrivez l'audio et la vidéo, modifiez la forme d'onde et générez de la parole avec des modèles qui s'exécutent sur votre Mac. Les modèles se téléchargent lorsque vous les choisissez ; les projets restent dans le stockage de l'application locale.
macOS 14 Sonoma ou version ultérieure · Apple Silicon recommandé · Conditions publiques en attente
En un coup d'œil
Qu'est-ce que VoxForge?
VoxForge est un espace de travail natif Mac pour la synthèse vocale locale, l'édition de transcriptions synchronisées par forme d'onde et la synthèse vocale. Il télécharge les modèles choisis par l'utilisateur, puis transcrit et synthétise la parole localement dans le flux de travail documenté.
- Plateforme
- macOS 14 Sonoma ou version ultérieure ; Apple silicium recommandé
- Idéal pour
- Transcription privée, travail de sous-titres, édition de transcription et narration locale
- Traitement
- La transcription et la synthèse vocale utilisent des technologies locales modèles
- Disponibilité
- Validation de la version ; Version publique et conditions commerciales en attente
Les faits sur le produit ont été examinés par rapport au référentiel d'application actuel le . Voir la méthode de vérification et la politique de correction.
Une application native Mac pour la transcription et la parole — entièrement hors ligne.
VoxForge est une application native macOS qui unifie la parole en texte (STT), texte en parole (TTS) et la transcription multimédia dans un seul outil qui s'exécute entièrement sur votre Mac. La transcription est alimentée par WhisperKit — Apple-Whisper optimisé pour Silicon qui couvre 99 langues, produit horodatages au niveau des mots et étiquettes qui parle avec SpeakerKit diarisation. Pour la sortie vocale, VoxForge fournit plus d'une douzaine de moteurs TTS locaux — y compris Qwen3-TTS, Kokoro-82M et Piper — pour que vous puissiez lire n'importe quel texte ou transcription à haute voix avec des voix naturelles et multilingues.
VoxForge regroupe la transcription, l'édition synchronisée par forme d'onde, la génération vocale locale, une bibliothèque de projets consultable, le traitement par lots, l'exportation de sous-titres et un éditeur d'histoire multipiste dans une seule application Mac. Les modèles vocaux s'exécutent localement, tandis que les téléchargements de modèles sélectionnés et la récupération explicite de médias utilisent le réseau. Le référentiel actuel n'a pas de compte ni d'analyse VoxForge. VoxForge est construit par HighRoad Software et est en cours de validation de version.
Transcrivez, modifiez et parlez à partir de la même application Mac.
L'éditeur de transcription, le studio vocal et l'espace de travail de narration ci-dessous proviennent de la version actuelle de VoxForge.
Tout ce qui est vocal, sur une seule machine
Transcription de qualité production et synthèse vocale naturelle, conçues pour être natives de macOS et pour fonctionner sans connexion réseau.
Transcrivez n'importe quoi, dans 99 langues
Faites glisser un fichier audio ou vidéo — ou transcrivez en direct depuis votre microphone — et VoxForge crée une transcription avec des horodatages au niveau des mots à l'aide d'un modèle WhisperKit local sélectionné. La précision dépend du modèle, de la langue, de la qualité de l'enregistrement, des locuteurs et du domaine ; aucun taux universel d'erreur de mot n'est revendiqué.
- Détectez automatiquement la langue ou choisissez parmi 99, avec traduction facultative en anglais
- La diarisation du locuteur étiquette chaque voix (SpeakerKit / Pyannote v4)
- Choisissez la taille du modèle de minuscule à grande-v3 pour correspondre à votre RAM de Mac
- Transcription en streaming en direct et files d'attente par lots pour des dossiers entiers
Douze moteurs vocaux locaux, à votre choix
Tapez ou collez texte et VoxForge le prononce avec des voix naturelles – pas de TTS cloud, pas de facturation par personnage. Parcourez les moteurs par qualité, taille et langue, prévisualisez avant le téléchargement et diffusez la lecture pour entendre les premiers mots presque instantanément.
- Qwen3-TTS (10 langues, contrôle d'émotion/style en option)
- Kokoro-82M — modèle vocal local compact ; vérifiez la taille actuelle du modèle et la prise en charge des langues dans la version
- Piper — des centaines de voix dans plus de 20 langues
- Lisez à haute voix toute transcription pour une relecture mains libres
Édition synchronisée avec la forme d'onde, style Descript
Cliquez sur la forme d'onde pour accéder à la transcription ; cliquez sur la transcription pour nettoyer l'audio. Renommez les intervenants, corrigez les mots en ligne, puis exportez-les selon les besoins de votre flux de travail. Un éditeur d'histoire multipiste vous permet d'assembler une narration et des clips dans une pièce finie.
- Exporter TXT, SRT, VTT, JSON, CSV, DOCX et PDF
- Résumés de transcription et traduction, générés sur l'appareil
- Gravure des sous-titres et multipiste chronologie
- Bibliothèque de projet avec recherche en texte intégral dans tout
De l'enregistrement au résultat en trois étapes
Pas de gymnastique de configuration. Ouvrez l'application, pointez-la vers votre audio et tout s'exécute localement.
Importez ou enregistrez
Faites glisser un fichier audio ou vidéo, enregistrez à partir de votre micro ou, dans VoxForge Pro, collez une URL vidéo. Les modèles sont téléchargés une fois lors de la première utilisation et restent mis en cache localement.
Transcrivez ou synthétisez
WhisperKit transcrit avec les étiquettes des locuteurs et les horodatages, ou choisissez un moteur TTS pour transformer le texte en parole. Tout fonctionne sur le moteur neuronal et le GPU.
Modifier et amp; export
Affinez la transcription par rapport à la forme d'onde, résumez-la ou traduisez-la, puis exportez des sous-titres, des documents ou de l'audio, le tout sans connexion Internet.
Conçu pour les personnes qui ne peuvent pas envoyer d'audio au cloud
Podcasteurs et amp; créateurs
Transcrivez des interviews, étiquetez les intervenants, exportez des sous-titres SRT prêts pour YouTube et des narrations vocales B-roll - une application au lieu de quatre.
Chercheurs
Transcription multilingue précise avec une diarisation fiable, un traitement par lots et des exportations structurées pour une qualité qualitative. analyse.
Juridique et amp; médical
Exécutez le traitement vocal localement. Vous restez responsable de l'enregistrement du consentement, de la confidentialité professionnelle, du stockage sécurisé et de tout téléchargement de modèle ou de média que vous lancez.
Utilisateurs d'Accessibilité
Des voix locales de haute qualité lisent les documents à haute voix, avec une prise en charge complète de VoiceOver et une navigation au clavier en premier.
Les étudiants et les étudiants. journalistes
Transformez les conférences et les interviews en texte consultable et modifiable en quelques minutes, puis relisez-le pour comprendre ce que vous avez manqué.
Équipes multilingues
99 langues de transcription ainsi que des voix naturelles dans plus de 20 langues de sortie, avec traduction vers l'anglais intégrée.
Discours hors réseau
L'inférence vocale et le stockage de projet sont locaux. Il n'y a pas de compte VoxForge ni de SDK d'analyse dans le référentiel actuel. L'accès au réseau est utilisé pour les modèles que vous choisissez de télécharger, d'acheter ou de validation de licence, le cas échéant, et les médias récupérés uniquement à partir d'une URL que vous fournissez dans la configuration directe.
STT + TTS en un seul endroit – enfin
VoxForge rassemble la transcription et la génération vocale dans un seul espace de travail Mac local. Les capacités des concurrents et les conditions commerciales peuvent changer, alors vérifiez-les directement avant de choisir.
| Capacité | VoxForge | MacWhisper | Speechify | Description |
|---|---|---|---|---|
| Speechify | ✓ | ✓ | — | ✓ |
| Texte en parole | ✓ | — | ✓ | ✓ |
| Diarisation des locuteurs | ✓ | Partiel | — | ✓ |
| Édition synchronisée avec la forme d'onde | ✓ | — | — | ✓ |
| Inférence vocale locale | ✓ | ✓ | Vérifier le fournisseur | Vérifier le fournisseur |
| Fonctionne hors ligne | ✓ | ✓ | — | — |
| Conditions commerciales | Publication en attente | Vérifier le fournisseur | Vérifier le fournisseur | Vérifier le fournisseur |
| Aucun compte requis | ✓ | ✓ | — | — |
Comparaison révisée 14 juillet 2026. Vérifiez les capacités et les conditions actuelles sur la page produit officielle de chaque fournisseur. Les noms de produits sont des marques commerciales de leurs propriétaires respectifs.
Canaux de sortie en validation
Le référentiel contient des configurations de magasin et de construction directe. Les prix publics et les liens d'achat n'apparaîtront qu'une fois ces points de terminaison mis en ligne.
- Speech-to-text en 99 langues
- Diarisation des locuteurs et amp; horodatages
- Plus de 12 moteurs de synthèse vocale locaux
- Édition de transcription synchronisée avec la forme d'onde
- Importer l'audio et l'amp; fichiers vidéo
- Sous-titres, documents et amp; exportation audio
- Bibliothèque de projets avec recherche en texte intégral
- Tout dans la configuration du magasin en bac à sable
- Importation d'URL de vidéo à partir de plus de 1 500 sites
- Téléchargement et amp; transcription par lots
- Formats étendus : WebM, MKV, AVI, OGG
- Demandes de fonctionnalités prioritaires
L'inférence vocale est locale dans les deux configurations. La configuration directe peut récupérer les médias que vous demandez explicitement ; La livraison des modèles et les contrôles d'admissibilité utilisent également le réseau.
Réponses aux questions
Speech-to-text et text-to-speech utilisent des modèles locaux sur le Mac. L'accès au réseau est utilisé pour les modèles que vous choisissez de télécharger, d'acheter ou de valider la licence le cas échéant, les liens d'assistance et la récupération directe des médias uniquement lorsque vous fournissez une URL.
99 langues via WhisperKit — la même couverture que Whisper d'OpenAI — y compris l'anglais, le français, Allemand, espagnol, italien, portugais, arabe, chinois, japonais, coréen, russe et hindi. La langue peut être détectée automatiquement ou définie manuellement, et la parole peut être traduite en anglais pendant la transcription.
Oui. VoxForge effectue la diarisation des locuteurs avec SpeakerKit (basé sur Pyannote v4), séparant et étiquetant automatiquement qui a dit quoi. Vous pouvez renommer les locuteurs et les étiquettes restent synchronisées avec la forme d'onde et les horodatages au niveau des mots afin que vous puissiez accéder à n'importe quel moment de l'audio.
VoxForge combine la transcription, la génération vocale locale, les étiquettes de locuteurs et l'édition synchronisée par forme d'onde dans un seul espace de travail Mac. Les fonctionnalités, les flux de données et les prix des concurrents changent ; vérifiez-les sur leurs pages officielles actuelles.
Le référentiel documente plusieurs moteurs vocaux locaux, notamment les voix système Qwen3-TTS, Kokoro-82M, Piper et Apple. La disponibilité du moteur, la taille du modèle, les langues et les contrôles de style dépendent de la version actuelle et du téléchargement choisi. Prévisualisez une voix sur un texte représentatif avant de la sélectionner pour un projet.
Oui. VoxForge transcrit l'audio et la vidéo avec des horodatages et peut exporter des formats de sous-titres et de documents. La configuration en bac à sable importe des fichiers locaux ; la configuration directe peut également récupérer des médias à partir d'une URL que vous fournissez, sous réserve de la disponibilité de la version et des conditions tierces.
Les conditions commerciales finales ne sont pas encore en vigueur. Tout prix, modèle de renouvellement, fonctionnalités incluses et itinéraire de remboursement seront affichés lors du paiement vérifié avant l'achat.
Le référentiel contient une configuration de Store en bac à sable et une configuration directe qui peut ajouter une récupération d'URL explicite et des formats étendus. La disponibilité finale des chaînes et les limites des fonctionnalités seront confirmées lors de la sortie. L'inférence vocale reste locale dans les deux configurations.
macOS 14 Sonoma ou version ultérieure. Apple Silicon (série M) est fortement recommandé car la transcription et la synthèse s'exécutent sur le Neural Engine et le GPU. Les modèles sont téléchargés une seule fois et mis en cache localement : le modèle Whisper Turbo recommandé et la voix Kokoro sont un petit téléchargement, et vous pouvez choisir des modèles plus légers sur Macs de 8 Go.