VoxForge  ·  macOS  ·  Validation de la version

Votre voix.
Votre machine.
Vos règles.

Transcrivez l'audio et la vidéo, modifiez la forme d'onde et générez de la parole avec des modèles qui s'exécutent sur votre Mac. Les modèles se téléchargent lorsque vous les choisissez ; les projets restent dans le stockage de l'application locale.

macOS 14 Sonoma ou version ultérieure  ·  Apple Silicon recommandé  ·  Conditions publiques en attente

VoxForge macOS interface : forme d'onde interactive synchronisée avec une transcription affichant le haut-parleur 1 et le haut-parleur 2, le sélecteur de voix TTS et la barre latérale du projet

En un coup d'œil

Qu'est-ce que VoxForge?

VoxForge est un espace de travail natif Mac pour la synthèse vocale locale, l'édition de transcriptions synchronisées par forme d'onde et la synthèse vocale. Il télécharge les modèles choisis par l'utilisateur, puis transcrit et synthétise la parole localement dans le flux de travail documenté.

Plateforme
macOS 14 Sonoma ou version ultérieure ; Apple silicium recommandé
Idéal pour
Transcription privée, travail de sous-titres, édition de transcription et narration locale
Traitement
La transcription et la synthèse vocale utilisent des technologies locales modèles
Disponibilité
Validation de la version ; Version publique et conditions commerciales en attente

Les faits sur le produit ont été examinés par rapport au référentiel d'application actuel le . Voir la méthode de vérification et la politique de correction.

99
Langues transcrites
12+
Moteurs TTS locaux
Local
Traitement de la parole
RC
État de sortie

Une application native Mac pour la transcription et la parole — entièrement hors ligne.

VoxForge est une application native macOS qui unifie la parole en texte (STT), texte en parole (TTS) et la transcription multimédia dans un seul outil qui s'exécute entièrement sur votre Mac. La transcription est alimentée par WhisperKit — Apple-Whisper optimisé pour Silicon qui couvre 99 langues, produit horodatages au niveau des mots et étiquettes qui parle avec SpeakerKit diarisation. Pour la sortie vocale, VoxForge fournit plus d'une douzaine de moteurs TTS locaux — y compris Qwen3-TTS, Kokoro-82M et Piper — pour que vous puissiez lire n'importe quel texte ou transcription à haute voix avec des voix naturelles et multilingues.

VoxForge regroupe la transcription, l'édition synchronisée par forme d'onde, la génération vocale locale, une bibliothèque de projets consultable, le traitement par lots, l'exportation de sous-titres et un éditeur d'histoire multipiste dans une seule application Mac. Les modèles vocaux s'exécutent localement, tandis que les téléchargements de modèles sélectionnés et la récupération explicite de médias utilisent le réseau. Le référentiel actuel n'a pas de compte ni d'analyse VoxForge. VoxForge est construit par HighRoad Software et est en cours de validation de version.

Écrans de produits réels

Transcrivez, modifiez et parlez à partir de la même application Mac.

L'éditeur de transcription, le studio vocal et l'espace de travail de narration ci-dessous proviennent de la version actuelle de VoxForge.

VoxForge éditeur de transcription synchronisé avec la forme d'onde
Modifiez une transcription tout en restant ancré à la forme d'onde.
VoxForge studio vocal
Choisissez une voix locale et prévisualisez-la avant le rendu.
VoxForge espace de travail du projet de narration
Créez des projets de narration plus longs sans exporter entre les outils.

Tout ce qui est vocal, sur une seule machine

Transcription de qualité production et synthèse vocale naturelle, conçues pour être natives de macOS et pour fonctionner sans connexion réseau.

01 — Parole en texte

Transcrivez n'importe quoi, dans 99 langues

Faites glisser un fichier audio ou vidéo — ou transcrivez en direct depuis votre microphone — et VoxForge crée une transcription avec des horodatages au niveau des mots à l'aide d'un modèle WhisperKit local sélectionné. La précision dépend du modèle, de la langue, de la qualité de l'enregistrement, des locuteurs et du domaine ; aucun taux universel d'erreur de mot n'est revendiqué.

  • Détectez automatiquement la langue ou choisissez parmi 99, avec traduction facultative en anglais
  • La diarisation du locuteur étiquette chaque voix (SpeakerKit / Pyannote v4)
  • Choisissez la taille du modèle de minuscule à grande-v3 pour correspondre à votre RAM de Mac
  • Transcription en streaming en direct et files d'attente par lots pour des dossiers entiers
02 — Synthèse vocale

Douze moteurs vocaux locaux, à votre choix

Tapez ou collez texte et VoxForge le prononce avec des voix naturelles – pas de TTS cloud, pas de facturation par personnage. Parcourez les moteurs par qualité, taille et langue, prévisualisez avant le téléchargement et diffusez la lecture pour entendre les premiers mots presque instantanément.

  • Qwen3-TTS (10 langues, contrôle d'émotion/style en option)
  • Kokoro-82M — modèle vocal local compact ; vérifiez la taille actuelle du modèle et la prise en charge des langues dans la version
  • Piper — des centaines de voix dans plus de 20 langues
  • Lisez à haute voix toute transcription pour une relecture mains libres
03 — Édition et amp; exporter

Édition synchronisée avec la forme d'onde, style Descript

Cliquez sur la forme d'onde pour accéder à la transcription ; cliquez sur la transcription pour nettoyer l'audio. Renommez les intervenants, corrigez les mots en ligne, puis exportez-les selon les besoins de votre flux de travail. Un éditeur d'histoire multipiste vous permet d'assembler une narration et des clips dans une pièce finie.

  • Exporter TXT, SRT, VTT, JSON, CSV, DOCX et PDF
  • Résumés de transcription et traduction, générés sur l'appareil
  • Gravure des sous-titres et multipiste chronologie
  • Bibliothèque de projet avec recherche en texte intégral dans tout

De l'enregistrement au résultat en trois étapes

Pas de gymnastique de configuration. Ouvrez l'application, pointez-la vers votre audio et tout s'exécute localement.

1

Importez ou enregistrez

Faites glisser un fichier audio ou vidéo, enregistrez à partir de votre micro ou, dans VoxForge Pro, collez une URL vidéo. Les modèles sont téléchargés une fois lors de la première utilisation et restent mis en cache localement.

2

Transcrivez ou synthétisez

WhisperKit transcrit avec les étiquettes des locuteurs et les horodatages, ou choisissez un moteur TTS pour transformer le texte en parole. Tout fonctionne sur le moteur neuronal et le GPU.

3

Modifier et amp; export

Affinez la transcription par rapport à la forme d'onde, résumez-la ou traduisez-la, puis exportez des sous-titres, des documents ou de l'audio, le tout sans connexion Internet.

Conçu pour les personnes qui ne peuvent pas envoyer d'audio au cloud

🎙️

Podcasteurs et amp; créateurs

Transcrivez des interviews, étiquetez les intervenants, exportez des sous-titres SRT prêts pour YouTube et des narrations vocales B-roll - une application au lieu de quatre.

🔬

Chercheurs

Transcription multilingue précise avec une diarisation fiable, un traitement par lots et des exportations structurées pour une qualité qualitative. analyse.

⚖️

Juridique et amp; médical

Exécutez le traitement vocal localement. Vous restez responsable de l'enregistrement du consentement, de la confidentialité professionnelle, du stockage sécurisé et de tout téléchargement de modèle ou de média que vous lancez.

Utilisateurs d'Accessibilité

Des voix locales de haute qualité lisent les documents à haute voix, avec une prise en charge complète de VoiceOver et une navigation au clavier en premier.

🎓

Les étudiants et les étudiants. journalistes

Transformez les conférences et les interviews en texte consultable et modifiable en quelques minutes, puis relisez-le pour comprendre ce que vous avez manqué.

🌍

Équipes multilingues

99 langues de transcription ainsi que des voix naturelles dans plus de 20 langues de sortie, avec traduction vers l'anglais intégrée.

Discours hors réseau

L'inférence vocale et le stockage de projet sont locaux. Il n'y a pas de compte VoxForge ni de SDK d'analyse dans le référentiel actuel. L'accès au réseau est utilisé pour les modèles que vous choisissez de télécharger, d'acheter ou de validation de licence, le cas échéant, et les médias récupérés uniquement à partir d'une URL que vous fournissez dans la configuration directe.

🔒
Aucune inférence cloud
STT et TTS s'exécutent sur le moteur neuronal et le moteur neuronal Apple. GPU.
🚫
Zéro télémétrie
Aucune analyse, aucun suivi, aucun ping d'utilisation.
👤
Aucun compte
Rien à inscrire. Il suffit d'ouvrir et d'utiliser.
🗄️
Stockage local
Les projets vivent dans le conteneur sandbox de l'application.

STT + TTS en un seul endroit – enfin

VoxForge rassemble la transcription et la génération vocale dans un seul espace de travail Mac local. Les capacités des concurrents et les conditions commerciales peuvent changer, alors vérifiez-les directement avant de choisir.

Capacité VoxForge MacWhisper Speechify Description
Speechify
Texte en parole
Diarisation des locuteursPartiel
Édition synchronisée avec la forme d'onde
Inférence vocale localeVérifier le fournisseurVérifier le fournisseur
Fonctionne hors ligne
Conditions commercialesPublication en attenteVérifier le fournisseurVérifier le fournisseurVérifier le fournisseur
Aucun compte requis

Comparaison révisée 14 juillet 2026. Vérifiez les capacités et les conditions actuelles sur la page produit officielle de chaque fournisseur. Les noms de produits sont des marques commerciales de leurs propriétaires respectifs.

Canaux de sortie en validation

Le référentiel contient des configurations de magasin et de construction directe. Les prix publics et les liens d'achat n'apparaîtront qu'une fois ces points de terminaison mis en ligne.

Création du magasin
En attente version
Configuration en bac à sable
  • Speech-to-text en 99 langues
  • Diarisation des locuteurs et amp; horodatages
  • Plus de 12 moteurs de synthèse vocale locaux
  • Édition de transcription synchronisée avec la forme d'onde
  • Importer l'audio et l'amp; fichiers vidéo
  • Sous-titres, documents et amp; exportation audio
  • Bibliothèque de projets avec recherche en texte intégral
Vérifier la disponibilité du magasin
La plus performante
Construction directe
En attente version
ID de développeur signé etamp; notarié
  • Tout dans la configuration du magasin en bac à sable
  • Importation d'URL de vidéo à partir de plus de 1 500 sites
  • Téléchargement et amp; transcription par lots
  • Formats étendus : WebM, MKV, AVI, OGG
  • Demandes de fonctionnalités prioritaires
Vérifier la disponibilité de la construction directe

L'inférence vocale est locale dans les deux configurations. La configuration directe peut récupérer les médias que vous demandez explicitement ; La livraison des modèles et les contrôles d'admissibilité utilisent également le réseau.

Réponses aux questions

Speech-to-text et text-to-speech utilisent des modèles locaux sur le Mac. L'accès au réseau est utilisé pour les modèles que vous choisissez de télécharger, d'acheter ou de valider la licence le cas échéant, les liens d'assistance et la récupération directe des médias uniquement lorsque vous fournissez une URL.

99 langues via WhisperKit — la même couverture que Whisper d'OpenAI — y compris l'anglais, le français, Allemand, espagnol, italien, portugais, arabe, chinois, japonais, coréen, russe et hindi. La langue peut être détectée automatiquement ou définie manuellement, et la parole peut être traduite en anglais pendant la transcription.

Oui. VoxForge effectue la diarisation des locuteurs avec SpeakerKit (basé sur Pyannote v4), séparant et étiquetant automatiquement qui a dit quoi. Vous pouvez renommer les locuteurs et les étiquettes restent synchronisées avec la forme d'onde et les horodatages au niveau des mots afin que vous puissiez accéder à n'importe quel moment de l'audio.

VoxForge combine la transcription, la génération vocale locale, les étiquettes de locuteurs et l'édition synchronisée par forme d'onde dans un seul espace de travail Mac. Les fonctionnalités, les flux de données et les prix des concurrents changent ; vérifiez-les sur leurs pages officielles actuelles.

Le référentiel documente plusieurs moteurs vocaux locaux, notamment les voix système Qwen3-TTS, Kokoro-82M, Piper et Apple. La disponibilité du moteur, la taille du modèle, les langues et les contrôles de style dépendent de la version actuelle et du téléchargement choisi. Prévisualisez une voix sur un texte représentatif avant de la sélectionner pour un projet.

Oui. VoxForge transcrit l'audio et la vidéo avec des horodatages et peut exporter des formats de sous-titres et de documents. La configuration en bac à sable importe des fichiers locaux ; la configuration directe peut également récupérer des médias à partir d'une URL que vous fournissez, sous réserve de la disponibilité de la version et des conditions tierces.

Les conditions commerciales finales ne sont pas encore en vigueur. Tout prix, modèle de renouvellement, fonctionnalités incluses et itinéraire de remboursement seront affichés lors du paiement vérifié avant l'achat.

Le référentiel contient une configuration de Store en bac à sable et une configuration directe qui peut ajouter une récupération d'URL explicite et des formats étendus. La disponibilité finale des chaînes et les limites des fonctionnalités seront confirmées lors de la sortie. L'inférence vocale reste locale dans les deux configurations.

macOS 14 Sonoma ou version ultérieure. Apple Silicon (série M) est fortement recommandé car la transcription et la synthèse s'exécutent sur le Neural Engine et le GPU. Les modèles sont téléchargés une seule fois et mis en cache localement : le modèle Whisper Turbo recommandé et la voix Kokoro sont un petit téléchargement, et vous pouvez choisir des modèles plus légers sur Macs de 8 Go.

Icône de l'application VoxForge

Discours, selon vos conditions

Transcrivez, éditez et synthétisez la parole avec des modèles locaux. La version publique est toujours en cours de validation.

macOS 14+ · Apple Silicon recommandé · Conditions commerciales en attente