Trascrivilo.
Dai voce.
Rendilo tuo.
Trasforma registrazioni e script in trascrizioni modificabili, clip vocali clonate e podcast a più voci. I modelli compatibili vengono eseguiti sul tuo Mac dopo aver scelto di scaricarli.
macOS 14 Sonoma o successiva · Apple Silicon consigliato · Termini pubblici in sospeso

In sintesi
Che cos'è VoxForge?
VoxForge è uno spazio di lavoro nativo Mac per la trascrizione locale, la clonazione della voce di riferimento, la generazione da script a voce e la produzione di podcast a più voci. I modelli vocali e di testo compatibili vengono eseguiti su Mac dopo il download.
- Piattaforma
- macOS 14 Sonoma o successiva; Apple silicon consigliato
- Ideale per
- Trascrizione, clonazione vocale, produzione di video e podcast narrati
- Elaborazione
- La trascrizione e la sintesi vocale utilizzano modelli locali
- Disponibilità
- Convalida del rilascio; build pubblica e termini commerciali in sospeso
Dati del prodotto esaminati rispetto all'attuale repository di applicazioni il . Consultare il metodo di verifica e la politica di correzione.
Uno Mac studio nativo per trascrizioni, voci e podcast.
VoxForge è un'applicazione nativa macOS per discorso in testo, script-to-speech, fa riferimento alla clonazione vocale e alla produzione di podcast multivoce. Un modello WhisperKit locale selezionato può produrre timestamp a livello di parola ed etichette degli altoparlanti. I modelli installati compatibili consentono la generazione del parlato, la clonazione della voce e la stesura della narrazione locale.
Podcast Studio assegna le voci riga per riga, organizza i dialoghi su una timeline ed esegue il rendering del progetto dalle voci e dai modelli selezionati. L'elaborazione vocale e la stesura del testo supportata vengono eseguite localmente; i download dei modelli, i controlli dei diritti ove applicabile e il recupero esplicito dei media con creazione diretta richiedono una connessione. VoxForge è creato da HighRoad Software e rimane in fase di convalida della versione.
Trascrivi, modifica e parla dalla stessa app Mac.
L'editor di trascrizione, lo studio vocale e l'area di lavoro di narrazione di seguito provengono dalla build VoxForge corrente.
Tutto il parlato, su un'unica macchina
Strumenti di trascrizione, generazione vocale e produzione progettati per un flusso di lavoro nativo Mac.
Trascrivi qualsiasi cosa, in 99 lingue
Trascina un file audio o video o trascrivi dal vivo dal tuo microfono e VoxForge crea una trascrizione con timestamp a livello di parola utilizzando un modello WhisperKit locale selezionato. La precisione dipende dal modello, dalla lingua, dalla qualità della registrazione, dagli altoparlanti e dal dominio; non viene dichiarato alcun tasso universale di errore delle parole.
- Rileva automaticamente la lingua o scegli tra 99, con traduzione opzionale in inglese
- La diarizzazione dell'altoparlante etichetta ogni voce (SpeakerKit / Pyannote v4)
- Scegli la dimensione del modello da piccola a grande-v3 in base alle tue Mac's RAM
- Trascrizione live streaming e code batch per intere cartelle
Trasforma uno script in una traccia vocale
Digita o incolla il testo, scegli un modello vocale installato compatibile, visualizza l'anteprima del risultato ed esporta l'audio. La disponibilità vocale, la copertura linguistica e i controlli di distribuzione dipendono dal modello selezionato.
- Crea e salva un profilo vocale dall'audio di riferimento con un modello compatibile
- Genera uno script completo come traccia unica o assegna voci riga per riga
- Anteprima del discorso prima di esportare l'audio di produzione
- Leggi ad alta voce qualsiasi trascrizione per correzione di bozze a mani libere
Crea un podcast a più voci su una sequenza temporale
Scrivi dialoghi, assegna una voce salvata o incorporata a ciascun personaggio, regola i tempi ed esegui il rendering da Podcast Studio. L'area di lavoro della narrazione può anche utilizzare un modello di testo locale compatibile per redigere una sceneggiatura dalle note della scena prima della generazione della voce.
- Esporta TXT, SRT, VTT, JSON, CSV, DOCX e PDF
- Riepiloghi della trascrizione, traduzione e bozze della narrazione locale
- Podcast Studio con assegnazione vocale per riga e controlli della timeline
- Libreria di progetti con ricerca full-text in tutto
Dalla registrazione al risultato in tre passaggi
Inserisci contenuti multimediali o uno script, scegli i modelli che desideri necessario, quindi modella ed esporta il risultato.
Importa o registra
Trascina un file audio o video, registra dal microfono oppure, in VoxForge Pro, incolla l'URL di un video. I modelli vengono scaricati una volta al primo utilizzo e rimangono memorizzati nella cache locale.
Trascrivi o sintetizza
Trascrivi con le etichette degli altoparlanti, genera parlato da uno script o crea un profilo vocale dall'audio di riferimento utilizzando un modello installato compatibile.
Modifica e amp; esporta
Perfeziona la trascrizione, assegna voci ai podcast, regola la sequenza temporale ed esporta sottotitoli, documenti, audio o video narrati.
Creato per le persone che non possono inviare audio al cloud
Podcaster e amp; creatori
Trascrivi interviste, etichetta relatori, esporta sottotitoli SRT pronti per YouTube e narrazione vocale B-roll: un'app invece di quattro.
Ricercatori
Trascrizione multilingue accurata con diarizzazione affidabile, elaborazione batch ed esportazioni strutturate per analisi qualitative.
Legale e medico
Mantieni l'elaborazione vocale su Mac per registrazioni riservate, revisioni strutturate ed esportazioni controllate.
Accessibilità utenti
Voci locali di alta qualità leggono i documenti ad alta voce, con supporto VoiceOver completo e navigazione tramite tastiera.
Studenti e studenti giornalisti
Trasforma lezioni e interviste in testo ricercabile e modificabile in pochi minuti, quindi rileggilo per cogliere ciò che ti sei perso.
Team multilingue
99 lingue di trascrizione più voci naturali in oltre 20 lingue di output, con traduzione in inglese integrata.
Discorso fuori dagli schemi
L'elaborazione vocale, la redazione del testo supportata e l'archiviazione dei progetti sono locali. L'accesso alla rete viene utilizzato per i modelli che scegli di scaricare, i controlli dei diritti ove applicabile e i contenuti multimediali recuperati solo da un URL fornito nella configurazione diretta.
STT + TTS in un unico posto: finalmente
VoxForge porta la trascrizione e la generazione del parlato in un unico spazio di lavoro Mac local-first. Le funzionalità e i termini commerciali della concorrenza possono cambiare, quindi verificali direttamente prima di scegliere.
| Funzionalità | VoxForge | MacWhisper | Speechify | Descrizione |
|---|---|---|---|---|
| Discorso in testo | ✓ | ✓ | — | ✓ |
| Sintesi vocale | ✓ | — | ✓ | ✓ |
| Diarizzazione dell'altoparlante | ✓ | Parziale | — | ✓ |
| Forma d'onda sincronizzata modifica | ✓ | — | — | ✓ |
| Inferenza vocale locale | ✓ | ✓ | Verifica fornitore | Verifica fornitore |
| Funziona offline | ✓ | ✓ | — | — |
| Termini commerciali | Rilascio in attesa | Controlla il fornitore | Controlla il fornitore | Controlla il fornitore |
| Nessun account richiesto | ✓ | ✓ | — | — |
Confronto esaminato il 14 luglio 2026. Verifica le funzionalità e i termini attuali sulla pagina ufficiale del prodotto di ciascun fornitore. I nomi dei prodotti sono marchi dei rispettivi proprietari.
Canali di rilascio in fase di convalida
Il repository contiene configurazioni Store e di compilazione diretta. I prezzi pubblici e i link di acquisto verranno visualizzati solo dopo che tali endpoint saranno attivi.
- Speech-to-text in 99 lingue
- Diarizzazione e amp; timestamp
- Script-to-speech e clonazione vocale di riferimento
- Podcast Studio multi-voce e redazione di narrazione locale
- Modifica della trascrizione sincronizzata con forma d'onda
- Importa audio locale e amp; file video
- Sottotitoli, documenti e amp; esportazione audio
- Libreria di progetti con ricerca full-text
- Tutto nella configurazione dello Store in modalità sandbox
- Importazione di URL video da oltre 1.500 siti
- Download di playlist e amp; trascrizione batch
- Formati estesi: WebM, MKV, AVI, OGG
- Richieste di funzionalità prioritarie
L'inferenza vocale è locale in entrambe le configurazioni. La configurazione diretta può recuperare i media richiesti esplicitamente; anche la consegna dei modelli e le verifiche dei diritti utilizzano la rete.
Domande e risposte
Speech-to-text e la sintesi vocale utilizza modelli locali su Mac. L'accesso alla rete viene utilizzato per i modelli che scegli di scaricare, acquistare o convalidare la licenza quando applicabile, i link di supporto e il recupero diretto dei media solo quando fornisci un URL.
99 lingue tramite WhisperKit: la stessa copertura di Whisper di OpenAI, tra cui inglese, francese, tedesco, spagnolo, Italiano, portoghese, arabo, cinese, giapponese, coreano, russo e hindi. La lingua può essere rilevata automaticamente o impostata manualmente e il parlato può essere tradotto in inglese durante la trascrizione.
Sì. VoxForge esegue la diarizzazione degli oratori con SpeakerKit (basato su Pyannote v4), separando ed etichettando automaticamente chi ha detto cosa. Puoi rinominare gli altoparlanti e le etichette rimangono sincronizzate con la forma d'onda e i timestamp a livello di parola in modo da poter passare a qualsiasi momento nell'audio.
VoxForge combina trascrizione, generazione vocale locale, etichette degli oratori e modifica sincronizzata con la forma d'onda in un unico spazio di lavoro Mac. Le caratteristiche della concorrenza, i flussi di dati e i prezzi cambiano; verificali sulle pagine ufficiali attuali.
VoxForge elenca le opzioni vocali integrate e scaricabili nell'app. La disponibilità vocale, le dimensioni del modello, la copertura linguistica e i controlli di consegna dipendono dalla build corrente e dal modello selezionato. Visualizza in anteprima il testo rappresentativo prima di impegnarti in un progetto.
Sì. VoxForge trascrive audio e video con timestamp e può esportare formati di sottotitoli e documenti. La configurazione sandbox importa file locali; la configurazione diretta può anche recuperare contenuti multimediali da un URL fornito, soggetto alla disponibilità della versione e ai termini di terze parti.
I termini commerciali finali non sono ancora attivi. Qualsiasi prezzo, modello di rinnovo, funzionalità incluse e percorso di rimborso verranno visualizzati al momento del pagamento verificato prima dell'acquisto.
Il repository contiene una configurazione dello Store in modalità sandbox e una configurazione diretta che può aggiungere il recupero di URL espliciti e formati estesi. La disponibilità finale del canale e i limiti delle funzionalità saranno confermati al momento del rilascio. L'inferenza vocale rimane locale in entrambe le configurazioni.
macOS 14 Sonoma o successivo un Apple Silicon Mac. Le esigenze di archiviazione e memoria variano in base ai modelli vocali e di testo che scegli di installare.