Transcreva.
Dê voz.
Torne-o seu.
Transforme gravações e scripts em transcrições editáveis, clipes de voz clonados e podcasts com várias vozes. Modelos compatíveis são executados em seu Mac depois que você escolhe baixá-los.
macOS 14 Sonoma ou posterior · Apple Silicon recomendado · Termos públicos pendentes

Resumo
O que é VoxForge?
VoxForge é um espaço de trabalho nativo Mac para transcrição local, clonagem de voz de referência, geração de script para fala e produção de podcast multivoz. Modelos de fala e texto compatíveis são executados no Mac após o download.
- Plataforma
- macOS 14 Sonoma ou posterior; Apple silício recomendado
- Melhor para
- Transcrição, clonagem de voz, vídeo narrado e produção de podcast
- Processamento
- Transcrição e síntese de fala usam modelos locais
- Disponibilidade
- Validação de versão; termos comerciais e de compilação pública pendentes
Fatos do produto analisados em relação ao repositório de aplicativos atual em . Consulte o método de verificação e a política de correções.
Um estúdio Mac nativo para transcrições, vozes e podcasts.
VoxForge é um aplicativo macOS nativo para fala para texto, script para fala, clonagem de voz de referência e produção de podcast multivoz. Um modelo WhisperKit local selecionado pode produzir carimbos de data/hora em nível de palavra e rótulos de alto-falante. Modelos instalados compatíveis potencializam a geração de fala, clonagem de voz e elaboração de narração local.
O Podcast Studio atribui vozes linha por linha, organiza diálogos em uma linha do tempo e renderiza o projeto a partir das vozes e modelos selecionados. O processamento de fala e a elaboração de texto com suporte são executados localmente; downloads de modelos, verificações de direitos quando aplicável e busca explícita de mídia de construção direta exigem uma conexão. VoxForge foi criado por HighRoad Software e permanece na validação da versão.
Transcreva, edite e fale no mesmo aplicativo Mac.
O editor de transcrição, o estúdio de voz e o espaço de trabalho de narração abaixo são da versão atual do VoxForge.
Tudo o que é falado, em uma máquina
Ferramentas de transcrição, geração de voz e produção projetadas para um fluxo de trabalho Mac nativo.
Transcreva qualquer coisa, em 99 idiomas
Arraste um arquivo de áudio ou vídeo — ou transcreva ao vivo de seu microfone — e VoxForge cria uma transcrição com carimbos de data/hora em nível de palavra usando um modelo WhisperKit local selecionado. A precisão depende do modelo, idioma, qualidade de gravação, alto-falantes e domínio; nenhuma taxa universal de erro de palavras é reivindicada.
- Detecte automaticamente o idioma ou escolha entre 99, com tradução opcional para o inglês
- A diarização do alto-falante rotula cada voz (SpeakerKit / Pyannote v4)
- Escolha o tamanho do modelo de minúsculo a grande-v3 para corresponder ao seu Mac's RAM
- Transcrição de streaming ao vivo e filas em lote para pastas inteiras
Transforme um script em uma faixa de voz
Digite ou cole texto, escolha um modelo de voz instalado compatível, visualize o resultado e exporte o áudio. A disponibilidade de voz, a cobertura do idioma e os controles de entrega dependem do modelo selecionado.
- Crie e salve um perfil de voz a partir de áudio de referência com um modelo compatível
- Gere um script completo como uma faixa ou atribua vozes linha por linha
- Visualize a fala antes de exportar o áudio de produção
- Leia em voz alta qualquer transcrição para revisão sem usar as mãos
Crie um podcast multivoz em uma linha do tempo
Escreva diálogos, atribua uma voz salva ou integrada a cada personagem, ajuste o tempo e renderize no Podcast Studio. O espaço de trabalho de narração também pode usar um modelo de texto local compatível para esboçar um roteiro a partir de notas de cena antes da geração de voz.
- Exportar TXT, SRT, VTT, JSON, CSV, DOCX e PDF
- Resumos de transcrição, tradução e rascunhos de narração local
- Podcast Studio com atribuição de voz por linha e controles de linha do tempo
- Biblioteca de projetos com pesquisa de texto completo em tudo
Da gravação ao resultado em três etapas
Traga mídia ou um script, escolha os modelos que você precisa, depois molde e exporte o resultado.
Importe ou grave
Arraste um arquivo de áudio ou vídeo, grave do seu microfone ou - no VoxForge Pro - cole um URL de vídeo. Os modelos são baixados uma vez no primeiro uso e permanecem armazenados em cache localmente.
Transcreva ou sintetize
Transcreva com rótulos de alto-falante, gere fala a partir de um script ou crie um perfil de voz a partir de áudio de referência usando um modelo instalado compatível.
Edite e edite seus dados. export
Refine a transcrição, atribua vozes de podcast, ajuste a linha do tempo e exporte legendas, documentos, áudio ou vídeo narrado.
Construído para pessoas que não conseguem enviar áudio para a nuvem
Podcasters e criadores
Transcreva entrevistas, rotule palestrantes, exporte legendas SRT prontas para o YouTube e narração B-roll de voz — um aplicativo em vez de quatro.
Pesquisadores
Transcrição multilíngue precisa com diarização confiável, processamento em lote e exportações estruturadas para qualidade análise.
Legal & médico
Mantenha o processamento de fala no Mac para gravações confidenciais, revisão estruturada e exportações controladas.
Usuários de acessibilidade
Vozes locais de alta qualidade leem documentos em voz alta, com suporte completo para VoiceOver e navegação com teclado.
Alunos e estudantes jornalistas
Transforme palestras e entrevistas em texto pesquisável e editável em minutos e, em seguida, leia-o novamente para descobrir o que você perdeu.
Equipes multilíngues
99 idiomas de transcrição, além de vozes naturais em mais de 20 idiomas de saída, com tradução para o inglês integrada.
Fala fora da rede
O processamento de fala, a elaboração de texto compatível e o armazenamento de projetos são locais. O acesso à rede é usado para modelos que você escolhe baixar, verificações de direitos quando aplicável e mídia obtida apenas de um URL fornecido na configuração direta.
STT + TTS em um só lugar — finalmente
VoxForge traz a transcrição e a geração de fala em um espaço de trabalho local Mac. As capacidades e os termos comerciais do concorrente podem mudar, portanto, verifique-os diretamente antes de escolher.
| Capacidade | VoxForge | MacWhisper | Speechify | Descript |
|---|---|---|---|---|
| Speech-to-text | ✓ | ✓ | — | ✓ |
| Text-to-speech | ✓ | — | ✓ | ✓ |
| Diarização do alto-falante | ✓ | Parcial | — | ✓ |
| Edição sincronizada com forma de onda | ✓ | — | — | ✓ |
| Inferência de fala local | ✓ | ✓ | Verificar fornecedor | Verificar fornecedor |
| Funciona off-line | ✓ | ✓ | — | — |
| Termos comerciais | Lançamento pendente | Verificar fornecedor | Verificar fornecedor | Verificar fornecedor |
| Não é necessária conta | ✓ | ✓ | — | — |
Comparação revisada em 14 de julho de 2026. Verifique os recursos e termos atuais na página oficial do produto de cada fornecedor. Os nomes dos produtos são marcas registradas de seus respectivos proprietários.
Canais de lançamento em validação
O repositório contém configurações de armazenamento e compilação direta. Os preços públicos e os links de compra aparecerão somente depois que esses endpoints estiverem ativos.
- Fala para texto em 99 idiomas
- Diarização e comunicação do alto-falante carimbos de data/hora
- Clonagem de script para fala e voz de referência
- Estúdio de podcast multivoz e elaboração de narração local
- Edição de transcrição sincronizada com forma de onda
- Importar áudio e áudio locais arquivos de vídeo
- Legenda, documento e exportação de áudio
- Biblioteca de projetos com pesquisa de texto completo
- Tudo na configuração da loja em sandbox
- Importação de URL de vídeo de mais de 1.500 sites
- Download e download de playlists transcrição em lote
- Formatos estendidos: WebM, MKV, AVI, OGG
- Solicitações de recursos prioritários
A inferência de fala é local em ambas as configurações. A configuração direta pode buscar mídia solicitada explicitamente; a entrega do modelo e as verificações de direitos também usam a rede.
Perguntas respondidas
A fala para texto e a conversão de texto para fala usam modelos locais no Mac. O acesso à rede é usado para modelos que você escolhe baixar, comprar ou validar licença quando aplicável, links de suporte e busca direta de mídia somente quando você fornece um URL.
99 idiomas via WhisperKit — a mesma cobertura do Whisper da OpenAI — incluindo inglês, francês, Alemão, Espanhol, Italiano, Português, Árabe, Chinês, Japonês, Coreano, Russo e Hindi. O idioma pode ser detectado automaticamente ou definido manualmente, e a fala pode ser traduzida para o inglês durante a transcrição.
Sim. VoxForge realiza diarização de alto-falante com SpeakerKit (baseado em Pyannote v4), separando e rotulando automaticamente quem disse o quê. Você pode renomear os alto-falantes e os rótulos permanecem sincronizados com a forma de onda e os carimbos de data e hora no nível da palavra para que você possa pular para qualquer momento do áudio.
VoxForge combina transcrição, geração de fala local, rótulos de alto-falante e edição sincronizada de forma de onda em um espaço de trabalho Mac. Características do concorrente, fluxos de dados e mudanças de preços; verifique-os em suas páginas oficiais atuais.
VoxForge lista opções de voz integradas e para download no aplicativo. A disponibilidade de voz, o tamanho do modelo, a cobertura do idioma e os controles de entrega dependem da construção atual e do modelo selecionado. Visualize o texto representativo antes de se comprometer com um projeto.
Sim. VoxForge transcreve áudio e vídeo com carimbos de data e hora e pode exportar legendas e formatos de documentos. A configuração em área restrita importa arquivos locais; a configuração direta também pode buscar mídia de um URL fornecido por você, sujeito à disponibilidade de lançamento e aos termos de terceiros.
Os termos comerciais finais ainda não estão ativos. Qualquer preço, modelo de renovação, recursos incluídos e rota de reembolso serão mostrados na finalização da compra verificada antes da compra.
O repositório contém uma configuração da Loja em sandbox e uma configuração direta que pode adicionar busca explícita de URL e formatos estendidos. A disponibilidade final do canal e os limites dos recursos serão confirmados no lançamento. A inferência de fala permanece local em ambas as configurações.
macOS 14 Sonoma ou posterior em um Apple Silicon Mac. As necessidades de armazenamento e memória variam de acordo com os modelos de fala e texto que você escolhe instalar.