Tu voz.
Tu máquina.
Tus reglas.
Transcribe audio y vídeo, edita según la forma de onda y genera voz con modelos que se ejecutan en tu Mac. Los modelos se descargan cuando tú los eliges; los proyectos permanecen en el almacenamiento de la aplicación local.
macOS 14 Sonoma o posterior · Apple Silicon recomendado · Términos públicos pendientes
De un vistazo
Qué es VoxForge?
VoxForge es un espacio de trabajo nativo Mac para conversión de voz a texto local, edición de transcripciones sincronizada con formas de onda y conversión de texto a voz. Descarga los modelos que el usuario elige, luego transcribe y sintetiza la voz localmente en el flujo de trabajo documentado.
- Plataforma
- macOS 14 Sonoma o posterior; Apple silicio recomendado
- Mejor para
- Transcripción privada, trabajo de subtítulos, edición de transcripciones y narración local
- Procesamiento
- La transcripción y la síntesis de voz utilizan modelos locales
- Disponibilidad
- Validación de versión; Términos comerciales y de compilación públicos pendientes
Datos del producto revisados en el repositorio de aplicaciones actual el . Consulte el método de verificación y la política de correcciones.
Una aplicación Mac nativa para transcripción y voz, completamente fuera de línea.
VoxForge es una aplicación nativa macOS que unifica voz a texto (STT), texto a voz (TTS) y la transcripción multimedia en una única herramienta que se ejecuta completamente en su Mac. La transcripción funciona con WhisperKit: Apple-Silicon-optimized Whisper que cubre 99 idiomas y produce marcas de tiempo a nivel de palabra y etiquetas de quién habla con SpeakerKit diarización. Para salida de voz, VoxForge envía más de una docena de motores TTS locales, incluidos Qwen3-TTS, Kokoro-82M y Piper, para que puedas leer cualquier texto o transcripción en voz alta con voces naturales y multilingües.
VoxForge ofrece transcripción, edición sincronizada con formas de onda, generación de voz local, una biblioteca de proyectos con capacidad de búsqueda, procesamiento por lotes, exportación de subtítulos y un editor de historias multipista en una sola aplicación Mac. Los modelos de voz se ejecutan localmente, mientras que las descargas de modelos seleccionados y la búsqueda de medios explícitos utilizan la red. El repositorio actual no tiene cuenta VoxForge ni análisis. VoxForge está construido por HighRoad Software y está en validación de versión.
Transcribe, edita y habla desde la misma aplicación Mac.
El editor de transcripciones, el estudio de voz y el espacio de trabajo de narración que aparecen a continuación pertenecen a la compilación VoxForge actual.
Todo tipo de voz, en una sola máquina
Transcripción de nivel de producción y síntesis de voz natural, diseñadas para sentirse nativas de macOS y trabajar sin conexión de red.
Transcribe cualquier cosa, en 99 idiomas
Arrastra un archivo de audio o vídeo, o transcribe en vivo desde tu micrófono, y VoxForge crea una transcripción con marcas de tiempo a nivel de palabra utilizando un WhisperKit local seleccionado. modelo. La precisión depende del modelo, idioma, calidad de grabación, hablantes y dominio; no se afirma ninguna tasa universal de error de palabra.
- Detección automática de idioma o elección entre 99, con traducción opcional al inglés
- La diarioización del hablante etiqueta cada voz (SpeakerKit / Pyannote v4)
- Elija el tamaño del modelo desde pequeño hasta grande-v3 para que coincida con la RAM de su Mac
- Transmisión en vivo de transcripción y colas por lotes para carpetas enteras
Doce motores de voz locales, usted elige
Escriba o pegue texto y VoxForge lo pronunciará con voz natural: sin TTS en la nube ni facturación por carácter. Explore los motores por calidad, tamaño e idioma, obtenga una vista previa antes de descargar y reproduzca en streaming para escuchar las primeras palabras casi al instante.
- Qwen3-TTS (10 idiomas, control opcional de emoción/estilo)
- Kokoro-82M: modelo de voz local compacto; verifique el tamaño del modelo actual y la compatibilidad con idiomas en la compilación
- Piper: cientos de voces en más de 20 idiomas
- Lea en voz alta cualquier transcripción para realizar una revisión con manos libres
Edición sincronizada con forma de onda, estilo Descript
Haga clic en la forma de onda para saltar la transcripción; haga clic en la transcripción para borrar el audio. Cambie el nombre de los oradores, corrija palabras en línea y luego exporte a lo que su flujo de trabajo necesite. Un editor de historias multipista te permite unir narraciones y clips en una pieza terminada.
- Exporta TXT, SRT, VTT, JSON, CSV, DOCX y PDF
- Resúmenes de transcripciones y traducción, generados en el dispositivo
- Subtítulos grabados y multipista línea de tiempo
- Biblioteca de proyectos con búsqueda de texto completo en todo
Desde la grabación hasta el resultado en tres pasos
Sin gimnasia de preparación. Abra la aplicación, apunte a su audio y todo se ejecutará localmente.
Importe o grabe
Arrastre un archivo de audio o video, grabe desde su micrófono o, en VoxForge Pro, pegue la URL de un video. Los modelos se descargan una vez en el primer uso y permanecen almacenados en caché localmente.
Transcribe o sintetiza
WhisperKit transcribe con etiquetas de orador y marcas de tiempo, o elige un motor TTS para convertir texto en voz. Todo se ejecuta en Neural Engine y GPU.
Editar y actualizar. export
Refine la transcripción según la forma de onda, resúmala o tradúzcala, luego exporte subtítulos, documentos o audio, todo sin una conexión a Internet.
Creado para personas que no pueden enviar audio al nube
Podcasters & creadores
Transcribe entrevistas, etiqueta a oradores, exporta subtítulos SRT listos para YouTube y narraciones de voz B-roll: una aplicación en lugar de cuatro.
Investigadores
Transcripción multilingüe precisa con diarios confiables, procesamiento por lotes y exportaciones estructuradas para fines cualitativos análisis.
Legal & médico
Ejecute el procesamiento de voz localmente. Usted sigue siendo responsable de registrar el consentimiento, la confidencialidad profesional, el almacenamiento seguro y cualquier descarga de modelos o medios que inicie.
Usuarios de accesibilidad
Voces locales de alta calidad que leen documentos en voz alta, con compatibilidad total con VoiceOver y navegación mediante teclado.
Estudiantes y estudiantes. periodistas
Convierta conferencias y entrevistas en texto editable y con capacidad de búsqueda en minutos, luego vuelva a leerlo para captar lo que se perdió.
Equipos multilingües
99 idiomas de transcripción más voces naturales en más de 20 idiomas de salida, con traducción al inglés incorporada.
Voz fuera de la red
La inferencia de voz y el almacenamiento de proyectos son locales. No hay ninguna cuenta VoxForge ni SDK de análisis en el repositorio actual. El acceso a la red se utiliza para los modelos que usted elige descargar, comprar o validar la licencia cuando corresponda, y los medios se obtienen solo desde una URL que usted proporciona en la configuración directa.
STT + TTS en un solo lugar: finalmente
VoxForge trae la transcripción y la generación de voz a un espacio de trabajo local Mac. Las capacidades y los términos comerciales de la competencia pueden cambiar, así que verifíquelos directamente antes de elegir.
| Capacidad | VoxForge | MacWhisper | Speechify | Descript |
|---|---|---|---|---|
| Voz a texto | ✓ | ✓ | — | ✓ |
| Texto a voz | ✓ | — | ✓ | ✓ |
| Diarización del hablante | ✓ | Parcial | — | ✓ |
| Edición sincronizada con forma de onda | ✓ | — | — | ✓ |
| Inferencia de voz local | ✓ | ✓ | Consultar proveedor | Consultar proveedor |
| Funciona sin conexión | ✓ | ✓ | — | — |
| Términos comerciales | Pendiente de publicación | Verificar proveedor | Verificar proveedor | Verificar proveedor |
| No se requiere cuenta | ✓ | ✓ | — | — |
Comparación revisada 14 de julio de 2026. Verifique las capacidades y los términos actuales en la página oficial del producto de cada proveedor. Los nombres de los productos son marcas comerciales de sus respectivos propietarios.
Canales de lanzamiento en validación
El repositorio contiene configuraciones de tienda y de compilación directa. Los precios públicos y los enlaces de compra aparecerán solo después de que esos puntos finales estén activos.
- Voz a texto en 99 idiomas
- Diarización y seguimiento del hablante. marcas de tiempo
- Más de 12 motores locales de conversión de texto a voz
- Edición de transcripciones sincronizadas con formas de onda
- Importar audio y formato local. archivos de vídeo
- Subtítulos, documentos y archivos. exportación de audio
- Biblioteca de proyectos con búsqueda de texto completo
- Todo en la configuración de la tienda en espacio aislado
- Importación de URL de vídeo desde más de 1500 sitios
- Descarga y descarga de listas de reproducción. transcripción por lotes
- Formatos extendidos: WebM, MKV, AVI, OGG
- Solicitudes de funciones prioritarias
La inferencia de voz es local en ambas configuraciones. La configuración directa puede recuperar los medios que usted solicite explícitamente; la entrega de modelos y las verificaciones de derechos también utilizan la red.
Preguntas respondidas
Voz a texto y texto a voz utilizan modelos locales en Mac. El acceso a la red se utiliza para los modelos que usted elige descargar, comprar o validar la licencia cuando corresponda, enlaces de soporte y recuperación directa de medios solo cuando proporciona una URL.
99 idiomas a través de WhisperKit, la misma cobertura que Whisper de OpenAI, incluidos inglés, francés, Alemán, español, italiano, portugués, árabe, chino, japonés, coreano, ruso e hindi. El idioma se puede detectar automáticamente o configurar manualmente, y la voz se puede traducir al inglés durante la transcripción.
Sí. VoxForge realiza un diario de los hablantes con SpeakerKit (basado en Pyannote v4), separando y etiquetando automáticamente quién dijo qué. Puede cambiar el nombre de los oradores y las etiquetas permanecen sincronizadas con la forma de onda y las marcas de tiempo a nivel de palabra para que pueda saltar a cualquier momento del audio.
VoxForge combina transcripción, generación de voz local, etiquetas de oradores y edición sincronizada con formas de onda en un espacio de trabajo Mac. Las características, los flujos de datos y los precios de la competencia cambian; verifíquelos en sus páginas oficiales actuales.
El repositorio documenta múltiples motores de voz locales, incluidos Qwen3-TTS, Kokoro-82M, Piper y Apple voces del sistema. La disponibilidad del motor, el tamaño del modelo, los idiomas y los controles de estilo dependen de la versión actual y de la descarga elegida. Obtenga una vista previa de una voz en un texto representativo antes de seleccionarla para un proyecto.
Sí. VoxForge transcribe audio y video con marcas de tiempo y puede exportar formatos de documentos y subtítulos. La configuración de espacio aislado importa archivos locales; la configuración directa también puede obtener medios de una URL que usted proporcione, sujeto a la disponibilidad de la versión y a los términos de terceros.
Los términos comerciales finales aún no están disponibles. Cualquier precio, modelo de renovación, funciones incluidas y ruta de reembolso se mostrarán en el proceso de pago verificado antes de la compra.
El repositorio contiene una configuración de Tienda en espacio aislado y una configuración directa que puede agregar búsqueda de URL explícita y formatos extendidos. La disponibilidad final del canal y los límites de las funciones se confirmarán en el momento del lanzamiento. La inferencia de voz permanece local en ambas configuraciones.
macOS 14 Sonoma o posterior. Se recomienda encarecidamente Apple Silicon (serie M) porque la transcripción y la síntesis se ejecutan en Neural Engine y GPU. Los modelos se descargan una vez y se almacenan en caché localmente: el modelo Whisper Turbo recomendado y la voz Kokoro son una descarga pequeña, y puede elegir modelos más livianos en Macs de 8 GB.