VoxForge  ·  macOS  ·  Validación de versión

Tu voz.
Tu máquina.
Tus reglas.

Transcribe audio y vídeo, edita según la forma de onda y genera voz con modelos que se ejecutan en tu Mac. Los modelos se descargan cuando tú los eliges; los proyectos permanecen en el almacenamiento de la aplicación local.

macOS 14 Sonoma o posterior  ·  Apple Silicon recomendado  ·  Términos públicos pendientes

Interfaz VoxForge macOS: forma de onda interactiva sincronizada con una transcripción que muestra las etiquetas Altavoz 1 y Altavoz 2, selector de voz TTS y barra lateral del proyecto

De un vistazo

Qué es VoxForge?

VoxForge es un espacio de trabajo nativo Mac para conversión de voz a texto local, edición de transcripciones sincronizada con formas de onda y conversión de texto a voz. Descarga los modelos que el usuario elige, luego transcribe y sintetiza la voz localmente en el flujo de trabajo documentado.

Plataforma
macOS 14 Sonoma o posterior; Apple silicio recomendado
Mejor para
Transcripción privada, trabajo de subtítulos, edición de transcripciones y narración local
Procesamiento
La transcripción y la síntesis de voz utilizan modelos locales
Disponibilidad
Validación de versión; Términos comerciales y de compilación públicos pendientes

Datos del producto revisados en el repositorio de aplicaciones actual el . Consulte el método de verificación y la política de correcciones.

99
Idiomas transcritos
12+
Motores TTS locales
Local
Procesamiento de voz
RC
Estado de versión

Una aplicación Mac nativa para transcripción y voz, completamente fuera de línea.

VoxForge es una aplicación nativa macOS que unifica voz a texto (STT), texto a voz (TTS) y la transcripción multimedia en una única herramienta que se ejecuta completamente en su Mac. La transcripción funciona con WhisperKit: Apple-Silicon-optimized Whisper que cubre 99 idiomas y produce marcas de tiempo a nivel de palabra y etiquetas de quién habla con SpeakerKit diarización. Para salida de voz, VoxForge envía más de una docena de motores TTS locales, incluidos Qwen3-TTS, Kokoro-82M y Piper, para que puedas leer cualquier texto o transcripción en voz alta con voces naturales y multilingües.

VoxForge ofrece transcripción, edición sincronizada con formas de onda, generación de voz local, una biblioteca de proyectos con capacidad de búsqueda, procesamiento por lotes, exportación de subtítulos y un editor de historias multipista en una sola aplicación Mac. Los modelos de voz se ejecutan localmente, mientras que las descargas de modelos seleccionados y la búsqueda de medios explícitos utilizan la red. El repositorio actual no tiene cuenta VoxForge ni análisis. VoxForge está construido por HighRoad Software y está en validación de versión.

Pantallas de productos reales

Transcribe, edita y habla desde la misma aplicación Mac.

El editor de transcripciones, el estudio de voz y el espacio de trabajo de narración que aparecen a continuación pertenecen a la compilación VoxForge actual.

VoxForge editor de transcripciones sincronizado con forma de onda
Edite una transcripción mientras permanece anclado a la forma de onda.
VoxForge estudio de voz
Elija una voz local y obtenga una vista previa de ella antes de renderizarla.
VoxForge espacio de trabajo del proyecto de narración
Cree proyectos de narración más largos sin exportar entre herramientas.

Todo tipo de voz, en una sola máquina

Transcripción de nivel de producción y síntesis de voz natural, diseñadas para sentirse nativas de macOS y trabajar sin conexión de red.

01 — Voz a texto

Transcribe cualquier cosa, en 99 idiomas

Arrastra un archivo de audio o vídeo, o transcribe en vivo desde tu micrófono, y VoxForge crea una transcripción con marcas de tiempo a nivel de palabra utilizando un WhisperKit local seleccionado. modelo. La precisión depende del modelo, idioma, calidad de grabación, hablantes y dominio; no se afirma ninguna tasa universal de error de palabra.

  • Detección automática de idioma o elección entre 99, con traducción opcional al inglés
  • La diarioización del hablante etiqueta cada voz (SpeakerKit / Pyannote v4)
  • Elija el tamaño del modelo desde pequeño hasta grande-v3 para que coincida con la RAM de su Mac
  • Transmisión en vivo de transcripción y colas por lotes para carpetas enteras
02 — Texto a voz

Doce motores de voz locales, usted elige

Escriba o pegue texto y VoxForge lo pronunciará con voz natural: sin TTS en la nube ni facturación por carácter. Explore los motores por calidad, tamaño e idioma, obtenga una vista previa antes de descargar y reproduzca en streaming para escuchar las primeras palabras casi al instante.

  • Qwen3-TTS (10 idiomas, control opcional de emoción/estilo)
  • Kokoro-82M: modelo de voz local compacto; verifique el tamaño del modelo actual y la compatibilidad con idiomas en la compilación
  • Piper: cientos de voces en más de 20 idiomas
  • Lea en voz alta cualquier transcripción para realizar una revisión con manos libres
03: edición y edición. exportar

Edición sincronizada con forma de onda, estilo Descript

Haga clic en la forma de onda para saltar la transcripción; haga clic en la transcripción para borrar el audio. Cambie el nombre de los oradores, corrija palabras en línea y luego exporte a lo que su flujo de trabajo necesite. Un editor de historias multipista te permite unir narraciones y clips en una pieza terminada.

  • Exporta TXT, SRT, VTT, JSON, CSV, DOCX y PDF
  • Resúmenes de transcripciones y traducción, generados en el dispositivo
  • Subtítulos grabados y multipista línea de tiempo
  • Biblioteca de proyectos con búsqueda de texto completo en todo

Desde la grabación hasta el resultado en tres pasos

Sin gimnasia de preparación. Abra la aplicación, apunte a su audio y todo se ejecutará localmente.

1

Importe o grabe

Arrastre un archivo de audio o video, grabe desde su micrófono o, en VoxForge Pro, pegue la URL de un video. Los modelos se descargan una vez en el primer uso y permanecen almacenados en caché localmente.

2

Transcribe o sintetiza

WhisperKit transcribe con etiquetas de orador y marcas de tiempo, o elige un motor TTS para convertir texto en voz. Todo se ejecuta en Neural Engine y GPU.

3

Editar y actualizar. export

Refine la transcripción según la forma de onda, resúmala o tradúzcala, luego exporte subtítulos, documentos o audio, todo sin una conexión a Internet.

Creado para personas que no pueden enviar audio al nube

🎙️

Podcasters & creadores

Transcribe entrevistas, etiqueta a oradores, exporta subtítulos SRT listos para YouTube y narraciones de voz B-roll: una aplicación en lugar de cuatro.

🔬

Investigadores

Transcripción multilingüe precisa con diarios confiables, procesamiento por lotes y exportaciones estructuradas para fines cualitativos análisis.

⚖️

Legal & médico

Ejecute el procesamiento de voz localmente. Usted sigue siendo responsable de registrar el consentimiento, la confidencialidad profesional, el almacenamiento seguro y cualquier descarga de modelos o medios que inicie.

Usuarios de accesibilidad

Voces locales de alta calidad que leen documentos en voz alta, con compatibilidad total con VoiceOver y navegación mediante teclado.

🎓

Estudiantes y estudiantes. periodistas

Convierta conferencias y entrevistas en texto editable y con capacidad de búsqueda en minutos, luego vuelva a leerlo para captar lo que se perdió.

🌍

Equipos multilingües

99 idiomas de transcripción más voces naturales en más de 20 idiomas de salida, con traducción al inglés incorporada.

Voz fuera de la red

La inferencia de voz y el almacenamiento de proyectos son locales. No hay ninguna cuenta VoxForge ni SDK de análisis en el repositorio actual. El acceso a la red se utiliza para los modelos que usted elige descargar, comprar o validar la licencia cuando corresponda, y los medios se obtienen solo desde una URL que usted proporciona en la configuración directa.

🔒
Sin inferencia en la nube
STT y TTS se ejecutan en Apple Neural Engine & GPU.
🚫
Telemetría cero
Sin análisis, sin seguimiento, sin pings de uso.
👤
Sin cuenta
No hay nada para registrarse. Simplemente ábrelo y úsalo.
🗄️
Almacenamiento local
Los proyectos se encuentran en el contenedor aislado de la aplicación.

STT + TTS en un solo lugar: finalmente

VoxForge trae la transcripción y la generación de voz a un espacio de trabajo local Mac. Las capacidades y los términos comerciales de la competencia pueden cambiar, así que verifíquelos directamente antes de elegir.

Capacidad VoxForge MacWhisper Speechify Descript
Voz a texto
Texto a voz
Diarización del hablanteParcial
Edición sincronizada con forma de onda
Inferencia de voz localConsultar proveedorConsultar proveedor
Funciona sin conexión
Términos comercialesPendiente de publicaciónVerificar proveedorVerificar proveedorVerificar proveedor
No se requiere cuenta

Comparación revisada 14 de julio de 2026. Verifique las capacidades y los términos actuales en la página oficial del producto de cada proveedor. Los nombres de los productos son marcas comerciales de sus respectivos propietarios.

Canales de lanzamiento en validación

El repositorio contiene configuraciones de tienda y de compilación directa. Los precios públicos y los enlaces de compra aparecerán solo después de que esos puntos finales estén activos.

Construcción de la tienda
Pendiente lanzamiento
Configuración en espacio aislado
  • Voz a texto en 99 idiomas
  • Diarización y seguimiento del hablante. marcas de tiempo
  • Más de 12 motores locales de conversión de texto a voz
  • Edición de transcripciones sincronizadas con formas de onda
  • Importar audio y formato local. archivos de vídeo
  • Subtítulos, documentos y archivos. exportación de audio
  • Biblioteca de proyectos con búsqueda de texto completo
Consultar disponibilidad de la tienda
Más capaz
Construcción directa
Pendiente lanzamiento
ID de desarrollador firmado y firmado. certificado ante notario
  • Todo en la configuración de la tienda en espacio aislado
  • Importación de URL de vídeo desde más de 1500 sitios
  • Descarga y descarga de listas de reproducción. transcripción por lotes
  • Formatos extendidos: WebM, MKV, AVI, OGG
  • Solicitudes de funciones prioritarias
Verifique la disponibilidad de compilación directa

La inferencia de voz es local en ambas configuraciones. La configuración directa puede recuperar los medios que usted solicite explícitamente; la entrega de modelos y las verificaciones de derechos también utilizan la red.

Preguntas respondidas

Voz a texto y texto a voz utilizan modelos locales en Mac. El acceso a la red se utiliza para los modelos que usted elige descargar, comprar o validar la licencia cuando corresponda, enlaces de soporte y recuperación directa de medios solo cuando proporciona una URL.

99 idiomas a través de WhisperKit, la misma cobertura que Whisper de OpenAI, incluidos inglés, francés, Alemán, español, italiano, portugués, árabe, chino, japonés, coreano, ruso e hindi. El idioma se puede detectar automáticamente o configurar manualmente, y la voz se puede traducir al inglés durante la transcripción.

Sí. VoxForge realiza un diario de los hablantes con SpeakerKit (basado en Pyannote v4), separando y etiquetando automáticamente quién dijo qué. Puede cambiar el nombre de los oradores y las etiquetas permanecen sincronizadas con la forma de onda y las marcas de tiempo a nivel de palabra para que pueda saltar a cualquier momento del audio.

VoxForge combina transcripción, generación de voz local, etiquetas de oradores y edición sincronizada con formas de onda en un espacio de trabajo Mac. Las características, los flujos de datos y los precios de la competencia cambian; verifíquelos en sus páginas oficiales actuales.

El repositorio documenta múltiples motores de voz locales, incluidos Qwen3-TTS, Kokoro-82M, Piper y Apple voces del sistema. La disponibilidad del motor, el tamaño del modelo, los idiomas y los controles de estilo dependen de la versión actual y de la descarga elegida. Obtenga una vista previa de una voz en un texto representativo antes de seleccionarla para un proyecto.

Sí. VoxForge transcribe audio y video con marcas de tiempo y puede exportar formatos de documentos y subtítulos. La configuración de espacio aislado importa archivos locales; la configuración directa también puede obtener medios de una URL que usted proporcione, sujeto a la disponibilidad de la versión y a los términos de terceros.

Los términos comerciales finales aún no están disponibles. Cualquier precio, modelo de renovación, funciones incluidas y ruta de reembolso se mostrarán en el proceso de pago verificado antes de la compra.

El repositorio contiene una configuración de Tienda en espacio aislado y una configuración directa que puede agregar búsqueda de URL explícita y formatos extendidos. La disponibilidad final del canal y los límites de las funciones se confirmarán en el momento del lanzamiento. La inferencia de voz permanece local en ambas configuraciones.

macOS 14 Sonoma o posterior. Se recomienda encarecidamente Apple Silicon (serie M) porque la transcripción y la síntesis se ejecutan en Neural Engine y GPU. Los modelos se descargan una vez y se almacenan en caché localmente: el modelo Whisper Turbo recomendado y la voz Kokoro son una descarga pequeña, y puede elegir modelos más livianos en Macs de 8 GB.

VoxForge ícono de aplicación

Voz, según sus términos

Transcriba, edite y sintetice voz con modelos locales. La compilación pública aún se encuentra en fase de validación de lanzamiento.

macOS 14+ · Apple Silicon recomendado · Términos comerciales pendientes