VoxForge  ·  macOS  ·  Release-Validierung

Ihre Stimme.
Ihre Maschine.
Ihre Regeln.

Transkribieren Sie Audio und Video, bearbeiten Sie sie anhand der Wellenform und generieren Sie Sprache mit Modellen, die auf Ihrem Mac ausgeführt werden. Modelle werden heruntergeladen, wenn Sie sie auswählen. Projekte bleiben im lokalen App-Speicher.

macOS 14 Sonoma oder höher  ·  Apple Silicon empfohlen  ·  Öffentliche Nutzungsbedingungen ausstehend

VoxForge macOS-Schnittstelle: interaktive Wellenform synchronisiert mit einem Transkript, das die Bezeichnungen „Sprecher 1“ und „Sprecher 2“, die TTS-Sprachauswahl und die Projektseitenleiste zeigt

Auf einen Blick

Was ist VoxForge?

VoxForge ist ein nativer Mac-Arbeitsbereich für lokale Sprache-zu-Text-, wellenformsynchronisierte Transkriptbearbeitung und Text-zu-Sprache. Es lädt vom Benutzer ausgewählte Modelle herunter und transkribiert und synthetisiert dann Sprache lokal im dokumentierten Workflow.

Plattform
macOS 14 Sonoma oder höher; Apple Silizium empfohlen
Am besten geeignet für
Private Transkription, Untertitelarbeit, Transkriptbearbeitung und lokale Erzählung
Verarbeitung
Transkription und Sprachsynthese verwenden lokale Modelle
Verfügbarkeit
Release-Validierung; Öffentliche Build- und kommerzielle Bedingungen ausstehend

Produktfakten anhand des aktuellen Anwendungs-Repositorys überprüft am . Siehe Verifizierungsmethode und Korrekturrichtlinie.

99
Sprachen transkribiert
12+
Lokale TTS-Engines
Lokal
Sprachverarbeitung
RC
Veröffentlichungsstatus

Eine native Mac-App für die Transkription undSprache – vollständig offline.

VoxForge ist eine native macOS-Anwendung, die Speech-to-Text (STT), Text-to-Speech (TTS) und Medientranskription in einem einzigen Tool vereint, das vollständig auf Ihrem läuft Mac. Die Transkription wird durch WhisperKit unterstützt – Apple-Silicon-optimized Whisper, das 99 Sprachen abdeckt, produziert Zeitstempel auf Wortebene und Beschriftungen, wer mit SpeakerKit spricht. Für die Sprachausgabe liefert VoxForge mehr als ein Dutzend lokale TTS-Engines – einschließlich Qwen3-TTS, Kokoro-82M und Piper – damit Sie jeden Text oder jedes Transkript mit natürlichen, mehrsprachigen Stimmen vorlesen können.

VoxForge vereint Transkription, wellenformsynchronisierte Bearbeitung, lokale Sprachgenerierung, eine durchsuchbare Projektbibliothek, Stapelverarbeitung, Untertitelexport und einen mehrspurigen Story-Editor in einer Mac-App. Sprachmodelle werden lokal ausgeführt, während ausgewählte Modelldownloads und der explizite Medienabruf das Netzwerk nutzen. Das aktuelle Repository verfügt über kein VoxForge-Konto oder Analysen. VoxForge wurde von HighRoad Software erstellt und befindet sich in der Release-Validierung.

Echte Produktbildschirme

Transkribieren, bearbeiten und sprechen Sie mit derselben Mac-App.

Der Transkripteditor, das Sprachstudio und der Erzählarbeitsbereich unten stammen aus der aktuellen VoxForge-Version.

VoxForge Wellenform-synchronisierter Transkripteditor
Bearbeiten Sie ein Transkript, während Sie in der Wellenform verankert bleiben.
VoxForge Sprachstudio
Wählen Sie eine lokale Stimme und zeigen Sie sie vor dem Rendern in der Vorschau an.
VoxForge Erzählprojektarbeitsbereich
Erstellen Sie längere Erzählprojekte, ohne zwischen Tools zu exportieren.

Alles Sprache, auf einer Maschine

Transkription in Produktionsqualität und natürliche Sprachsynthese, so konzipiert, dass sie sich wie macOS anfühlt und ohne Netzwerkverbindung funktioniert.

01 – Speech-to-Text

Transkribieren Sie alles in 99 Sprachen

Ziehen Sie eine Audio- oder Videodatei hinein – oder transkribieren Sie live von Ihrem Mikrofon – und VoxForge erstellt mithilfe eines ausgewählten lokalen WhisperKit-Modells ein Transkript mit Zeitstempeln auf Wortebene. Die Genauigkeit hängt vom Modell, der Sprache, der Aufnahmequalität, den Sprechern und der Domäne ab. Es wird keine universelle Wortfehlerrate beansprucht.

  • Sprache automatisch erkennen oder aus 99 auswählen, mit optionaler Übersetzung ins Englische
  • Lautsprecher-Diakarisierung beschriftet jede Stimme (SpeakerKit / Pyannote v4)
  • Wählen Sie die Modellgröße von winzig bis groß-v3 entsprechend Ihrer Mac's RAM
  • Live-Streaming-Transkription und Batch-Warteschlangen für ganze Ordner
02 – Text-to-Speech

Zwölf lokale Sprach-Engines, Ihre Wahl

Text eingeben oder einfügen und VoxForge spricht es mit natürlichen Stimmen – kein Cloud-TTS, keine Abrechnung pro Zeichen. Durchsuchen Sie Engines nach Qualität, Größe und Sprache, zeigen Sie vor dem Herunterladen eine Vorschau an und streamen Sie die Wiedergabe, sodass Sie die ersten Wörter fast sofort hören.

  • Qwen3-TTS (10 Sprachen, optionale Emotions-/Stilsteuerung)
  • Kokoro-82M – kompaktes lokales Sprachmodell; Überprüfen Sie die aktuelle Modellgröße und Sprachunterstützung im Build
  • Piper – Hunderte von Stimmen in mehr als 20 Sprachen
  • Lesen Sie jedes Transkript für freihändiges Korrekturlesen vor
03 – Bearbeiten & exportieren

Wellenform-synchronisierte Bearbeitung, Beschreibungsstil

Klicken Sie auf die Wellenform, um das Transkript zu überspringen; Klicken Sie auf das Transkript, um das Audio zu Scrubben. Benennen Sie Sprecher um, korrigieren Sie Wörter inline und exportieren Sie sie dann entsprechend Ihren Workflow-Anforderungen. Mit einem mehrspurigen Story-Editor können Sie Erzählungen und Clips zu einem fertigen Stück zusammenfügen.

  • Exportieren Sie TXT, SRT, VTT, JSON, CSV, DOCX und PDF
  • Transkriptzusammenfassungen und -übersetzungen, auf dem Gerät generiert
  • Einbrennen von Untertiteln und mehrspurige Zeitleiste
  • Projektbibliothek mit Volltextsuche in allen Bereichen

Von der Aufnahme bis zum Ergebnis in drei Schritten

Keine Setup-Gymnastik. Öffnen Sie die App, richten Sie sie auf Ihr Audio und alles wird lokal ausgeführt.

1

Importieren oder Aufzeichnen

Ziehen Sie eine Audio- oder Videodatei hinein, nehmen Sie von Ihrem Mikrofon auf oder fügen Sie – in VoxForge Pro – eine Video-URL ein. Modelle werden bei der ersten Verwendung einmal heruntergeladen und bleiben lokal zwischengespeichert.

2

Transkribieren oder synthetisieren

WhisperKit transkribiert mit Sprecherbezeichnungen und Zeitstempeln oder wählt eine TTS-Engine aus, um Text in Sprache umzuwandeln. Alles läuft auf der Neural Engine und der GPU.

3

Bearbeiten & exportieren

Verfeinern Sie das Transkript anhand der Wellenform, fassen Sie es zusammen oder übersetzen Sie es und exportieren Sie dann Untertitel, Dokumente oder Audio – alles ohne Internetverbindung.

Entwickelt für Personen, die keine Audiodaten an die Cloud senden können

🎙️

Podcaster & Ersteller

Interviews transkribieren, Sprecher kennzeichnen, YouTube-fähige SRT-Untertitel exportieren und B-Roll-Kommentare vertonen – eine App statt vier.

🔬

Forscher

Genaue mehrsprachige Transkription mit zuverlässiger Tagebuchführung, Stapelverarbeitung und strukturierten Exporten für qualitative Zwecke Analyse.

⚖️

Rechtliche & medizinische

Sprachverarbeitung lokal ausführen. Sie bleiben für die Einwilligung zur Aufzeichnung, die berufliche Vertraulichkeit, die sichere Speicherung und alle von Ihnen initiierten Modell- oder Medien-Downloads verantwortlich.

Benutzer mit Barrierefreiheit

Hochwertige lokale Stimmen lesen Dokumente vor, mit vollständiger VoiceOver-Unterstützung und durchgehender Tastatur-First-Navigation.

🎓

Studenten & Journalisten

Verwandeln Sie Vorträge und Interviews in wenigen Minuten in durchsuchbaren, bearbeitbaren Text und lesen Sie ihn dann noch einmal, um nachzuvollziehen, was Sie verpasst haben.

🌍

Mehrsprachige Teams

99 Transkriptionssprachen plus natürliche Stimmen in über 20 Ausgabesprachen – mit integrierter Übersetzung ins Englische.

Sprache außerhalb des Rasters

Sprachinferenz und Projektspeicherung erfolgen lokal. Im aktuellen Repository gibt es kein VoxForge-Konto oder Analyse-SDK. Der Netzwerkzugriff wird für Modelle verwendet, die Sie herunterladen, kaufen oder ggf. lizenzieren möchten, und Medien werden nur von einer URL abgerufen, die Sie in der direkten Konfiguration angeben.

🔒
Keine Cloud-Inferenz
STT und TTS werden auf der Apple Neural Engine & GPU.
🚫
Keine Telemetrie
Keine Analyse, kein Tracking, keine Nutzungs-Pings.
👤
Kein Konto
Keine Anmeldung erforderlich. Einfach öffnen und verwenden.
🗄️
Lokaler Speicher
Projekte leben im Sandbox-Container der App.

STT + TTS an einem Ort – endlich

VoxForge bringt Transkription und Sprachgenerierung in einen lokalen Mac-Arbeitsbereich. Die Funktionen und Geschäftsbedingungen von Mitbewerbern können sich ändern. Überprüfen Sie diese daher direkt, bevor Sie sich entscheiden.

Capability VoxForge MacWhisper Speechify Beschreiben
Sprache-zu-Text
Text-zu-Sprache
SprecherdiarisierungTeilweise
Wellenform-synchronisierte Bearbeitung
Lokale SprachinferenzAnbieter prüfenAnbieter prüfen
Funktioniert offline
GeschäftsbedingungenAusstehende VeröffentlichungAnbieter prüfenAnbieter prüfenAnbieter prüfen
Kein Konto erforderlich

Vergleich überprüft am 14. Juli 2026. Überprüfen Sie die aktuellen Funktionen und Bedingungen auf der offiziellen Produktseite jedes Anbieters. Produktnamen sind Marken ihrer jeweiligen Eigentümer.

Release-Kanäle in der Validierung

Das Repository enthält Store- und Direct-Build-Konfigurationen. Öffentliche Preise und Kauflinks werden erst angezeigt, nachdem diese Endpunkte live sind.

Store-Build
Ausstehende Veröffentlichung
Sandbox-Konfiguration
  • Speech-to-Text in 99 Sprachen
  • Sprechertagebuch & Zeitstempel
  • 12+ lokale Text-to-Speech-Engines
  • Wellenform-synchronisierte Transkriptbearbeitung
  • Lokale Audio- und Audiodateien importieren. Videodateien
  • Untertitel, Dokument & Audioexport
  • Projektbibliothek mit Volltextsuche
Store-Verfügbarkeit prüfen
Am leistungsfähigsten
Direkter Build
AusstehendVeröffentlichung
Entwickler-ID signiert & notariell beglaubigt
  • Alles in der Sandbox-Store-Konfiguration
  • Video-URL-Import von über 1.500 Websites
  • Playlist-Download & Batch-Transkription
  • Erweiterte Formate: WebM, MKV, AVI, OGG
  • Prioritäre Funktionsanfragen
Direkt-Build-Verfügbarkeit prüfen

Sprachinferenz ist in beiden Konfigurationen lokal. Die direkte Konfiguration kann Medien abrufen, die Sie explizit anfordern; Modellbereitstellung und Berechtigungsprüfungen nutzen ebenfalls das Netzwerk.

Fragen, beantwortet

Speech-to-Text und Text-to-Speech verwenden lokale Modelle auf dem Mac. Der Netzwerkzugriff wird für Modelle verwendet, die Sie herunterladen, kaufen oder ggf. für die Lizenzvalidierung auswählen, Support-Links und den direkten Medienabruf nur, wenn Sie eine URL angeben.

99 Sprachen über WhisperKit – die gleiche Abdeckung wie OpenAIs Whisper – einschließlich Englisch, Französisch, Deutsch, Spanisch, Italienisch, Portugiesisch, Arabisch, Chinesisch, Japanisch, Koreanisch, Russisch und Hindi. Die Sprache kann automatisch erkannt oder manuell eingestellt werden und Sprache kann während der Transkription ins Englische übersetzt werden.

Ja. VoxForge führt mit SpeakerKit (basierend auf Pyannote v4) eine Sprecheraufzeichnung durch und trennt und beschriftet automatisch, wer was gesagt hat. Sie können Sprecher umbenennen und die Beschriftungen bleiben mit der Wellenform und den Zeitstempeln auf Wortebene synchronisiert, sodass Sie zu jedem Moment im Audio springen können.

VoxForge kombiniert Transkription, lokale Sprachgenerierung, Sprecherbezeichnungen und wellenformsynchronisierte Bearbeitung in einem Mac-Arbeitsbereich. Mitbewerberfunktionen, Datenflüsse und Preise ändern sich; Überprüfen Sie sie auf ihren aktuellen offiziellen Seiten.

Das Repository dokumentiert mehrere lokale Sprach-Engines, darunter Qwen3-TTS, Kokoro-82M, Piper und Apple Systemstimmen. Verfügbarkeit der Engine, Modellgröße, Sprachen und Stilsteuerung hängen vom aktuellen Build und dem gewählten Download ab. Sehen Sie sich eine Vorschau eines repräsentativen Textes an, bevor Sie ihn für ein Projekt auswählen.

Ja. VoxForge transkribiert Audio und Video mit Zeitstempeln und kann Untertitel und Dokumentformate exportieren. Die Sandbox-Konfiguration importiert lokale Dateien; Die direkte Konfiguration kann Medien auch von einer von Ihnen angegebenen URL abrufen, vorbehaltlich der Verfügbarkeit der Veröffentlichung und der Bedingungen Dritter.

Die endgültigen kommerziellen Bedingungen sind noch nicht verfügbar. Alle Preise, Verlängerungsmodelle, enthaltenen Funktionen und Rückerstattungswege werden an der verifizierten Kasse vor dem Kauf angezeigt.

Das Repository enthält eine Sandbox-Store-Konfiguration und eine direkte Konfiguration, die expliziten URL-Abruf und erweiterte Formate hinzufügen kann. Die endgültige Kanalverfügbarkeit und Funktionsgrenzen werden bei der Veröffentlichung bestätigt. Die Sprachinferenz bleibt in beiden Konfigurationen lokal.

macOS 14 Sonoma oder höher. Apple Silicon (M-Serie) wird dringend empfohlen, da Transkription und Synthese auf der Neural Engine und der GPU ausgeführt werden. Modelle werden einmal heruntergeladen und lokal zwischengespeichert – das empfohlene Whisper Turbo-Modell und die Kokoro-Sprache sind ein kleiner Download, und Sie können leichtere Modelle auf 8 GB Macs wählen.

VoxForge App-Symbol

Sprache nach Ihren Wünschen

Transkribieren, bearbeiten und synthetisieren Sie Sprache mit lokalen Modellen. Der öffentliche Build befindet sich noch in der Release-Validierung.

macOS 14+ · Apple Silicon empfohlen · Kommerzielle Bedingungen ausstehend