文字に起こします。
音声を出します。
自分のものにします。
録音とスクリプトを編集可能なトランスクリプト、クローン音声クリップ、およびマルチボイス ポッドキャストに変換します。互換性のあるモデルは、ダウンロードを選択した後、Mac 上で実行されます。
macOS 14 Sonoma 以降 · Apple Silicon 推奨 · 公開条件保留中

概要
とはVoxForge?
VoxForge は、ローカル文字起こし、参照音声のクローン作成、スクリプト音声生成、およびマルチ音声ポッドキャスト制作のためのネイティブ Mac ワークスペースです。互換性のある音声およびテキスト モデルは、ダウンロード後に Mac 上で実行されます。
- プラットフォーム
- macOS 14 Sonoma 以降。 Apple シリコンを推奨
- 最適
- 文字起こし、音声クローン、ナレーション付きビデオおよびポッドキャストの制作
- 処理
- 文字起こしと音声合成はローカルを使用モデル
- 可用性
- リリースの検証。公開ビルドおよび商業条件は保留中
製品の事実は、. 検証方法と修正ポリシーを参照してください。
トランスクリプト、音声、ポッドキャスト用の 1 つのネイティブ Mac スタジオ。
VoxForge は、次のネイティブ macOS アプリケーションです。 音声合成, スクリプト音声変換、リファレンス音声クローンおよびマルチ音声ポッドキャスト制作。選択したローカル WhisperKit モデルは、単語レベルのタイムスタンプと話者ラベルを生成できます。互換性のあるインストール済みモデルは、音声生成、音声クローン作成、およびローカル ナレーション ドラフトを強化します。
Podcast Studio は音声を 1 行ずつ割り当て、タイムライン上でダイアログを編成し、選択した音声とモデルからプロジェクトをレンダリングします。音声処理とサポートされているテキスト ドラフトはローカルで実行されます。モデルのダウンロード、資格チェック (該当する場合)、および明示的な直接ビルド メディアの取得には接続が必要です。 VoxForge は次によって構築されますHighRoad Software リリース検証中のままです。
同じ Mac アプリから文字起こし、編集、発話を行います。
以下の文字起こしエディタ、音声スタジオ、およびナレーション ワークスペースは、現在の VoxForge ビルドのものです。
すべての音声を 1 台のマシンで
ネイティブ Mac ワークフロー用に設計された文字起こし、音声生成、制作ツール。
99 言語であらゆるものを文字に起こします
音声ファイルまたはビデオ ファイルをドラッグインするか、ライブで文字起こししますマイク — そして VoxForge は、選択されたローカル WhisperKit モデルを使用して、単語レベルのタイムスタンプを持つトランスクリプトを作成します。精度はモデル、言語、録音品質、話者、ドメインによって異なります。普遍的な単語誤り率は主張されていません。
- 言語を自動検出するか、99 言語から選択し、オプションで英語に翻訳します
- 話者ダイアライゼーションによりすべての音声にラベルが付けられます (SpeakerKit / Pyannote v4)
- ご使用の環境に合わせて、小型から大型 v3 までのモデル サイズを選択してくださいMac' の RAM
- フォルダ全体のライブ ストリーミング文字起こしとバッチ キュー
スクリプトを音声トラックに変換する
タイプまたはテキストを貼り付け、互換性のあるインストール済み音声モデルを選択し、結果をプレビューしてオーディオをエクスポートします。音声の利用可能性、言語範囲、および配信制御は、選択したモデルによって異なります。
- 互換性のあるモデルを使用して、リファレンス音声から音声プロファイルを作成して保存します。
- 完全なスクリプトを 1 つのトラックとして生成するか、音声を 1 行ずつ割り当てます。
- 本番音声をエクスポートする前に音声をプレビューします
- トランスクリプトを読み上げてハンズフリー校正を行う
タイムライン上にマルチボイス ポッドキャストを構築します
ダイアログを作成し、各キャラクターに保存または内蔵の音声を割り当て、タイミングを調整して、Podcast Studio からレンダリングします。ナレーション ワークスペースでは、互換性のあるローカル テキスト モデルを使用して、音声生成前にシーン ノートからスクリプトを作成することもできます。
- TXT、SRT、VTT、JSON、CSV、DOCX、PDF をエクスポート
- トランスクリプトの概要、翻訳、およびローカル ナレーションのドラフト
- 行ごとの音声割り当てとタイムライン コントロールを備えた Podcast Studio
- すべてを対象とした全文検索が可能なプロジェクト ライブラリ
録音から結果まで 3 つのステップで完了
メディアまたはスクリプトを取り込み、必要なモデルを選択し、結果を整形してエクスポートします。
インポートまたは録音
オーディオ ファイルまたはビデオ ファイルをドラッグするか、マイクから録音するか、VoxForge Pro ではビデオ URL を貼り付けます。モデルは最初の使用時に一度ダウンロードされ、ローカルにキャッシュされたままになります。
文字起こしまたは合成
スピーカー ラベルを使用した文字起こし、スクリプトから音声の生成、または互換性のあるインストール済みモデルを使用した参照音声から音声プロファイルの作成を行います。
編集と合成。エクスポート
トランスクリプトを調整し、ポッドキャストの音声を割り当て、タイムラインを調整し、字幕、ドキュメント、音声、またはナレーション付きビデオをエクスポートします。
音声をクラウド
ポッドキャスターとクリエイター
インタビューの文字起こし、発言者のラベル付け、YouTube 対応 SRT 字幕のエクスポート、および音声 B ロール ナレーションを、4 つではなく 1 つのアプリで実行できます。
研究者
定性的なダイアライゼーション、バッチ処理、構造化エクスポートによる正確な多言語文字起こし。
法務と分析。医療
機密録音、構造化されたレビュー、および制御されたエクスポートのために、Mac で音声処理を維持します。
アクセシビリティ ユーザー
VoiceOver の完全サポートとキーボード ファースト ナビゲーションにより、高品質のローカル音声がドキュメントを読み上げます。
学生と生徒ジャーナリスト
講義やインタビューを数分で検索、編集可能なテキストに変換し、読み忘れた箇所を読み返すことができます。
多言語チーム
99 の文字起こし言語に加え、20 以上の出力言語にわたる自然音声 - 英語への翻訳が組み込まれています。
グリッド外の音声
音声処理、サポートされているテキスト ドラフト、プロジェクト ストレージはローカルです。ネットワーク アクセスは、ダウンロードするように選択したモデル、該当する場合は権利チェック、および直接構成で指定した URL からのみフェッチされるメディアに使用されます。
STT + TTS を 1 か所に — 最終的に
VoxForge により、文字起こしと音声生成が 1 つのローカル優先の Mac ワークスペースに組み込まれます。競合他社の機能や商業条件は変更される可能性があるため、選択する前に直接確認してください。
| 機能 | VoxForge | MacWhisper | 音声化 | 説明 |
|---|---|---|---|---|
| 音声合成 | ✓ | ✓ | — | ✓ |
| 音声合成 | ✓ | — | ✓ | ✓ |
| 話者ダイアリゼーション | ✓ | 部分的 | — | ✓ |
| 波形同期編集 | ✓ | — | — | ✓ |
| ローカル音声推論 | ✓ | ✓ | ベンダーの確認 | ベンダーの確認 |
| オフラインで動作します | ✓ | ✓ | — | — |
| 商業条件 | リリース保留中 | ベンダーを確認してください | ベンダーを確認してください | 確認してくださいベンダー |
| アカウントは必要ありません | ✓ | ✓ | — | — |
2026 年 7 月 14 日にレビューされた比較。各ベンダーの公式製品ページで現在の機能と条件を確認してください。製品名は、それぞれの所有者の商標です。
検証中のリリース チャネル
リポジトリには、ストア構成とダイレクトビルド構成が含まれています。公開価格と購入リンクは、これらのエンドポイントが公開された後にのみ表示されます。
- 99 言語の音声テキスト変換
- 話者のダイアリゼーションと音声変換タイムスタンプ
- 音声合成および参照音声のクローン作成
- マルチボイス Podcast Studio およびローカル ナレーション ドラフト
- 波形同期トランスクリプト編集
- ローカル音声のインポート&ビデオ ファイル
- 字幕、ドキュメント、およびオーディオ エクスポート
- 全文検索付きのプロジェクト ライブラリ
- サンドボックスストア設定内のすべて
- 1,500 以上のサイトからのビデオ URL インポート
- プレイリストのダウンロードとバッチ転写
- 拡張形式: WebM、MKV、AVI、OGG
- 優先機能リクエスト
音声推論はどちらの構成でもローカルです。直接構成では、明示的に要求したメディアを取得できます。モデルの配信と資格チェックにもネットワークが使用されます。
質問と回答
音声合成およびテキスト読み上げは、Mac のローカル モデルを使用します。ネットワーク アクセスは、ダウンロード、購入、または該当する場合はライセンス認証を行うために選択したモデル、サポート リンク、および URL を指定した場合にのみ直接メディアを取得するために使用されます。
WhisperKit 経由で 99 言語 — OpenAI の Whisper と同じ対応 — 英語を含むフランス語、ドイツ語、スペイン語、イタリア語、ポルトガル語、アラビア語、中国語、日本語、韓国語、ロシア語、ヒンディー語。言語は自動検出または手動で設定でき、文字起こし中に音声を英語に翻訳できます。
はい。 VoxForge は、SpeakerKit (Pyannote v4 ベース) を使用して話者ダイアライゼーションを実行し、誰が何を言ったかを自動的に分離してラベル付けします。スピーカーの名前を変更でき、ラベルは波形および単語レベルのタイムスタンプと同期したままになるため、音声の任意の瞬間にジャンプできます。
VoxForge は、文字起こし、ローカル音声生成、話者ラベル、波形同期編集を 1 つの Mac ワークスペースに組み合わせます。競合他社の機能、データ フロー、価格は変化します。現在の公式ページで確認してください。
VoxForge には、アプリの組み込みおよびダウンロード可能な音声オプションがリストされています。音声の利用可能性、モデル サイズ、言語範囲、および配信制御は、現在のビルドと選択したモデルによって異なります。プロジェクトにコミットする前に代表的なテキストをプレビューします。
はい。 VoxForge は、オーディオとビデオをタイムスタンプ付きで転写し、字幕とドキュメント形式をエクスポートできます。サンドボックス構成ではローカル ファイルがインポートされます。直接設定では、リリースの可用性とサードパーティの規約に従って、指定した URL からメディアをフェッチすることもできます。
最終的な商用規約はまだ有効ではありません。価格、更新モデル、含まれる機能、返金ルートは、購入前の確認済みチェックアウト時に表示されます。
リポジトリには、サンドボックス化されたストア構成と、明示的な URL フェッチと拡張形式を追加できる直接構成が含まれています。最終的なチャネルの可用性と機能の境界はリリース時に確認されます。音声推論はどちらの構成でもローカルのままです。
macOS 14 Sonoma 以降、Apple Silicon Mac。ストレージとメモリの必要性は、インストールすることを選択した音声およびテキスト モデルによって異なります。