概览
什么是VoxForge?
VoxForge 是一个原生 Mac 工作区,用于本地转录、参考语音克隆、脚本到语音生成和多语音播客制作。下载后,兼容的语音和文本模型可以在 Mac 上运行。
- 平台
- macOS 14 索诺玛或更高版本; Apple 推荐芯片
- 最适合
- 转录、语音克隆、解说视频和播客制作
- 处理
- 转录和语音合成使用本地模型
- 可用性
- 发布验证;公共构建和商业条款待定
已于 . 查看验证方法和更正政策。
一个用于转录、语音和播客的原生 Mac 工作室。
VoxForge 是一个原生macOS 应用程序语音转文本, 脚本转语音、参考语音克隆和多语音播客制作。选定的本地 WhisperKit 模型可以生成字级时间戳和说话者标签。兼容的安装模型支持语音生成、语音克隆和本地旁白起草。
Podcast Studio 逐行分配声音,在时间线上组织对话,并根据您选择的声音和模型渲染项目。语音处理和支持的文本起草在本地运行;模型下载、适用的权限检查和显式直接构建媒体获取都需要连接。 VoxForge 由 HighRoad Software 构建,并仍在发布验证中。
通过同一个 Mac 应用进行转录、编辑和讲话。
下面的转录编辑器、语音工作室和旁白工作区来自当前的 VoxForge 版本。
一切在一台机器上进行语音
专为原生 Mac 工作流程而设计的转录、语音生成和制作工具。
以 99 种语言转录任何内容
拖入音频或视频文件 - 或从麦克风实时转录 - VoxForge 使用选定的本地 WhisperKit 模型创建带有单词级时间戳的转录。准确性取决于型号、语言、录音质量、说话者和领域;没有声称普遍的单词错误率。
- 自动检测语言或从 99 种语言中进行选择,并可选择翻译成英语
- 说话者分类标记每个语音 (SpeakerKit / Pyannote v4)
- 选择从小到大的模型尺寸,以匹配您的Mac RAM
- 整个文件夹的实时流转录和批处理队列
将脚本转换为语音轨道
键入或粘贴文本,选择兼容的已安装语音模型,预览结果并导出音频。语音可用性、语言覆盖范围和交付控制取决于所选型号。
- 使用兼容型号从参考音频创建并保存语音配置文件
- 将完整脚本生成为一个轨道或逐行分配语音
- 在导出制作音频之前预览语音
- 大声朗读任何文字记录以进行免提校对
在时间轴上构建多语音播客
编写对话、为每个角色分配已保存或内置的语音、调整时间并从 Podcast Studio 进行渲染。旁白工作区还可以使用兼容的本地文本模型,在生成语音之前根据场景注释起草脚本。
- 导出 TXT、SRT、VTT、JSON、CSV、DOCX 和 PDF
- 转录摘要、翻译和本地旁白草稿
- Podcast Studio 具有每行语音分配和时间线控件
- 可对所有内容进行全文搜索的项目库
从录制到结果只需三个步骤
引入媒体或脚本,选择您需要的模型,然后调整并导出结果。
导入或录制
拖入音频或视频文件,从麦克风录制,或者在 VoxForge Pro 中粘贴视频 URL。模型在首次使用时下载一次并在本地缓存。
转录或合成
使用说话者标签进行转录,从脚本生成语音,或使用兼容的已安装模型从参考音频创建语音配置文件。
编辑和合成导出
优化脚本、分配播客语音、调整时间线以及导出字幕、文档、音频或带旁白的视频。
专为无法将音频发送到云
播客和播客创作者
转录采访、标记演讲者、导出 YouTube 就绪的 SRT 字幕和语音 B-roll 旁白 — 一个应用程序而不是四个应用程序。
研究人员
通过可靠的分类、批处理和结构化导出进行准确的多语言转录,以进行定性分析分析。
法律和法律医疗
在 Mac 上进行语音处理,以实现机密录音、结构化审查和受控导出。
无障碍用户
高质量的本地语音朗读文档,并提供全面的 VoiceOver 支持和键盘优先导航。
学生和学生记者
在几分钟内将讲座和采访变成可搜索、可编辑的文本,然后再读一遍以了解您错过的内容。
多语言团队
99 种转录语言以及跨 20 多种输出语言的自然语音 - 内置英语翻译。
离线语音
语音处理、支持的文本起草和项目存储都在本地。网络访问用于您选择下载的模型、权限检查(如果适用)以及仅从您在直接配置中提供的 URL 获取的媒体。
STT + TTS 在一个地方 - 最终
VoxForge 将转录和语音生成引入一个本地优先的 Mac 工作区。竞争对手的功能和商业条款可能会发生变化,因此请在选择前直接进行验证。
| 功能 | VoxForge | MacWhisper | 语音化 | 描述 |
|---|---|---|---|---|
| 语音转文本 | ✓ | ✓ | — | ✓ |
| 文本转语音 | ✓ | — | ✓ | ✓ |
| 说话人分类 | ✓ | 部分 | — | ✓ |
| 波形同步编辑 | ✓ | — | — | ✓ |
| 本地语音推断 | ✓ | ✓ | 检查供应商 | 检查供应商 |
| 离线工作 | ✓ | ✓ | — | — |
| 商业条款 | 待发布 | 检查供应商 | 检查供应商 | 检查供应商 |
| 无需帐户 | ✓ | ✓ | — | — |
比较审核日期为 2026 年 7 月 14 日。在每个供应商的官方产品页面上验证当前功能和条款。产品名称是其各自所有者的商标。
验证中的发布渠道
存储库包含存储和直接构建配置。仅在这些端点上线后才会显示公开价格和购买链接。
- 99 种语言的语音转文本
- 说话人分类和语音识别时间戳
- 脚本到语音和参考语音克隆
- 多语音 Podcast Studio 和本地旁白起草
- 波形同步转录编辑
- 导入本地音频&视频文件
- 字幕、文档和视频文件音频导出
- 支持全文搜索的项目库
- 沙盒商店配置中的所有内容
- 从 1,500 多个网站导入视频 URL
- 播放列表下载和下载批量转录
- 扩展格式:WebM、MKV、AVI、OGG
- 优先功能请求
两种配置中的语音推理都是本地的。直接配置可以获取您明确请求的媒体;模型交付和权利检查也使用网络。
问题及解答
语音转文本和文本转语音在 Mac 上使用本地模型。网络访问用于您选择下载、购买或在适用时进行许可验证的模型、支持链接以及仅在您提供 URL 时直接获取媒体。
通过 WhisperKit 实现 99 种语言 — 覆盖范围与 OpenAI 的 Whisper 相同 — 包括英语、法语、德语、西班牙语、意大利语、葡萄牙语、阿拉伯语、中文、日语、韩语、俄语和印地语。可以自动检测或手动设置语言,转录时可以将语音翻译成英语。
是的。 VoxForge 使用SpeakerKit(基于Pyannote v4)执行说话人分类,自动分离和标记谁说了什么。您可以重命名扬声器,并且标签与波形和字级时间戳保持同步,以便您可以跳转到音频中的任何时刻。
VoxForge 在一个 Mac 工作区中结合了转录、本地语音生成、说话者标签和波形同步编辑。竞争对手的功能、数据流和价格变化;在其当前的官方页面上进行验证。
VoxForge 列出了应用中的内置和可下载的语音选项。语音可用性、模型大小、语言覆盖范围和交付控制取决于当前版本和所选模型。在提交项目之前预览代表性文本。
可以。 VoxForge 转录带有时间戳的音频和视频,并可以导出字幕和文档格式。沙盒配置导入本地文件;直接配置还可以从您提供的 URL 获取媒体,具体取决于版本可用性和第三方条款。
最终商业条款尚未生效。任何价格、续订型号、包含的功能和退款路线都将在购买前经过验证的结账时显示。
存储库包含沙盒商店配置和可以添加显式 URL 抓取和扩展格式的直接配置。最终渠道可用性和功能边界将在发布时确认。两种配置中的语音推理均保持在本地。
macOS 14 索诺玛或更高版本的 Apple Silicon Mac。存储和内存需求因您选择安装的语音和文本模型而异。
