toolgarden.xyz
EN

文字转语音

使用 Kokoro 高质量音色把中文或英文转换为自然语音,可调语速、在线试听并下载 WAV,浏览器本地生成。

文字转语音

Kokoro 高质量音色在浏览器本地生成,首次使用需加载约 339 MB 模型。0 / 2000 字符

输出音频

输入文字并生成语音后,可在这里试听和下载 WAV 文件。

工具说明

文字转语音使用 Kokoro 神经网络模型,在浏览器中把中文或英文文字合成为更自然、稳定的语音。它不再依赖操作系统自带音色,因此不同设备可以获得更一致的效果。

每种语言提供两款经过筛选的音色,并支持调整语速。生成完成后可以直接试听或下载标准 WAV 文件,适合旁白草稿、发音检查、无障碍试听和原型配音。

使用步骤

  1. 输入并选择语言

    粘贴中文或英文内容,使用标点控制停顿,单次最多输入 2000 个字符。

  2. 选择音色和语速

    从当前语言的两款音色中选择,并在 0.75x 到 1.5x 之间调整语速。

  3. 生成、试听并下载

    等待浏览器完成本地合成,试听结果后下载 WAV 文件。

支持范围与限制

合成引擎
Kokoro 82M 中英双语模型,使用高精度 ONNX 版本在浏览器中运行
语言支持
中文和英语
可用音色
中文女声、中文男声、美式女声和英式女声
可调参数
语速 0.75x 到 1.5x
输出格式
24 kHz WAV 音频,可在线试听和下载
处理位置
文字和生成音频保留在当前浏览器,不发送到 ToolGarden 服务器

典型使用场景

  • 制作旁白草稿

    把视频脚本、产品介绍或课程文案快速转换为可下载的参考语音。

  • 检查内容可听性

    听取页面文案或提示语,发现拗口句子、错误停顿和数字读法问题。

  • 辅助阅读与原型验证

    为阅读辅助、交互演示和语音界面原型提供稳定的中英文语音。

使用前需要知道的事

  • 首次生成需要下载约 339 MB 的高精度模型,后续访问通常会复用浏览器缓存。
  • 模型在浏览器本地运行,生成速度取决于设备性能,较长文本会自动分段合成。
  • 合成语音仍可能读错姓名、缩写和特殊数字,发布前请完整试听。
  • 不要用合成语音冒充真实人物或制作未经授权的欺骗性内容。

相关概念

Kokoro
一款轻量的开放权重文本转语音模型,用于把文本转换为自然语音。
WAV
保存未压缩 PCM 音频的通用格式,便于播放、剪辑和继续处理。

常见问题

文字转语音会上传我的文字吗?
不会。文字由浏览器本地加载的 Kokoro 模型生成语音,不会发送到 ToolGarden 服务器。首次使用时浏览器会从模型仓库下载所需文件并缓存。
有哪些可用的声音?
语言精简为中文和英语,每种语言提供两款经过筛选的音色,避免受操作系统语音包质量影响。
可以导出语音文件吗?
可以。生成完成后可先在页面试听,再直接下载标准 WAV 音频文件。
为什么第一次生成比较慢?
浏览器首次使用时需要下载并初始化约 339 MB 的语音模型。模型被缓存后,再次使用通常只需等待合成过程。
可以把生成结果保存成文件吗?
可以。生成完成后可在输出面板试听,并点击下载按钮保存为 WAV 文件。
为什么只保留中文和英语?
当前模型针对中文和英语进行了优化。精简语言列表可以保证每个选项都有稳定音色,避免显示设备上质量不一致的系统语音。