工具说明
文字转语音使用 Kokoro 神经网络模型,在浏览器中把中文或英文文字合成为更自然、稳定的语音。它不再依赖操作系统自带音色,因此不同设备可以获得更一致的效果。
每种语言提供两款经过筛选的音色,并支持调整语速。生成完成后可以直接试听或下载标准 WAV 文件,适合旁白草稿、发音检查、无障碍试听和原型配音。
使用步骤
输入并选择语言
粘贴中文或英文内容,使用标点控制停顿,单次最多输入 2000 个字符。
选择音色和语速
从当前语言的两款音色中选择,并在 0.75x 到 1.5x 之间调整语速。
生成、试听并下载
等待浏览器完成本地合成,试听结果后下载 WAV 文件。
支持范围与限制
- 合成引擎
- Kokoro 82M 中英双语模型,使用高精度 ONNX 版本在浏览器中运行
- 语言支持
- 中文和英语
- 可用音色
- 中文女声、中文男声、美式女声和英式女声
- 可调参数
- 语速 0.75x 到 1.5x
- 输出格式
- 24 kHz WAV 音频,可在线试听和下载
- 处理位置
- 文字和生成音频保留在当前浏览器,不发送到 ToolGarden 服务器
典型使用场景
制作旁白草稿
把视频脚本、产品介绍或课程文案快速转换为可下载的参考语音。
检查内容可听性
听取页面文案或提示语,发现拗口句子、错误停顿和数字读法问题。
辅助阅读与原型验证
为阅读辅助、交互演示和语音界面原型提供稳定的中英文语音。
使用前需要知道的事
- 首次生成需要下载约 339 MB 的高精度模型,后续访问通常会复用浏览器缓存。
- 模型在浏览器本地运行,生成速度取决于设备性能,较长文本会自动分段合成。
- 合成语音仍可能读错姓名、缩写和特殊数字,发布前请完整试听。
- 不要用合成语音冒充真实人物或制作未经授权的欺骗性内容。
相关概念
- Kokoro
- 一款轻量的开放权重文本转语音模型,用于把文本转换为自然语音。
- WAV
- 保存未压缩 PCM 音频的通用格式,便于播放、剪辑和继续处理。