这一组工具用 FFmpeg 的 WebAssembly 版本在浏览器里解码和重编码音频,因此格式转换、剪辑、合并、变速、改采样率这类操作不需要把文件传到服务器。音频转文本用的是浏览器内运行的开源 Whisper 模型,音频分轨用的是同样在本地运行的分离模型。
代价是算力来自你的设备:一段几分钟的音频转文本或分轨,可能需要等待相当长时间,而同样的格式转换通常只要几秒。
在线处理音频,支持转 MP3、转 WAV、从视频提取音频、音频合并、音频剪辑、音频压缩、麦克风录音、音频转文本、修改音量、修改播放速度、修改采样率、调整比特率、去除静音和文字转语音。转换、剪辑、合并、压缩和音频编辑优先在浏览器本地完成,转文本可在浏览器中加载开源 Whisper 模型。
音频和视频优先在本地浏览器处理;FFmpeg WASM 和转文本模型会按需下载开源资源。
这一组工具用 FFmpeg 的 WebAssembly 版本在浏览器里解码和重编码音频,因此格式转换、剪辑、合并、变速、改采样率这类操作不需要把文件传到服务器。音频转文本用的是浏览器内运行的开源 Whisper 模型,音频分轨用的是同样在本地运行的分离模型。
代价是算力来自你的设备:一段几分钟的音频转文本或分轨,可能需要等待相当长时间,而同样的格式转换通常只要几秒。
比特率决定体积与音质的平衡。下面是 MP3 常用档位的粗略参考,实际差异取决于素材和你的听音环境。
| 比特率 | 每分钟约占 | 听感 | 适合的素材 |
|---|---|---|---|
| 96 kbps | 约 0.7 MB | 能听清但细节明显损失 | 纯语音、会议录音、播客初稿 |
| 128 kbps | 约 0.9 MB | 多数场景下够用 | 语音内容、背景音乐 |
| 192 kbps | 约 1.4 MB | 音乐上已接近透明 | 一般音乐分发 |
| 320 kbps | 约 2.3 MB | MP3 的实用上限 | 需要尽量保真的音乐 |
MP3 是有损格式,重新编码无法把已经丢掉的高频找回来。把 128 kbps 的文件转成 320 kbps 只会让体积变大,音质不会变好:要保真就从无损源开始。
浏览器内的 FFmpeg 需要把整个文件读进内存,处理大文件(尤其是长视频提取音频)时可能因内存不足失败。遇到这种情况先把源文件切短。
音频转文本和音频分轨要下载模型并做大量计算,耗时与音频长度和设备性能成正比,移动端可能无法完成较长的素材。