简介说明
okoro-82M,就是这样一款满足所有条件的神器。它只有82M参数,却能输出相当自然的中文语音;体积小巧到只需几百MB,却支持8种不同音色。更重要的是——它完全开源,Apache 2.0许可,零成本商用。
整合包附带103种(男,女)中文音色。
| 概念 | 定义 |
|---|---|
| Kokoro-82M | 由 hexgrad 开发的轻量级TTS模型,仅82M参数,支持8种中文音色 |
| ONNX优化 | 模型经过ONNX优化,可在CPU上高效推理,无需GPU |
| 语音管道(Pipeline) | Kokoro 的核心API,负责分词、音素转换、语音合成全流程 |
| 音色(Voice) | 预训练的音色模型,不同音色适合不同场景 |
| 指标 | 数值 |
|---|---|
| 参数规模 | 82M |
| 模型大小 | ~165MB |
| 输出采样率 | 24kHz |
| 支持语言 | 中文、英语、日语、韩语等8种 |
| 中文音色数 | 103种(男,女) |
| 推理设备 | CPU / GPU |
| 许可协议 | Apache 2.0 |
对比同级别模型,Kokoro 在中文场景下表现尤为突出——不仅音色自然,而且对中文多音字的处理也相当不错。对于没有GPU的个人开发者来说,这可能是目前最优的中文TTS本地方案。
一、先说它解决了什么问题
Kokoro 的模型很轻,生成速度也很讨喜,但第一次接触官方项目时,通常要自己准备 Python 环境、安装依赖、下载模型,再从示例代码里改文本。对于熟悉 Python 的开发者,这套流程很直接;对于只是想把一段文字读出来的人,却多了几道门槛。
这个 Windows 便携包做的事情很具体:把官方的 Kokoro ONNX 推理能力装进一个可以拷走的目录里。双击“启动webui.bat”,浏览器会打开本地页面,输入文字、选择音色,按下生成,就能得到 WAV 文件。内置 Python模型和依赖都放在包内,不要求电脑另外安装 Python,也不依赖项目当前所在的工作目录。
网页默认示例使用的是官方中文示例中的“千里之行,始于足下。”,不是另写的一段宣传文案。这样既方便第一次试听,也能和官方示例的结果进行对照。
二、官方 kokoro-onnx 是什么
官方项目是 Kokoro-TTS 的 ONNX Runtime 封装,核心接口保持得很干净:准备模型、音色和文本,调用 Kokoro.create() 生成音频。官方 README 列出的重点包括多语言、多音色、CPU/GPU 运行,以及较小的模型体积;项目本身还提供保存音频、中文示例和流式生成等示例代码。
官方中文示例采用 Misaki 的中文 G2P,把“千里之行,始于足下。”转换为模型能识别的音素,再交给 ONNX 模型合成。这种设计适合写程序、做服务,或者把 Kokoro 接到自己的应用里。
三、本地整合包多了哪些东西
1. 打开即用的中文 WebUI
整合包把常用参数放到了页面上:文本、音色、语速、音量和生成结果都能直接操作。生成结果区域会显示生成次数、开始时间、完成时间和当前文件名。第二次生成时,页面会明确提示播放器正在使用旧音频,直到新文件真正生成后再更新,避免“看起来没变化”却不知道到底有没有重新合成的问题。
2. 发音覆盖(本地增强)
中文里最容易遇到的不是模型不会说,而是同一个字在不同词里读法不同。例如:
长向 = chang2 xiang4
把规则写在输入框中,系统会在合成前检查格式、拼音数量和是否能生成有效音素。通过后才开始推理;检查失败时会告诉你哪一行有问题,并给出可修改的格式建议。
这里要说清楚:发音覆盖不是官方 kokoro-onnx API,而是本地 WebUI 加上的增强功能。它会优先按词组处理覆盖内容,因此“长向”这类容易被分词器拆开的词,也能按指定读音合成。预检默认开启,开关记录在 jxshn-com_pz.ini;不需要时可以取消勾选,以减少一次检查带来的等待。
3. 音色混合与长文本选项
页面支持选择第二个音色并调整混合比例,适合做更柔和或更有辨识度的声音。连续长文本模式则尽量保持长句之间的连贯性,但会增加推理耗时,默认关闭。句号和逗号停顿也可以分别调整,朗读诗词、说明文和对白时更容易找到合适的节奏。
4. 更适合移动和交付
包内提供模型、音色文件、运行时、许可证说明、版本信息和 SHA256SUMS.txt 校验文件。启动端口从 8888 开始,如果被占用会自动尝试下一个端口。模型路径使用包内相对位置,换到另一块硬盘或另一台没有 Python 的 Windows 电脑上,仍按同样的方式启动。
四、和官方项目相比,优点在哪里
官方项目更像一个可靠的发动机,本地整合包则把发动机、控制面板和出厂工具放到了一起。
| 对比项 | 官方 kokoro-onnx | 本地整合包 |
|---|---|---|
| 使用方式 | 以 Python API 和示例代码为主 | 浏览器 WebUI,双击启动 |
| 环境准备 | 需要自行准备 Python、依赖和模型 | 内置 Python、依赖、模型和音色 |
| 中文体验 | 提供中文 G2P 示例 | 中文默认示例、中文界面和中文参数提示 |
| 多音字处理 | 由 G2P 和词典决定 | 增加发音覆盖和生成前预检 |
| 音色操作 | 通过代码传入音色 | 页面选择音色,可调混合比例 |
| 长文本 | 通过 API 参数控制 | 页面直接开启连续合成并调停顿 |
| 发布检查 | 由使用者自行处理 | 提供版本、许可证和 SHA256 校验信息 |
最大的优势不是“模型变大了”,而是少了很多重复准备工作。测试、试听、改一个多音字、重新生成一段 WAV,这些操作都能在一个页面里完成。对于不想维护虚拟环境、又需要反复试听中文读音的人,差别非常明显。
五、它的缺点也要提前知道
第一,便携包并不等于小文件。模型和内置运行时会占用数百 MB 磁盘空间,复制和备份都比单独安装 Python 包更重。
第二,它目前是面向 Windows 的本地工具,页面监听在 127.0.0.1,适合个人电脑使用,不是开箱即用的局域网服务或云端 API。Linux、macOS 用户仍然更适合直接使用官方项目或自行搭建环境。
第三,发音覆盖属于本地增强,不是官方模型能力。它解决的是指定词组的读音控制,不会自动理解所有上下文;规则写错、拼音声调写错,仍然需要人工检查。预检能拦住很多格式问题,但它不能替人判断一句话在文学语境里是否“最自然”。
第四,官方项目更新会更快。整合包为了便携和稳定,固定了 Python、模型、依赖和页面版本。想第一时间使用上游的新接口,开发者仍然应该关注官方仓库,并在需要时自行升级,而不是把整合包当成官方发行版。
最后还有许可证问题:kokoro-onnx 代码采用 MIT License,Kokoro 模型采用 Apache License 2.0,但软件代码和模型授权是两件事。对外分发或二次商用前,应当同时查看官方仓库、模型卡和随包提供的 LICENSES.txt,不能只看代码仓库的许可证。
六、适合哪些人
如果你要做中文朗读、短视频配音、小说试音、诗词试听,或者只是想快速比较不同音色,这个整合包会比从命令行开始搭环境省事很多。尤其是经常遇到“这个字在这里要换一个读法”的场景,发音覆盖能把反复改代码变成改一行规则。
如果你正在开发自己的 TTS 产品,需要异步流式接口、服务端并发、跨平台部署或精细控制推理生命周期,官方 Python API 反而更合适。整合包的定位是本地创作和快速验证,不是替代上游库的开发框架。
七、从哪里开始
下载并解压整合包后,双击“启动webui.bat”。首次启动会加载模型,等待时间取决于电脑性能。进入页面后先用默认示例试听,再换成自己的文字;遇到多音字时,在“发音覆盖(本地增强)”中按“原文 = 数字声调拼音”的格式逐行填写。确认预检通过后再生成,通常比盲目反复试听更快找到正确读法。
这套本地包没有改变 Kokoro 的核心模型,它做的是把官方能力整理成一条更短的使用路径:下载、启动、输入、试听、修正、导出。对于想把中文 TTS 真正用起来的人,这往往比再多一个参数更有价值。
系统资源消耗情况
整合包运行前

运行后占用内存0.7G

kokoro生成中占用1.3G

图片预览
一句话 0.5秒合成音频

字数长也能几秒内合成 4.38秒

下载地址







评论抢沙发