Kokoro-82M中文语音版来了!轻量级 TTS无需显卡1G内存可用!0.5秒合成!自带103个音色 解压即用

文章目录(快捷跳转)

简介说明
okoro-82M,就是这样一款满足所有条件的神器。它只有82M参数,却能输出相当自然的中文语音;体积小巧到只需几百MB,却支持8种不同音色。更重要的是——它完全开源,Apache 2.0许可,零成本商用。

整合包附带103种(男,女)中文音色。

概念 定义
Kokoro-82M 由 hexgrad 开发的轻量级TTS模型,仅82M参数,支持8种中文音色
ONNX优化 模型经过ONNX优化,可在CPU上高效推理,无需GPU
语音管道(Pipeline) Kokoro 的核心API,负责分词、音素转换、语音合成全流程
音色(Voice) 预训练的音色模型,不同音色适合不同场景
指标 数值
参数规模 82M
模型大小 ~165MB
输出采样率 24kHz
支持语言 中文、英语、日语、韩语等8种
中文音色数 103种(男,女)
推理设备 CPU / GPU
许可协议 Apache 2.0

对比同级别模型,Kokoro 在中文场景下表现尤为突出——不仅音色自然,而且对中文多音字的处理也相当不错。对于没有GPU的个人开发者来说,这可能是目前最优的中文TTS本地方案。

一、先说它解决了什么问题

Kokoro 的模型很轻,生成速度也很讨喜,但第一次接触官方项目时,通常要自己准备 Python 环境、安装依赖、下载模型,再从示例代码里改文本。对于熟悉 Python 的开发者,这套流程很直接;对于只是想把一段文字读出来的人,却多了几道门槛。

这个 Windows 便携包做的事情很具体:把官方的 Kokoro ONNX 推理能力装进一个可以拷走的目录里。双击“启动webui.bat”,浏览器会打开本地页面,输入文字、选择音色,按下生成,就能得到 WAV 文件。内置 Python模型和依赖都放在包内,不要求电脑另外安装 Python,也不依赖项目当前所在的工作目录。

网页默认示例使用的是官方中文示例中的“千里之行,始于足下。”,不是另写的一段宣传文案。这样既方便第一次试听,也能和官方示例的结果进行对照。

二、官方 kokoro-onnx 是什么

官方项目是 Kokoro-TTS 的 ONNX Runtime 封装,核心接口保持得很干净:准备模型、音色和文本,调用 Kokoro.create() 生成音频。官方 README 列出的重点包括多语言、多音色、CPU/GPU 运行,以及较小的模型体积;项目本身还提供保存音频、中文示例和流式生成等示例代码。

官方中文示例采用 Misaki 的中文 G2P,把“千里之行,始于足下。”转换为模型能识别的音素,再交给 ONNX 模型合成。这种设计适合写程序、做服务,或者把 Kokoro 接到自己的应用里。

三、本地整合包多了哪些东西

1. 打开即用的中文 WebUI

整合包把常用参数放到了页面上:文本、音色、语速、音量和生成结果都能直接操作。生成结果区域会显示生成次数、开始时间、完成时间和当前文件名。第二次生成时,页面会明确提示播放器正在使用旧音频,直到新文件真正生成后再更新,避免“看起来没变化”却不知道到底有没有重新合成的问题。

2. 发音覆盖(本地增强)

中文里最容易遇到的不是模型不会说,而是同一个字在不同词里读法不同。例如:

长向 = chang2 xiang4

把规则写在输入框中,系统会在合成前检查格式、拼音数量和是否能生成有效音素。通过后才开始推理;检查失败时会告诉你哪一行有问题,并给出可修改的格式建议。

这里要说清楚:发音覆盖不是官方 kokoro-onnx API,而是本地 WebUI 加上的增强功能。它会优先按词组处理覆盖内容,因此“长向”这类容易被分词器拆开的词,也能按指定读音合成。预检默认开启,开关记录在 jxshn-com_pz.ini;不需要时可以取消勾选,以减少一次检查带来的等待。

3. 音色混合与长文本选项

页面支持选择第二个音色并调整混合比例,适合做更柔和或更有辨识度的声音。连续长文本模式则尽量保持长句之间的连贯性,但会增加推理耗时,默认关闭。句号和逗号停顿也可以分别调整,朗读诗词、说明文和对白时更容易找到合适的节奏。

4. 更适合移动和交付

包内提供模型、音色文件、运行时、许可证说明、版本信息和 SHA256SUMS.txt 校验文件。启动端口从 8888 开始,如果被占用会自动尝试下一个端口。模型路径使用包内相对位置,换到另一块硬盘或另一台没有 Python 的 Windows 电脑上,仍按同样的方式启动。

四、和官方项目相比,优点在哪里

官方项目更像一个可靠的发动机,本地整合包则把发动机、控制面板和出厂工具放到了一起。

 

对比项 官方 kokoro-onnx 本地整合包
使用方式 以 Python API 和示例代码为主 浏览器 WebUI,双击启动
环境准备 需要自行准备 Python、依赖和模型 内置 Python、依赖、模型和音色
中文体验 提供中文 G2P 示例 中文默认示例、中文界面和中文参数提示
多音字处理 由 G2P 和词典决定 增加发音覆盖和生成前预检
音色操作 通过代码传入音色 页面选择音色,可调混合比例
长文本 通过 API 参数控制 页面直接开启连续合成并调停顿
发布检查 由使用者自行处理 提供版本、许可证和 SHA256 校验信息

最大的优势不是“模型变大了”,而是少了很多重复准备工作。测试、试听、改一个多音字、重新生成一段 WAV,这些操作都能在一个页面里完成。对于不想维护虚拟环境、又需要反复试听中文读音的人,差别非常明显。

五、它的缺点也要提前知道

第一,便携包并不等于小文件。模型和内置运行时会占用数百 MB 磁盘空间,复制和备份都比单独安装 Python 包更重。

第二,它目前是面向 Windows 的本地工具,页面监听在 127.0.0.1,适合个人电脑使用,不是开箱即用的局域网服务或云端 API。Linux、macOS 用户仍然更适合直接使用官方项目或自行搭建环境。

第三,发音覆盖属于本地增强,不是官方模型能力。它解决的是指定词组的读音控制,不会自动理解所有上下文;规则写错、拼音声调写错,仍然需要人工检查。预检能拦住很多格式问题,但它不能替人判断一句话在文学语境里是否“最自然”。

第四,官方项目更新会更快。整合包为了便携和稳定,固定了 Python、模型、依赖和页面版本。想第一时间使用上游的新接口,开发者仍然应该关注官方仓库,并在需要时自行升级,而不是把整合包当成官方发行版。

最后还有许可证问题:kokoro-onnx 代码采用 MIT License,Kokoro 模型采用 Apache License 2.0,但软件代码和模型授权是两件事。对外分发或二次商用前,应当同时查看官方仓库、模型卡和随包提供的 LICENSES.txt,不能只看代码仓库的许可证。

六、适合哪些人

如果你要做中文朗读、短视频配音、小说试音、诗词试听,或者只是想快速比较不同音色,这个整合包会比从命令行开始搭环境省事很多。尤其是经常遇到“这个字在这里要换一个读法”的场景,发音覆盖能把反复改代码变成改一行规则。

如果你正在开发自己的 TTS 产品,需要异步流式接口、服务端并发、跨平台部署或精细控制推理生命周期,官方 Python API 反而更合适。整合包的定位是本地创作和快速验证,不是替代上游库的开发框架。

七、从哪里开始

下载并解压整合包后,双击“启动webui.bat”。首次启动会加载模型,等待时间取决于电脑性能。进入页面后先用默认示例试听,再换成自己的文字;遇到多音字时,在“发音覆盖(本地增强)”中按“原文 = 数字声调拼音”的格式逐行填写。确认预检通过后再生成,通常比盲目反复试听更快找到正确读法。

这套本地包没有改变 Kokoro 的核心模型,它做的是把官方能力整理成一条更短的使用路径:下载、启动、输入、试听、修正、导出。对于想把中文 TTS 真正用起来的人,这往往比再多一个参数更有价值。

系统资源消耗情况

整合包运行前

kokoro未运行前

运行后占用内存0.7G

kokoro运行后

kokoro生成中占用1.3G

kokoro生成中占用

图片预览

一句话 0.5秒合成音频

0.5秒合成音频

字数长也能几秒内合成 4.38秒
Kokoro-82M中文合成整合包界面图片
下载地址

https://github.com/thewh1teagle/kokoro-onnx

未经允许不得转载:网站源码、软件资源与技术教程分享 - 今夕资源网 » Kokoro-82M中文语音版来了!轻量级 TTS无需显卡1G内存可用!0.5秒合成!自带103个音色 解压即用
扫码在手机上阅读本页
赞(0)

评论抢沙发

评论前必须登录!