# IndexTTS2_LocalPythonGenerate **Repository Path**: limerence02/index-tts2_-local-python-generate ## Basic Information - **Project Name**: IndexTTS2_LocalPythonGenerate - **Description**: No description available - **Primary Language**: Unknown - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-08-05 - **Last Updated**: 2026-08-05 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # IndexTTS2 本地语音合成工具 这是一个基于 IndexTTS2 的本地 AI 语音合成工具,提供图形化界面,支持情感控制、语速调节等高级功能。 ## ✨ 功能特点 - 🎙️ **高质量语音合成** - 基于 IndexTTS2 模型 - 🎨 **图形化界面** - 简单易用的 GUI - 😊 **情感控制** - 支持 8 种情感调节(喜、怒、哀、惧、厌恶、低落、惊喜、平静) - ⚡ **语速调节** - 0.5x - 2.0x 倍速控制 - 🎵 **试听功能** - 生成后即可播放预览 - 🎛️ **高级参数** - Temperature、Top P、Top K 等采样参数 - 📦 **快速预设** - 默认、高质量、高创造性、稳定四种预设 ## 📋 系统要求 - Windows 10/11 - Python 3.10 或更高版本 - 至少 8GB 内存(推荐 16GB) - 约 12GB 磁盘空间(用于模型文件) ## 🚀 快速开始 ### 方法一:使用安装脚本(推荐) 1. 下载本项目 2. 双击运行 `install.bat` 3. 等待依赖安装完成 4. 双击运行 `start.bat` ### 方法二:手动安装 1. 克隆项目: ```bash git clone https://gitee.com/limerence02/index-tts2_-local-python-generate.git cd index-tts2_-local-python-generate ``` 2. 安装 uv(Python 包管理器): ```bash pip install uv ``` 3. 创建虚拟环境并安装依赖: ```bash uv venv uv pip install -r requirements.txt ``` 4. 启动 GUI: ```bash uv run python local_gui_advanced.py ``` ## 📖 使用说明 ### 第一次使用 1. **加载模型** - 点击"🚀 加载 AI 模型"按钮 - 首次加载会自动下载模型文件(约 6GB),需要几分钟 - 后续启动会直接加载本地模型 2. **选择参考音频** - 点击"📁 选择"按钮 - 选择一个 3-10 秒的清晰人声音频文件 - 支持 WAV、MP3、FLAC 格式 - 参考音频决定生成语音的音色 3. **输入文本** - 在文本框中输入要转换的文字 - 支持中文和英文 4. **调整参数(可选)** - **语速**:0.5x(慢)- 2.0x(快) - **情感**:调节 8 种情感滑块 - **采样参数**:调整生成质量和多样性 - **快速预设**:点击预设按钮快速应用配置 5. **生成语音** - 点击"🎙️ 生成语音" - 选择保存位置 - 等待生成完成(CPU 模式较慢,约 2-5 分钟) - 点击"▶️ 试听"播放生成的音频 ## ⚙️ 高级参数说明 ### 情感控制 - **喜悦**:高兴、愉快的情绪 - **愤怒**:生气、愤怒的情绪 - **悲伤**:难过、伤心的情绪 - **恐惧**:害怕、恐慌的情绪 - **厌恶**:反感、厌恶的情绪 - **低落**:沮丧、忧郁的情绪 - **惊喜**:惊讶、意外的情绪 - **平静**:平和、冷静的情绪 ### 采样参数 - **Temperature**(创造性):越高越有变化,越低越稳定(默认 0.8) - **Top P**(多样性):控制生成的多样性(默认 0.8) - **Top K**:限制候选词数量(默认 30) - **Repetition Penalty**(重复惩罚):防止重复,越高越不会重复(默认 10.0) ### 快速预设 - **默认**:平衡的设置,适合大多数场景 - **高质量**:更稳定、更清晰的输出 - **高创造性**:更多变化,更自然 - **稳定**:最稳定、一致性最好 ## 🎯 使用技巧 1. **选择好的参考音频** - 使用清晰、无背景噪音的人声录音 - 3-10 秒的长度最佳 - 音质越好,生成效果越好 2. **调整语速** - 正常对话:1.0x - 快速播报:1.3x - 1.5x - 舒缓讲解:0.7x - 0.9x 3. **情感设置** - 可以混合多种情感(例如:喜悦 0.5 + 惊喜 0.3) - 情感权重建议 0.5 - 0.8 之间 - 不设置情感时会使用中性语调 4. **文本长度** - 建议每次生成不超过 200 字 - 长文本可以分段生成后拼接 ## ⚠️ 注意事项 - CPU 模式生成较慢,请耐心等待 - 首次启动会下载模型文件,需要稳定的网络连接 - 不要关闭命令行窗口,否则 GUI 会关闭 - 生成的音频文件为 WAV 格式,文件较大 ## 🐛 常见问题 **Q: 首次启动为什么这么慢?** A: 首次启动需要下载约 6GB 的模型文件,请耐心等待。后续启动会直接使用本地模型。 **Q: 为什么生成这么慢?** A: 本项目使用 CPU 模式运行,速度相对较慢。如果有 NVIDIA GPU,可以修改代码启用 GPU 加速。 **Q: 如何提高生成质量?** A: 使用高质量的参考音频,尝试"高质量"预设,适当调整 Temperature 参数。 **Q: 可以商用吗?** A: 请参考 IndexTTS2 官方的许可协议。 ## 📦 打包为 exe(可选) 使用 PyInstaller 打包: ```bash pip install pyinstaller pyinstaller --onefile --windowed --name "IndexTTS2语音合成" local_gui_advanced.py ``` ## 🙏 致谢 - [IndexTTS2](https://github.com/IndexTeam/Index-1.9B) - 核心 TTS 模型 - [Gradio](https://gradio.app/) - 原始 WebUI 框架 - [Pygame](https://www.pygame.org/) - 音频播放 ## 📄 许可 本项目基于 MIT 许可证开源。 ## 🔗 相关链接 - [IndexTTS2 官方项目](https://github.com/IndexTeam/Index-1.9B) - [问题反馈](https://gitee.com/limerence02/index-tts2_-local-python-generate/issues) ## 📝 更新日志 ### v1.0.0 (2026-08-05) - 初始版本发布 - 支持基本语音合成功能 - 提供图形化界面 - 支持情感控制和语速调节 - 内置试听功能