关于 Fish Audio
让每个人都能拥有会表达的 AI 声音
Fish Audio 是一家专注生成式语音技术的公司,核心团队包含 GPT-SoVITS、Bert-VITS2 等知名开源语音项目的核心开发者。平台提供文本转语音(TTS)与声音克隆两大能力,主打「高表现力」与「情感可控」。
其自研 S2.1 Pro 模型支持 83 种语言的文本转语音与多语种声音克隆,仅需 10 秒左右的清晰音频即可构建数字声纹,输出最高 48kHz 工作室级音质,并支持语速、音高与情感参数调节。
面向开发者,Fish Audio 提供低延迟 RESTful API 与多语言 SDK,采用按量计费;同时开源了 Fish Speech 模型(GitHub 累计 28k+ Star),支持 PyTorch / ONNX 导出与私有化部署,形成覆盖创作、无障碍与智能硬件的开发者生态。
核心功能一览
六大核心能力,覆盖创作全流程
10 秒声音克隆
上传或录制 10 秒音频即可生成自定义神经声纹,跨语种保留语气与音色。
83 种语言 TTS
S2.1 Pro 支持 83 种语言文本转语音与多语种配音,覆盖主流市场。
情感与参数控制
可调节语速、音高与情感矩阵,让语音更贴近真人表达。
工作室级音质
输出最高 48kHz 高清音频,内置降噪与响度均衡,减少后期处理。
开发者 API
提供低延迟 REST API 与 SDK,支持批量生成与私有化部署(Fish Speech 开源)。
零基础快速上手
4 步完成你的第一件 AI 作品,无需任何设计经验
注册并获取密钥
在 fish.audio 注册账号,于控制台创建 API Key 用于调用。
克隆声音
录制或上传 10 秒清晰音频,生成专属音色并命名保存。
输入文本合成
在 Web 或 App 输入文案,选择音色与语言,一键生成语音。
接入 API
用官方 SDK 或 REST 接口把语音合成与克隆集成进自己的应用。

常见问题解答
遇到问题?这里可能有你想要的答案
Fish Audio 免费吗?
提供免费额度供个人试用,商业用途需升级付费计划以获得商用授权。
支持哪些语言?
S2.1 Pro 支持 83 种语言,包括中、英、日、韩、西、法、德、俄、阿等主流语言。
同类对比
和同类工具横向对比,帮你选对工具。
| 对比维度 | Fish Audio | ElevenLabs | Murf |
|---|---|---|---|
| 克隆所需音频 | 约 10 秒 | 数分钟 | 数分钟 |
| 支持语言 | 83 种 | 29+ 种 | 20+ 种 |
| 开源模型 | Fish Speech 开源 | 否 | 否 |
| 价格定位 | 高性价比 | 偏高 | 中等 |
同类推荐工具
发现更多优质 AI 创作工具,找到最适合你的那一款
Deepgram
Deepgram 是用于实时与批量语音转写的开发者优先 STT API,Nova-3 模型实现亚 300ms 流式延迟、50+ 语言支持,并为语音智能体提供原生端点检测。
ElevenLabs
ElevenLabs 是领先的 AI 音频与语音平台,提供文本转语音、语音克隆、声音设计、音乐生成与语音转写,支持多语言 ,广泛应用于配音、有声书与客服语音智能体。
MiniMax
MiniMax 是 2021 年成立于上海的通用人工智能公司,自研覆盖文本、语音、视频、音乐的全模态模型,并推出海螺 AI(视频)、Talkie(角色对话)与开放平台 API,2026 年 1 月于港交所上市。
Suno
Suno 是领先的 AI 音乐生成平台,输入一段文字描述或歌词即可生成包含人声、旋律与完整编曲的歌曲,通常一分钟内出歌,支持 25+ 语言与分轨导出。