关于 Deepgram
为实时而生的高精度语音转写
Deepgram 是一家以「最快的生产级流式语音转写」为核心能力的公司。与后期改造为流式的批处理模型不同,Deepgram 的 API 从设计之初就面向实时:通过 WebSocket 持续推送音频块、回传部分与最终文本,端到端延迟低于 300ms(人类对话延迟感知阈值)。
2026 年旗舰模型 Nova-3 在真实流式音频上的词错误率约 6.8%,支持 45+ 语言,并提供说话人分离、智能格式化与关键术语提示;面向语音智能体单独推出的 Flux 模型把「端点检测」直接融入语音模型,用语义与节奏判断用户是否说完,而非单纯依赖静音。新账户提供 $200 免费额度。
核心功能一览
六大核心能力,覆盖创作全流程
Nova-3 高精度
流式 WER 约 6.8%,在噪声、口音、电话音频下稳健,支持 50+ 语言与行业微调。
实时流式 API
WebSocket 推送音频、亚 300ms 回传文本,适合语音智能体与实时字幕。
Flux 语音智能体模型
模型内建端点检测与打断处理,10 种语言可中途切换,无需单独 VAD。
说话人分离与格式化
自动标点、数字规整、PII 脱敏与多说话人标注,输出即可读可用。
灵活部署
支持云端、私有云与本地部署,医疗/法律等行业可定制专用模型。
零基础快速上手
4 步完成你的第一件 AI 作品,无需任何设计经验
注册账户
在 deepgram.com 注册,新账户可领取 $200 免费转录额度。
获取 API Key
在控制台创建 API Key,妥善保管用于鉴权。
实时转录
用 WebSocket 持续推送音频流,接收部分与最终转写结果。
构建语音智能体
切换到 Flux 模型,利用内建 端点检测实现自然打断的语音对话。

常见问题解答
遇到问题?这里可能有你想要的答案
Deepgram 免费吗?
新账户赠送 $200 免费额度用于构建原型;之后按音频分钟数计费,Nova-3 流式约 $0.0077/分钟。
和 Whisper 怎么选?
需要真低延迟实时转写或语音智能体端点检测时,Deepgram 更省事;若追求自建与数据不出内网,Whisper 自托管更合适。
支持中文吗?
支持,Nova-3 覆盖 45+ 语言含中文,并提供自动语言检测与多语种混合识别。
同类对比
和同类工具横向对比,帮你选对工具。
| 对比维度 | Deepgram | OpenAI Whisper | AssemblyAI |
|---|---|---|---|
| 定位 | 实时优先托管 API | 开源+API | 语音智能体优先 |
| 实时延迟 | <300ms | 需另接 Realtime API | 约 300ms |
| 说话人分离 | 是 | 原生不支持 | 是(付费档) |
| 端点检测 | Flux 内建 | 否 | Universal-Streaming 内建 |
| 免费额度 | $200 | 有限 | 有 |
同类推荐工具
发现更多优质 AI 创作工具,找到最适合你的那一款
ElevenLabs
ElevenLabs 是领先的 AI 音频与语音平台,提供文本转语音、语音克隆、声音设计、音乐生成与语音转写,支持多语言,广泛应用于配音、有声书与客服语音智能体。
Fish Audio
Fish Audio 是支持情感可控的实时 AI 语音合成与声音克隆平台,仅需 10 秒音频即可克隆音 色,支持 83 种语言、48kHz 工作室级输出,并开放开源模型 Fish Speech 与开发者 API。
MiniMax
MiniMax 是 2021 年成立于上海的通用人工智能公司,自研覆盖文本、语音、视频、音乐的全模态模型,并推出海螺 AI(视频)、Talkie(角色对话)与开放平台 API,2026 年 1 月于港交所上市。
Suno
Suno 是领先的 AI 音乐生成平台,输入一段文字描述或歌词即可生成包含人声、旋律与完整编曲的歌曲,通常一分钟内出歌,支持 25+ 语言与分轨导出。