Deepgram

Deepgram

语音转写 API

Deepgram

Deepgram 从一开始就是为流式语音转写而生的托管 STT API,Nova-3 在嘈杂、带口音或重叠语音下仍保持高精度,Flux 模型原生处理语音智能体的端点检测。

<300ms
流式转录延迟
50+
支持语言
$0.0077
流式每分钟价格

免费试用 · 无需下载即可在线体验

关于 Deepgram

为实时而生的高精度语音转写

Deepgram 是一家以「最快的生产级流式语音转写」为核心能力的公司。与后期改造为流式的批处理模型不同,Deepgram 的 API 从设计之初就面向实时:通过 WebSocket 持续推送音频块、回传部分与最终文本,端到端延迟低于 300ms(人类对话延迟感知阈值)。

2026 年旗舰模型 Nova-3 在真实流式音频上的词错误率约 6.8%,支持 45+ 语言,并提供说话人分离、智能格式化与关键术语提示;面向语音智能体单独推出的 Flux 模型把「端点检测」直接融入语音模型,用语义与节奏判断用户是否说完,而非单纯依赖静音。新账户提供 $200 免费额度。

核心功能一览

六大核心能力,覆盖创作全流程

🎯

Nova-3 高精度

流式 WER 约 6.8%,在噪声、口音、电话音频下稳健,支持 50+ 语言与行业微调。

实时流式 API

WebSocket 推送音频、亚 300ms 回传文本,适合语音智能体与实时字幕。

🤖

Flux 语音智能体模型

模型内建端点检测与打断处理,10 种语言可中途切换,无需单独 VAD。

👥

说话人分离与格式化

自动标点、数字规整、PII 脱敏与多说话人标注,输出即可读可用。

🔐

灵活部署

支持云端、私有云与本地部署,医疗/法律等行业可定制专用模型。

零基础快速上手

4 步完成你的第一件 AI 作品,无需任何设计经验

1

注册账户

在 deepgram.com 注册,新账户可领取 $200 免费转录额度。

2

获取 API Key

在控制台创建 API Key,妥善保管用于鉴权。

3

实时转录

用 WebSocket 持续推送音频流,接收部分与最终转写结果。

4

构建语音智能体

切换到 Flux 模型,利用内建端点检测实现自然打断的语音对话。

全平台客户端下载

支持网页端、桌面端、移动端及浏览器插件,随时随地开启创作

使用入口

官网与控制台
注册、额度与控制台
下载
API 文档
REST / WebSocket 文档与示例
下载
官方 SDK
Python / Node / Go 官方 SDK
网页可用
Playground 演示
浏览器内试用转写
下载
SpeedAIAD

常见问题解答

遇到问题?这里可能有你想要的答案

1

Deepgram 免费吗?

新账户赠送 $200 免费额度用于构建原型;之后按音频分钟数计费,Nova-3 流式约 $0.0077/分钟。

2

和 Whisper 怎么选?

需要真低延迟实时转写或语音智能体端点检测时,Deepgram 更省事;若追求自建与数据不出内网,Whisper 自托管更合适。

3

支持中文吗?

支持,Nova-3 覆盖 45+ 语言含中文,并提供自动语言检测与多语种混合识别。

同类对比

和同类工具横向对比,帮你选对工具。

对比维度DeepgramOpenAI WhisperAssemblyAI
定位实时优先托管 API开源+API语音智能体优先
实时延迟<300ms需另接 Realtime API约 300ms
说话人分离原生不支持是(付费档)
端点检测Flux 内建Universal-Streaming 内建
免费额度$200有限