Deepgram(深度语法)深度评测:2025年AI语音识别与实时转录的智能引擎使用教程:从入门到精通
从选型到落地的可执行指南,适合个人与团队快速上手。
教程正文
从选型到落地的实战步骤。
一、Deepgram 是什么?为什么选择它?
Deepgram 是一款基于深度学习的语音识别与实时转录平台,专为高精度、低延迟场景设计。与传统的语音转文字工具不同,Deepgram 原生支持 端到端神经网络,无需中间声学模型,因此能处理嘈杂环境、多说话人、俚语和专业术语。2025 年最新版本已支持 30+ 语言,实时转录延迟低于 300ms,准确率高达 98% 以上。

本教程将带你从注册账号开始,一步步实现实时录音转录、音频文件批量处理,并分享开发者常用的进阶技巧。
二、注册与获取 API 密钥
2.1 创建账户
- 访问 Deepgram Console,点击 Get Started。
- 支持 Google / GitHub 快速登录,或使用邮箱注册。
- 首次用户自动进入 Free Tier(每月 $200 免费额度,约 20 小时音频)。
2.2 获取 API Key
- 登录后,左侧导航栏选择 API Keys。
- 点击 Create New Key,建议为不同项目分别命名(如
webrtc-demo)。 - 复制生成的密钥(格式类似
xxxxxxxxxxxxxxxxxxxx),请妥善保管。

DEEPGRAM_API_KEY 加载。三、快速上手:Python 实时转录
3.1 安装 SDK
Deepgram 提供官方 Python、Node.js、Go、Java 等 SDK。以 Python 为例:
pip install deepgram-sdk pyaudio # pyaudio 用于麦克风输入
3.2 编写实时转录脚本
以下脚本从麦克风实时采集音频并流式传输到 Deepgram:
import asyncio
import pyaudio
from deepgram import Deepgram
DEEPGRAM_API_KEY = 'YOUR_API_KEY' # 替换为你的密钥
def callback(data):
"""处理转录结果"""
print(f"转录: {data['channel']['alternatives'][0]['transcript']}")
async def transcribe_microphone():
dg = Deepgram(DEEPGRAM_API_KEY)
# 配置参数:语言中文,启用实时标点
config = {
'language': 'zh-CN',
'punctuate': True,
'encoding': 'linear16',
'sample_rate': 16000,
'channels': 1
}
connection = await dg.transcription.live(config)
connection.on('transcriptReceived', callback)
# 打开麦克风采
p = pyaudio.PyAudio()
stream = p.open(format=pyaudio.paInt16,
channels=1,
rate=16000,
input=True,
frames_per_buffer=4096)
print("🎤 正在录音,按 Ctrl+C 停止...")
try:
while True:
data = stream.read(4096)
await connection.send(data)
except KeyboardInterrupt:
print("\n⏹ 停止录音")
finally:
stream.close()
p.terminate()
await connection.finish()
if __name__ == '__main__':
asyncio.run(transcribe_microphone())

3.3 运行测试
- 保存脚本为
live_transcribe.py。 - 在终端执行
python live_transcribe.py。 - 对着麦克风说话,你将看到逐词实时打印的文本,延迟极低。
'diarize': True,Deepgram 会自动标记说话人标签(Speaker 0、Speaker 1)。四、批量转录音频文件(非实时)
对于已录制的音频(MP3 / WAV / FLAC 等),使用 REST API 更高效。
4.1 上传并转录
import requests
API_KEY = 'YOUR_API_KEY'
URL = 'https://api.deepgram.com/v1/listen?language=zh-CN&punctuate=true'
headers = {
'Authorization': f'Token {API_KEY}',
'Content-Type': 'audio/wav'
}
with open('meeting.wav', 'rb') as f:
response = requests.post(URL, headers=headers, data=f)
result = response.json()
transcript = result['results']['channels'][0]['alternatives'][0]['transcript']
print(transcript)
你也可以直接传入可公开访问的 URL:
response = requests.post(
'https://api.deepgram.com/v1/listen',
headers={'Authorization': f'Token {API_KEY}'},
json={'url': 'https://example.com/audio.mp3'}
)
4.2 获取时间戳与置信度
转录结果中包含每个词的起止时间和置信度,可用于字幕生成:
words = result['results']['channels'][0]['alternatives'][0]['words']
for w in words:
print(f"{w['word']}: {w['start']:.2f}s - {w['end']:.2f}s (置信度 {w['confidence']:.2%})")
五、进阶功能与实战技巧
5.1 自定义词汇提升专业术语准确率
在 API 请求中加入 keywords 参数:
'https://api.deepgram.com/v1/listen?keywords=深度学习&keywords=神经网络&keywords=Transformer'
Deepgram 会将这些词作为候选,提升在特定领域的识别率。
5.2 语言自动检测
如果不确定音频语言,使用 language=multi 开启自动检测,Deepgram 会返回检测到的语言代码:
'https://api.deepgram.com/v1/listen?language=multi'
5.3 利用 WebSocket 实现低延迟实时字幕
对于直播、会议场景,建议使用 WebSocket 协议:
const { createClient } = require('@deepgram/sdk');
const deepgram = createClient('YOUR_API_KEY');
const connection = deepgram.transcription.live({
language: 'zh-CN',
encoding: 'linear16',
sample_rate: 16000,
model: 'nova-2' // 2025年最新模型
});
connection.on('transcriptReceived', (data) => {
const transcript = JSON.parse(data).channel.alternatives[0].transcript;
console.log(transcript);
});
5.4 回调通知与结果存储
在预处理(Pre-Recorded)请求中添加 callback 参数,Deepgram 会在转录完成后 POST 结果到你的服务器:
'https://api.deepgram.com/v1/listen?callback=https://your-server.com/webhook'
六、常见问题与排错
| 问题 | 解决方案 |
|---|---|
| API 返回 403 | 检查 API Key 是否正确,或是否超出免费额度 |
| 转录结果空白 | 确认音频采样率为 16000Hz,编码为 LINEAR16 |
| 延迟过高 | 使用 WebSocket 而非 HTTP;选择就近区域(us-east / eu-west) |
七、总结
Deepgram 以其超低延迟、高准确度和灵活的 API 成为 2025 年 AI 语音识别的标杆。无论是构建语音助手、自动生成字幕,还是分析客服录音,Deepgram 都能轻松胜任。你可以结合 Nova-2 模型 和 自定义词汇 获得最佳效果。现在就去 控制台 免费试用吧!
相关教程推荐
继续学习相关主题。
CodeGeeX(科德吉克斯)深度评测:2025年免费开源AI编程助手,智能代码补全与多语言革命使用教程:从入门到精通
全面评测2025年免费开源AI编程助手CodeGeeX,涵盖安装配置、代码补全、Chat对话、代码翻译、离线模式等实操技巧,助你快速提升编码效率。
文心一言(Wenxin Yiyan)深度评测:2025年国产多模态大语言模型的智能对话与全能助手革命使用教程:从入门到精通
从注册、基础对话到多模态创作、代码辅助与自定义模板,手把手教你玩转2025版文心一言,涵盖实用技巧和常见问题解答,适合所有水平的AI使用者。
Claude(克劳德)深度评测:2025年Anthropic打造的多模态AI聊天机器人的智能对话与创作引擎使用教程:从入门到精通
全面评测Claude 2025版,从注册登录到多模态分析、创作引擎及高级技巧,帮助初学者快速上手并精通这款AI聊天机器人。
Kagi(卡吉AI)深度评测:2025年以人为本的AI搜索引擎,隐私优先与智能聚合革命使用教程:从入门到精通
2025年最值得尝试的AI搜索引擎Kagi使用教程:从注册、隐私设置到AI摘要、Universal Search进阶玩法,附实操截图与技巧,打造无广告、零追踪的智能搜索体验。