Compare · 横评对比
Cartesia vs Deepgram Aura:实时 TTS、语音管线与费用怎么选
Cartesia Sonic 适合 LLM 增量文本与中文实时语音;Deepgram Aura-2 适合其官方支持语种及已有 Deepgram STT 的管线。比较语言覆盖、WebSocket、打断控制和计费。
| 维度 | cartesia | deepgram-aura |
|---|---|---|
| 定位 | Sonic 实时 TTS,可配 Ink 与 Managed Agents | Aura TTS,可配 Deepgram STT |
| 接口 | bytes、SSE、WebSocket | REST 与 WebSocket |
| 增量输入 | context / continuation | WebSocket 文本输入与 Flush |
| 中断控制 | 取消 context 并清理客户端缓冲 | Clear 控制消息并清理客户端缓冲 |
| 公开价格 | Free 20K credits/月;Pro $5/月 100K | Aura-2 Pay As You Go $0.03/千字符 |
| 适合团队 | 优先打磨 LLM→语音交互层 | 已在 Deepgram 上做 STT 的团队 |
| 中文 TTS | Sonic 3.6 官方列出 zh | Aura-2 官方 TTS 语言列表目前不含中文 |
Cartesia 与 Deepgram Aura 都能把文字转成可流式播放的语音。若你只挑“说话层”,重点测声音、延迟、并发和价格;若你已经用 Deepgram 做转录,还要把整条 STT→LLM→TTS 管线的维护成本算进去。Deepgram 另有 Flux TTS,本文只比较 Aura-2;两者接口和计价不能混为一谈。
核心差异
Cartesia 的 Sonic 3.6 提供 WebSocket 增量文本、context 和 continuation,适合 LLM 的文本一段段到来时持续合成。Deepgram Aura-2 提供 REST 与 WebSocket,适合需要 REST 快速接入或在 Deepgram 生态内使用语音合成的团队。**但两者的语言覆盖差异很大:Cartesia Sonic 3.6 官方包含中文,Aura-2 当前官方 TTS 列表不含中文。中文语音合成项目不应把 Aura-2 当作可直接替换的候选。**Deepgram WebSocket 有 Flush 和 Clear 控制消息:前者处理缓冲中待生成文本,后者在用户打断时清理内部缓冲。Cartesia 则有 context 取消与 flush 机制。实际插话效果还取决于你是否停止本地播放器缓冲。
Cartesia 适合什么情况
Cartesia 的优势是同一个 WebSocket context 中连续送入文本并收音频,减少多句拼接时的停顿。Sonic 3.6 官方支持包括中文的 44 种语言;一支语音是否能自然朗读你的品牌名、金额和混合语句,要用自己的录音盲测。Cartesia 还可提供 Ink STT 和托管式 Agent,但本比较只把 TTS 算作必需能力。
Deepgram Aura 适合什么情况
Deepgram Aura-2 的官方资料强调实时交互和企业应用,可通过 REST 或 WebSocket 使用。若你的产品已经在 Deepgram 上做识别,供应商、账单与监控可能更容易集中。Aura-2 对日期、金额等格式化文本的读法也有官方指导;上线时应先对输入文本做标点、缩写和敏感数据处理。官方当前列出的 Aura-2 TTS 语言为英语、西班牙语、德语、法语、荷兰语、意大利语和日语;Deepgram STT 支持中文,不能据此推断 Aura-2 也能合成中文。Deepgram 的 Flux TTS 另有 v2 Speak WebSocket;照抄 Flux 的示例调用 Aura 会失败。
价格与计费
截至 2026 年 10 月 6 日,Cartesia 官网列出 Free 每月 2 万 credits、Pro 每月 5 美元含 10 万 credits,TTS 用量按 credits 消耗。Deepgram 价格页列 Aura-2 Pay As You Go 为每千字符 0.03 美元,并提供初始试用额度。两种单位不同,不应按单价做“绝对便宜”结论。用同一批文本统计实际字符、输出、失败重试、并发和电话链路,再计算每次成功会话费用。
落地检查
分别测完整文本 HTTP 流和 LLM 增量文本 WebSocket;固定样本、区域、音频格式和播放器缓冲。做中文服务时,先依据语言支持排除 Aura-2;比较受支持语言时,再准备 30 条同语种客服话术,包含订单号、金额、地址、人名、时间和用户插话。记录首可播放音频时间、整句完成、字词错误、打断后多播时间、连接失败和账单。生产环境的 API key 留在服务端,日志与语音数据按隐私政策保留。
结论
LLM 增量输出是关键路径,优先测 Cartesia。已有 Deepgram STT、希望让语音识别和合成共享平台,优先测 Aura-2。若目标语言是中文,当前应选支持中文的 TTS 候选,Aura-2 不在其中;若目标语言受两者支持,再做真实链路和同语种盲听。
官方资料
结论
中文语音合成需求,Cartesia Sonic 3.6 在两者中是有明确官方支持的选项,Aura-2 当前未列中文 TTS。若目标是 Aura-2 支持的语言且已有 Deepgram STT,再按真实链路和完整费用比较。
常见问题
- Deepgram Aura-2 和 Flux TTS 是同一个模型吗?
- 不是。两者的接口、示例和价格不同;本文只比较 Aura-2。
- Deepgram Aura-2 能用 WebSocket 吗?
- 能。官方文档列出 Aura 的流式 WebSocket 能力和 Flush、Clear 等控制消息。
- Cartesia Sonic 3.6 支持中文吗?
- 支持,官方语言表包含 zh。Deepgram Aura-2 当前官方 TTS 语言列表未列中文,因此不能把它当作中文合成备选。
- 用户插话后,服务端 Clear 就够了吗?
- 不够。服务端停止新音频之外,还要清理播放器或电话网关里已排队的音频。
- 哪一家更便宜?
- 两者计费单位不同。把同一批文本的字符、credits、失败重试和通话链路计入,才能比较每次成功会话成本。
- 已有 Deepgram STT 是否必须选 Aura?
- 不必。统一供应商能减少部分运维和采购复杂度,但声音效果和延迟仍要和 Cartesia 同场测试。