Cartesia 介绍
了解工具的详细功能和使用方法
Cartesia 是面向开发者的实时语音平台,核心能力包括 Sonic 文本转语音、Ink 语音转文字,以及托管式语音 Agent。若你的产品需要把 LLM 逐段生成的文本立即播给用户,Cartesia 的 WebSocket TTS 比“等全文完成再生成音频”更贴合场景。
适合谁
- 正在开发电话客服、语音助手、直播互动或应用内语音回复的团队。
- 需要把 LLM 增量文本送入 TTS,并逐块接收音频的开发者。
- 要对中文、英文等多语言语音做同一套上线验收的产品团队。
主要能力
Sonic 3.6 是当前稳定型号,官方文档列出 44 种语言,包括中文。WebSocket 可复用连接、保留 context,并持续接收音频块;HTTP bytes 适合全文已知的单次生成,SSE 可在 HTTP 场景携带时间戳。不要把供应商宣称的模型延迟直接写成用户听到声音的端到端延迟:网络、文本分块、播放器缓冲和电话链路都会增加等待时间。
Cartesia 也提供 Ink 2 实时转录与 Managed Agents。后者把转录、LLM、合成、轮次控制等组合起来,但并不意味着所有现有客服系统能零改造接入。选型时先确定自己只需要 TTS,还是需要整条语音 Agent 管线。
价格与限制
截至 2026 年 10 月 6 日,官网显示 Free 每月 2 万 credits;Pro 每月 5 美元、10 万 credits;Startup 每月 49 美元、125 万 credits;Scale 每月 299 美元、800 万 credits。语音模型 credits 与 Managed Agents 预付金额是不同额度。官网把商业使用许可列在 Pro 及以上;免费档适合技术试验,商业用途先复核条款。语音克隆涉及声音权利与授权,不要上传未经许可的录音。
上线建议
用同一批中文数字、姓名、地名、英文缩写和静音/中断样本测 Cartesia、ElevenLabs 与 Deepgram。分别记录首音频时间、端到端可听延迟、漏读率、发音一致性、并发拒绝率和每千字实际账单。把 API key 留在服务端;浏览器接入应使用官方建议的短期访问令牌。对用户清楚说明声音由 AI 生成。