如何在2026年构建你自己的AI通话平台
完整的堆栈指南——LLM、STT、TTS 以及大多数教程都会忽略的载波层。
2024年,人工智能打电话还是一件新鲜事。到2026年,这将成为标准的商业基础设施。 AI通话 平台处理来电支持、筛选潜在客户、预约、收款和开展外呼活动——所有这些都无需人工客服在线。
大多数企业都会从 Vapi、Bland AI 或 Retell 等平台购买现成的此类功能。但越来越多的公司——包括代理商、电信经销商、SaaS 开发商以及呼叫量大的企业——正在自行构建此类功能。为什么?
- 成本。 规模化运营时,托管平台的全包费用为每分钟 0.07 美元至 0.15 美元。如果自行搭建技术栈,同样的通话费用则为 0.02 美元至 0.04 美元。
- 控制。 您可以选择每个组件——LLM、语音、电话、路由逻辑。
- 竞争优势。 您的呼叫基础设施将成为您的专属护城河,而不是每个竞争对手都可以购买的商品服务。
本指南将详细介绍整个架构:每一层的作用、要使用的工具、它们如何连接,以及——至关重要的是——大多数教程都会忽略的运营商基础设施层,而这一层决定了您的平台是否能够大规模运行。
每个AI通话平台的四个层次
选择工具之前,先了解工具堆栈。 AI通话 平台——无论是你自己搭建的还是购买的——都是由四个按顺序运作的层组成的:
Caller's phone
│
▼
[Layer 1] Telephony / Carrier
│ SIP trunk, PSTN gateway, DID numbers
▼
[Layer 2] Speech-to-Text (STT)
│ Transcribes caller audio in real time
▼
[Layer 3] LLM (Large Language Model)
│ Understands intent, decides response
▼
[Layer 4] Text-to-Speech (TTS)
│ Converts response to natural voice audioT
│
▼
Back to caller
音频双向持续传输。呼叫者说话 → 语音转语音 (STT) 转录 → 语音语言管理 (LLM) 生成回复 → 文本转语音 (TTS) 合成音频 → 呼叫者听到回复。您的服务器实时协调所有四个层级。端到端目标:从“呼叫者停止说话”到“客服人员开始说话”的时间间隔小于 800 毫秒。超过 1,000 毫秒,呼叫者会认为连接已断开。
让我们一层一层地搭建起来。
第一层:电话通信——每个人都低估的基础
这是大多数教程都会匆匆略过,只用“使用”一词带过的部分。 Twilio然后继续。这一层还决定了你的每分钟费用、音频质量,以及你的AI代理听起来是自然还是机械。
这一层的作用:
- 接收来自真实电话号码(PSTN)的来电
- 将呼出电话路由到任何目的地
- 通过 WebSocket 或 SIP 将音频流传输到您的服务器
- 提供来电者拨打的电话号码
你有两个选择:
方案 A — 托管电话服务(例如 Twilio)
设置快捷。按零售CPaaS费率计费(每分钟0.013美元起,外呼费另加平台费)。非常适合原型设计和小批量使用。但如果每月通话时长超过100,000万分钟,成本将迅速累积。
选项 B — 直接 SIP 中继(推荐用于生产环境)
将您的平台直接连接到批发 SIP 终端提供商。更低的每分钟费率,完全掌控路由,无平台加价。配置仅需 10 分钟。规模化部署可节省 30%–60% 的费用。
对于生产环境构建,推荐使用 IDT Express 作为载体层。
IDT Express是一家批发语音终端服务提供商,隶属于IDT公司(纽约证券交易所代码:IDT)——全球最大的批发语音运营商之一,拥有超过25年的运营商基础设施经验。 SIP中继 和 语音终止 给你 AI通话 平台:
- 白金路线 — G.711 无压缩音频,拨号后延迟小于 3 秒,专为 AI 语音代理工作负载优化,其中编解码器质量直接影响 STT 准确性。
- 1,000 多个 CLI 路由 覆盖 200 多个国家/地区——您的平台从第一天起即可在全球范围内拨打和接听电话
- DID号码 在140多个国家/地区 — 通过 API 立即为您的代理商提供任何市场的真实本地电话号码
- 弹性并发 — 无需预先配置,即可扩展到 10 到 10,000 多个并发呼叫
- 搅拌/摇动 签 外拨电话均带有 A 级认证签名,可防止被标记为垃圾电话,从而避免降低接听率
SIP 配置(适用于任何 SIP 兼容框架):
SIP Server: sip.idtexpress.com
Transport: TLS (recommended) or UDP
Codec: G.711 ulaw (PCMU) — critical for AI workloads
Authentication: Digest auth with your IDT Express credentials
DTMF: RFC 2833代码语言: 的CSS (CSS)免费获取您的 SIP 凭证 idtexpress.com/sign-up注册后即可立即获得证书——无需销售电话。
第二层:语音转文字——聆听来电者的声音
STT 层将通话者的音频转换为 LLM 可以处理的文本。对于基于电话的 AI 通话而言,这比听起来要难得多——电话音频以 8kHz mulaw 格式运行,而不是大多数音频工具所期望的 16kHz PCM 格式。
电话STT的关键要求:
- 原生支持 8kHz mulaw(无重采样步骤 = 更低延迟)
- 实时转录(逐字逐句地记录通话者说话的内容,而不是在通话结束后记录)
- 中位延迟低于 300 毫秒
- 字母数字字符的准确性——电话号码、确认码、电子邮件地址
- 抗噪能力——电话线路存在背景噪声和压缩伪影
推荐选项:
| Provider | 延迟 | 最适合 |
|---|---|---|
| Deepgram Nova-2 | 约200毫秒 | 生产效率高,性价比最佳 |
| AssemblyAI Universal-3 | 约307毫秒 | 字母数字准确率最高 |
| OpenAI Whisper(托管) | 约400毫秒 | 通用性强,易于集成 |
| Google STT 流媒体 | 约250毫秒 | 多语言企业 |
对于大多数 AI 通话平台而言,Deepgram Nova-2 是默认选择——它原生支持 8kHz mulaw,提供约 200ms P50 延迟,并且对通话者通过电话共享的结构化数据(号码、代码、地址)具有极佳的准确性。
快速集成(Python、Deepgram):
import deepgram
dg_client = deepgram.Deepgram(DEEPGRAM_API_KEY)
async def transcribe_stream(audio_stream):
response = await dg_client.transcription.live({
'encoding': 'mulaw',
'sample_rate': 8000,
'model': 'nova-2',
'interim_results': True,
'endpointing': 300,
})
# Send audio chunks as they arrive from your SIP/WebSocket layer
async for chunk in audio_stream:
response.send(chunk)
代码语言: Python
(蟒蛇)第三层:LLM大脑——克劳德的AI呼叫
LLM 接收呼叫者的转录文本,保持对话上下文,决定接下来要说什么,并可选择性地调用外部工具(您的 CRM、日历、支付系统)。
为什么选择 Claude 进行人工智能呼叫:
Claude(Anthropic)由于以下几个与通话用例相关的特定原因,已成为语音代理 LLM 的一个强有力的选择:
- 遵循指令 克劳德能够可靠地遵循复杂的系统提示,这些提示定义了客服人员的角色、通话流程、升级规则和工具使用方法。在通话过程中,客服人员“脱稿”是一个严重的问题。克劳德的指令执行能力堪称一流。
- 简明回答 — 如果得到正确的提示,Claude 倾向于给出更简短、更口语化的回答——这对于语音来说至关重要,因为冗长的回答会让人感觉不自然,并增加 TTS 延迟。
- 工具使用 — Claude 的函数调用(工具使用 API)可处理实时查找 — 检查日历可用性、查询 CRM 记录、验证订单状态 — 可靠且 JSON 格式正确。
- 多轮对话背景 — 在整个通话过程中保持对话上下文的连贯性,不会“忘记”之前的交流。
呼叫模型选择:
- 克劳德·俳句 — 延迟最低(约 150 毫秒),最适合简单的入站流程(常见问题解答、路由、预约确认)
- 克劳德十四行诗 — 兼顾延迟和推理,最适合大多数通话场景
- 克劳德·奥普斯 — 最高推理质量,仅在通话复杂程度需要时使用(复杂销售、谈判)
呼叫代理的系统提示结构:
You are [Agent Name], a [role] for [Company].
PERSONALITY: [tone, style — e.g., "professional but warm, concise"]
YOUR GOAL: [primary objective — e.g., "qualify inbound leads and book a demo"]
CALL FLOW:
1. Greet caller by name if available
2. Identify their need in one open question
3. [flow logic...]
4. If you cannot resolve: transfer to human agent
RULES:
- Keep all responses under 3 sentences
- Never fabricate information — if unsure, say so
- Always confirm before taking any action (booking, updating records)
- End the call professionally if the caller asks to stop
TOOLS AVAILABLE:
- check_calendar(date, time) → returns availability
- create_booking(name, email, date, time) → books appointment
- lookup_customer(phone_number) → returns CRM record代码语言: 的CSS (CSS)第四层:文本转语音——您的代理人的声音
TTS层将克劳德的文本回复转换成自然流畅的音频,并传递给呼叫者。语音质量直接影响呼叫者是否信任并与您的客服人员互动。
关键要求:
- 流媒体 TTS(在生成完整响应之前开始播放——可减少约 40% 的延迟)
- 低延迟首字节生成(<300毫秒)
- 自然韵律——停顿、重音、节奏
- 电话兼容输出(8kHz 或可转换)
推荐选项:
| Provider | 语音质量 | 延迟 | 最适合 |
|---|---|---|---|
| 十一实验室 | 最高 | 约250毫秒 | 面向客户的优质产品 |
| 笛卡尔 | (卓越)等级 | 约100毫秒 | 延迟敏感呼叫 |
| OpenAI 文本转语音 | 非常好 | 约300毫秒 | 易于集成,一致性 |
| Azure 神经文本转语音 | 非常好 | 约200毫秒 | 企业级、多语言 |
对于 AI 通话平台而言,Cartesia 之所以获得关注,正是因为其首字节延迟低于 100 毫秒——当需要客服人员在处理后立即开始说话时,这一点至关重要。
编曲:连接四个层次
您的服务器是编排层——即在电话系统和您的 AI 流水线之间路由音频的 WebSocket 桥梁。主要有两个框架:
Pipecat(开源,推荐)
from pipecat.pipeline.pipeline import Pipeline
from pipecat.services.deepgram import DeepgramSTTService
from pipecat.services.anthropic import AnthropicLLMService
from pipecat.services.cartesia import CartesiaTTSService
from pipecat.transports.network.fastapi_websocket import FastAPIWebsocketTransport
async def run_agent(websocket):
transport = FastAPIWebsocketTransport(websocket)
pipeline = Pipeline([
transport.input(), # Audio in from SIP/WebSocket
DeepgramSTTService(), # Speech to text
AnthropicLLMService( # Claude LLM
model="claude-sonnet-4-20250514",
system=SYSTEM_PROMPT
),
CartesiaTTSService(), # Text to speech
transport.output() # Audio out to caller
])
await pipeline.run()代码语言: Python
(蟒蛇)LiveKit Agents(开源,适用于更大规模应用) 当您需要同时处理数千个基于 WebRTC 和 SIP 的并发呼叫时,这是最佳选择。虽然基础设施开销较大,但并发管理能力显著提升。
整合起来:完整的架构
Caller dials DID number (IDT Express)
│
▼
IDT Express SIP Trunk
(G.711 audio, Platinum route)
│
▼
Your SIP Gateway / WebSocket Server
(Pipecat or LiveKit orchestration)
│ │
▼ ▼
Deepgram STT Cartesia TTS
(transcribe) (synthesise)
│ ▲
▼ │
Claude Sonnet (Anthropic)
(understand + decide + respond)
│
▼
Tool calls (CRM, calendar, payments)端到端延迟预算(目标:低于 800 毫秒):
- 电话到服务器延迟:约 50 毫秒(IDT 白金级路由)
- STT(Deepgram):约200毫秒
- LLM(克劳德·索内特):约200毫秒
- TTS 第一个字节(笛卡尔):~100ms
- 服务器到电话系统:约 50 毫秒
- 总计:约 600 毫秒 ✓
扩展您的平台
一旦您的单代理概念验证成功,扩展就需要:
并发调用: 每个呼叫都在其自身的进程/容器中运行。IDT Express SIP 中继具有弹性,无需预先配置。您可以扩展计算资源(而非运营商资源)来应对突发流量。
全球范围: IDT快递 DID号码 覆盖 140 多个国家/地区,这意味着您的平台无需与每个国家/地区的运营商单独建立合作关系,即可在任何市场接受本地通话。一个账户,一个 API,全球覆盖。
规模化成本优化:
- 对于简单的呼叫类型,请使用 Claude Haiku(与 Sonnet 相比,LLM 成本可节省约 70%)。
- IDT Express 即时路线,适用于外呼批量营销活动(最低每分钟费率)
- IDT Express Platinum 为面向客户的来电提供服务(质量对客户留存至关重要)
- 缓存常用短语(问候语、等待音乐)的文本转语音 (TTS) 代码——可节省约 15% 的 TTS 成本。
搅拌/摇晃: 所有通过 IDT Express 拨出的电话都会自动进行 STIR/SHAKEN 签名。对于 AI 呼叫平台而言,这一点至关重要——未经签名的呼叫越来越容易被主流运营商标记为垃圾电话,这会在您的客服人员开口之前就严重影响您的外呼接听率。
入门指南:您的堆栈清单
| 元件 | 推荐工具 | 是时候开始布置了 |
|---|---|---|
| 载体 / SIP中继 | IDT快递 | 10分钟 |
| DID号码 | IDT快递 | 通过 API 即时 |
| STT | Deepgram Nova-2 | 15分钟 |
| LLM | 克劳德·索内特(人格API) | 10分钟 |
| TTS | Cartesia 或 ElevenLabs | 15分钟 |
| 编曲配置 | 派普卡特 | 30分钟 |
| 下文 | AWS/GCP + Docker | 1-2小时 |
合理的时间线:
- 概念验证工作:1-2天
- 单次使用生产代理:1-2 周
- 具备分析功能的完整多用例平台:4-8 周
常見問題解答
问:我没有编程经验,可以搭建一个AI通话平台吗? 答:就这里描述的基础设施层面而言,实际上不太可能。对于无代码方案,Vapi、Bland AI 和 Synthflow 都是专门构建的托管平台。如果您想自行构建并拥有开发团队,本指南涵盖了您所需的一切。
问:为什么音频编解码器对人工智能通话很重要? 答:AI语音转文本引擎在G.711未压缩音频上的性能明显优于G.729压缩音频。压缩编解码器会引入失真,导致转录准确率降低高达15%,从而降低LLM的输入质量,并产生更差的客服响应。IDT Express Platinum默认使用G.711编码。
问:我的AI呼叫平台如何获取电话号码? 答:IDT Express 在 140 多个国家/地区提供 DID(直接拨入)号码,可通过 API 进行配置。号码即时激活。您可以将它们分配给呼入流程、分配给特定的 AI 客服人员,或用于呼出来电显示。
问:我的AI呼叫平台是否需要符合STIR/SHAKEN标准? 答:是的,美国境内拨出电话需要进行STIR/SHAKEN签名。根据FCC规定,所有拨出电话都必须进行STIR/SHAKEN签名。IDT Express会自动处理此项签名——所有拨出流量均以A级认证进行签名。不符合规定的拨出电话越来越多地被各大运营商标记为“疑似垃圾电话”。
下一步
如果您准备好开始建造:
- 创建免费的 IDT Express 帐户 — 获取您的 SIP 凭证和 25 美元免费额度。只需 60 秒。
- 注册 Anthropic API 访问权限 — 您的 Claude API 密钥可立即在 console.anthropic.com 获取。
- 安装 Pipecat — 使用 pip 安装 pipecat-ai 并运行快速入门指南
- 拨打你的第一个人工智能电话 — 一天之内即可完成一个可行的概念验证
对于运营商层——将你的人工智能连接到真实手机网络的底层基础设施—— IDT Express语音终止 和 SIP中继 专为 AI 语音工作负载而设计:包括 G.711 音频、弹性并发、全球 DID 号码和 STIR/SHAKEN 合规性。


