纽约证券交易所:IDT
使用 IDT Express 保持领先
产品

了解我们的产品如何彻底改变您的沟通和协作方式。

声乐

探索我们旨在优化您的通信工作流程的先进语音解决方案。

多种 DID 号码解决方案旨在增强您的通信能力。

通过我们先进的 SIP 中继解决方案体验无与伦比的通信效率。

尖端技术可主动检测并消除 DID 号码上的垃圾邮件标记。

让您的客户能够通过拨打免费电话号码与您的企业联系。

人工智能语音代理可以随时随地自动处理电话、获取销售线索和提供客户支持。

无论您的受众身在何处,我们的平台都能确保跨不同渠道的无缝消息传递。

通过促进交互式对话来构建客户旅程,所有这些都在您的应用程序框架内进行。 

通过我们先进的短信平台以简单有效的方式与您的受众联系。 

BYOC

充分利用 IDT 作为您选择的运营商的力量,同时利用您平台的高级功能和服务。

将 Twilio 与我们强大的运营商路由平台集成,以实现无与伦比的语音终止系统。

体验可靠且高质量的通信服务,同时利用 Genesys 的先进功能。 

将 IDT 与 MS Teams 的协作优势相集成,实现高效且功能丰富的通信。 

通过我们先进的 BYOC 解决方案体验与 Plivo 无缝连接的运营商网络的强大功能。 

工具

体验我们旨在简化通信管理的在线语音工具的强大功能。 

使用我们的 STIR/SHAKEN 验证检查工具确保外拨电话的真实性和完整性。 

用户友好的工具,用于验证您的企业号码的声誉,确保其保持可信。 

比较并深入了解外拨费用、优化预算并做出明智的决策。 

轻松估算和比较与不同 DID 号码提供商相关的成本。 

比较顶级 CPaaS 提供商的入站 VoIP 费率并优化您的入站呼叫成本。 

生成自定义短信模板。 

相关资源

为自己提供在动态的沟通环境中蓬勃发展所需的资源。

文章涵盖广泛的主题。

观看我们的视频指南。

获取常见问题的答案。

查找说明以充分利用我们的产品。

了解今天最重要的新闻报道

发现电信见解和趋势。

查找流行电信术语的定义。

查看我们日历上的即将举行的活动
关于我们

专为满足您的需求而打造的全球电信合作伙伴。 

了解我们致力于提供创新解决方案以连接全球人员和企业背后的故事。 

了解我们遍布全球的强大网络基础设施,确保可靠、安全的连接。 

有问题、反馈或需要帮助吗? 我们的专业团队随时为您提供帮助!

寻找合作伙伴或注册合作伙伴计划。

纽约证券交易所:IDT
学习/博客

如何构建人工智能通话平台(2026):技术栈、架构和运营商设置

|
| 8分钟
|
在这篇文章中

如何在2026年构建你自己的AI通话平台

完整的堆栈指南——LLM、STT、TTS 以及大多数教程都会忽略的载波层。

2024年,人工智能打电话还是一件新鲜事。到2026年,这将成为标准的商业基础设施。 AI通话 平台处理来电支持、筛选潜在客户、预约、收款和开展外呼活动——所有这些都无需人工客服在线。

大多数企业都会从 Vapi、Bland AI 或 Retell 等平台购买现成的此类功能。但越来越多的公司——包括代理商、电信经销商、SaaS 开发商以及呼叫量大的企业——正在自行构建此类功能。为什么?

  • 成本。 规模化运营时,托管平台的全包费用为每分钟 0.07 美元至 0.15 美元。如果自行搭建技术栈,同样的通话费用则为 0.02 美元至 0.04 美元。
  • 控制。 您可以选择每个组件——LLM、语音、电话、路由逻辑。
  • 竞争优势。 您的呼叫基础设施将成为您的专属护城河,而不是每个竞争对手都可以购买的商品服务。

本指南将详细介绍整个架构:每一层的作用、要使用的工具、它们如何连接,以及——至关重要的是——大多数教程都会忽略的运营商基础设施层,而这一层决定了您的平台是否能够大规模运行。

每个AI通话平台的四个层次

选择工具之前,先了解工具堆栈。 AI通话 平台——无论是你自己搭建的还是购买的——都是由四个按顺序运作的层组成的:

Caller's phone
[Layer 1] Telephony / Carrier
      │  SIP trunk, PSTN gateway, DID numbers
[Layer 2] Speech-to-Text (STT)
      │  Transcribes caller audio in real time
[Layer 3] LLM (Large Language Model)
      │  Understands intent, decides response
[Layer 4] Text-to-Speech (TTS)
      │  Converts response to natural voice audioT
Back to caller

音频双向持续传输。呼叫者说话 → 语音转语音 (STT) 转录 → 语音语言管理 (LLM) 生成回复 → 文本转语音 (TTS) 合成音频 → 呼叫者听到回复。您的服务器实时协调所有四个层级。端到端目标:从“呼叫者停止说话”到“客服人员开始说话”的时间间隔小于 800 毫秒。超过 1,000 毫秒,呼叫者会认为连接已断开。

让我们一层一层地搭建起来。

第一层:电话通信——每个人都低估的基础

这是大多数教程都会匆匆略过,只用“使用”一词带过的部分。 Twilio然后继续。这一层还决定了你的每分钟费用、音频质量,以及你的AI代理听起来是自然还是机械。

这一层的作用:

  • 接收来自真实电话号码(PSTN)的来电
  • 将呼出电话路由到任何目的地
  • 通过 WebSocket 或 SIP 将音频流传输到您的服务器
  • 提供来电者拨打的电话号码

你有两个选择:

方案 A — 托管电话服务(例如 Twilio)

设置快捷。按零售CPaaS费率计费(每分钟0.013美元起,外呼费另加平台费)。非常适合原型设计和小批量使用。但如果每月通话时长超过100,000万分钟,成本将迅速累积。

将您的平台直接连接到批发 SIP 终端提供商。更低的每分钟费率,完全掌控路由,无平台加价。配置仅需 10 分钟。规模化部署可节省 30%–60% 的费用。

对于生产环境构建,推荐使用 IDT Express 作为载体层。

IDT Express是一家批发语音终端服务提供商,隶属于IDT公司(纽约证券交易所代码:IDT)——全球最大的批发语音运营商之一,拥有超过25年的运营商基础设施经验。 SIP中继语音终止 给你 AI通话 平台:

  • 白金路线 — G.711 无压缩音频,拨号后延迟小于 3 秒,专为 AI 语音代理工作负载优化,其中编解码器质量直接影响 STT 准确性。
  • 1,000 多个 CLI 路由 覆盖 200 多个国家/地区——您的平台从第一天起即可在全球范围内拨打和接听电话
  • DID号码 在140多个国家/地区 — 通过 API 立即为您的代理商提供任何市场的真实本地电话号码
  • 弹性并发 — 无需预先配置,即可扩展到 10 到 10,000 多个并发呼叫
  • 搅拌/摇动 外拨电话均带有 A 级认证签名,可防止被标记为垃圾电话,从而避免降低接听率

SIP 配置(适用于任何 SIP 兼容框架):

SIP Server: sip.idtexpress.com
Transport: TLS (recommended) or UDP
Codec: G.711 ulaw (PCMU) — critical for AI workloads
Authentication: Digest auth with your IDT Express credentials
DTMF: RFC 2833代码语言: 的CSS (CSS)

免费获取您的 SIP 凭证 idtexpress.com/sign-up注册后即可立即获得证书——无需销售电话。

第二层:语音转文字——聆听来电者的声音

STT 层将通话者的音频转换为 LLM 可以处理的文本。对于基于电话的 AI 通话而言,这比听起来要难得多——电话音频以 8kHz mulaw 格式运行,而不是大多数音频工具所期望的 16kHz PCM 格式。

电话STT的关键要求:

  • 原生支持 8kHz mulaw(无重采样步骤 = 更低延迟)
  • 实时转录(逐字逐句地记录通话者说话的内容,而不是在通话结束后记录)
  • 中位延迟低于 300 毫秒
  • 字母数字字符的准确性——电话号码、确认码、电子邮件地址
  • 抗噪能力——电话线路存在背景噪声和压缩伪影

推荐选项:

Provider延迟最适合
Deepgram Nova-2约200毫秒生产效率高,性价比最佳
AssemblyAI Universal-3约307毫秒字母数字准确率最高
OpenAI Whisper(托管)约400毫秒通用性强,易于集成
Google STT 流媒体约250毫秒多语言企业

对于大多数 AI 通话平台而言,Deepgram Nova-2 是默认选择——它原生支持 8kHz mulaw,提供约 200ms P50 延迟,并且对通话者通过电话共享的结构化数据(号码、代码、地址)具有极佳的准确性。

快速集成(Python、Deepgram):

import deepgram

dg_client = deepgram.Deepgram(DEEPGRAM_API_KEY)

async def transcribe_stream(audio_stream):
    response = await dg_client.transcription.live({
        'encoding': 'mulaw',
        'sample_rate': 8000,
        'model': 'nova-2',
        'interim_results': True,
        'endpointing': 300,
    })
    # Send audio chunks as they arrive from your SIP/WebSocket layer
    async for chunk in audio_stream:
        response.send(chunk)
代码语言: Python
 (蟒蛇)

第三层:LLM大脑——克劳德的AI呼叫

LLM 接收呼叫者的转录文本,保持对话上下文,决定接下来要说什么,并可选择性地调用外部工具(您的 CRM、日历、支付系统)。

为什么选择 Claude 进行人工智能呼叫:

Claude(Anthropic)由于以下几个与通话用例相关的特定原因,已成为语音代理 LLM 的一个强有力的选择:

  • 遵循指令 克劳德能够可靠地遵循复杂的系统提示,这些提示定义了客服人员的角色、通话流程、升级规则和工具使用方法。在通话过程中,客服人员“脱稿”是一个严重的问题。克劳德的指令执行能力堪称一流。
  • 简明回答 — 如果得到正确的提示,Claude 倾向于给出更简短、更口语化的回答——这对于语音来说至关重要,因为冗长的回答会让人感觉不自然,并增加 TTS 延迟。
  • 工具使用 — Claude 的函数调用(工具使用 API)可处理实时查找 — 检查日历可用性、查询 CRM 记录、验证订单状态 — 可靠且 JSON 格式正确。
  • 多轮对话背景 — 在整个通话过程中保持对话上下文的连贯性,不会“忘记”之前的交流。

呼叫模型选择:

  • 克劳德·俳句 — 延迟最低(约 150 毫秒),最适合简单的入站流程(常见问题解答、路由、预约确认)
  • 克劳德十四行诗 — 兼顾延迟和推理,最适合大多数通话场景
  • 克劳德·奥普斯 — 最高推理质量,仅在通话复杂程度需要时使用(复杂销售、谈判)

呼叫代理的系统提示结构:

You are [Agent Name], a [role] for [Company].

PERSONALITY: [tone, style — e.g., "professional but warm, concise"]

YOUR GOAL: [primary objective — e.g., "qualify inbound leads and book a demo"]

CALL FLOW:
1. Greet caller by name if available
2. Identify their need in one open question
3. [flow logic...]
4. If you cannot resolve: transfer to human agent

RULES:
- Keep all responses under 3 sentences
- Never fabricate informationif unsure, say so
- Always confirm before taking any action (booking, updating records)
- End the call professionally if the caller asks to stop

TOOLS AVAILABLE:
- check_calendar(date, time) → returns availability
- create_booking(name, email, date, time) → books appointment
- lookup_customer(phone_number) → returns CRM record代码语言: 的CSS (CSS)

第四层:文本转语音——您的代理人的声音

TTS层将克劳德的文本回复转换成自然流畅的音频,并传递给呼叫者。语音质量直接影响呼叫者是否信任并与您的客服人员互动。

关键要求:

  • 流媒体 TTS(在生成完整响应之前开始播放——可减少约 40% 的延迟)
  • 低延迟首字节生成(<300毫秒)
  • 自然韵律——停顿、重音、节奏
  • 电话兼容输出(8kHz 或可转换)

推荐选项:

Provider语音质量延迟最适合
十一实验室最高约250毫秒面向客户的优质产品
笛卡尔(卓越)等级约100毫秒延迟敏感呼叫
OpenAI 文本转语音非常好约300毫秒易于集成,一致性
Azure 神经文本转语音非常好约200毫秒企业级、多语言

对于 AI 通话平台而言,Cartesia 之所以获得关注,正是因为其首字节延迟低于 100 毫秒——当需要客服人员在处理后立即开始说话时,这一点至关重要。

编曲:连接四个层次

您的服务器是编排层——即在电话系统和您的 AI 流水线之间路由音频的 WebSocket 桥梁。主要有两个框架:

Pipecat(开源,推荐)

from pipecat.pipeline.pipeline import Pipeline
from pipecat.services.deepgram import DeepgramSTTService
from pipecat.services.anthropic import AnthropicLLMService
from pipecat.services.cartesia import CartesiaTTSService
from pipecat.transports.network.fastapi_websocket import FastAPIWebsocketTransport

async def run_agent(websocket):
    transport = FastAPIWebsocketTransport(websocket)

    pipeline = Pipeline([
        transport.input(),           # Audio in from SIP/WebSocket
        DeepgramSTTService(),        # Speech to text
        AnthropicLLMService(         # Claude LLM
            model="claude-sonnet-4-20250514",
            system=SYSTEM_PROMPT
        ),
        CartesiaTTSService(),        # Text to speech
        transport.output()           # Audio out to caller
    ])

    await pipeline.run()代码语言: Python
 (蟒蛇)

LiveKit Agents(开源,适用于更大规模应用) 当您需要同时处理数千个基于 WebRTC 和 SIP 的并发呼叫时,这是最佳选择。虽然基础设施开销较大,但并发管理能力显著提升。

整合起来:完整的架构

Caller dials DID number (IDT Express)
              │
              ▼
    IDT Express SIP Trunk
    (G.711 audio, Platinum route)
              │
              ▼
    Your SIP Gateway / WebSocket Server
    (Pipecat or LiveKit orchestration)
         │            │
         ▼            ▼
  Deepgram STT    Cartesia TTS
  (transcribe)    (synthesise)
         │            ▲
         ▼            │
    Claude Sonnet (Anthropic)
    (understand + decide + respond)
         │
         ▼
    Tool calls (CRM, calendar, payments)

端到端延迟预算(目标:低于 800 毫秒):

  • 电话到服务器延迟:约 50 毫秒(IDT 白金级路由)
  • STT(Deepgram):约200毫秒
  • LLM(克劳德·索内特):约200毫秒
  • TTS 第一个字节(笛卡尔):~100ms
  • 服务器到电话系统:约 50 毫秒
  • 总计:约 600 毫秒

扩展您的平台

一旦您的单代理概念验证成功,扩展就需要:

并发调用: 每个呼叫都在其自身的进程/容器中运行。IDT Express SIP 中继具有弹性,无需预先配置。您可以扩展计算资源(而非运营商资源)来应对突发流量。

全球范围: IDT快递 DID号码 覆盖 140 多个国家/地区,这意味着您的平台无需与每个国家/地区的运营商单独建立合作关系,即可在任何市场接受本地通话。一个账户,一个 API,全球覆盖。

规模化成本优化:

  • 对于简单的呼叫类型,请使用 Claude Haiku(与 Sonnet 相比,LLM 成本可节省约 70%)。
  • IDT Express 即时路线,适用于外呼批量营销活动(最低每分钟费率)
  • IDT Express Platinum 为面向客户的来电提供服务(质量对客户留存至关重要)
  • 缓存常用短语(问候语、等待音乐)的文本转语音 (TTS) 代码——可节省约 15% 的 TTS 成本。

搅拌/摇晃: 所有通过 IDT Express 拨出的电话都会自动进行 STIR/SHAKEN 签名。对于 AI 呼叫平台而言,这一点至关重要——未经签名的呼叫越来越容易被主流运营商标记为垃圾电话,这会在您的客服人员开口之前就严重影响您的外呼接听率。

入门指南:您的堆栈清单

元件推荐工具是时候开始布置了
载体 / SIP中继IDT快递10分钟
DID号码IDT快递通过 API 即时
STTDeepgram Nova-215分钟
LLM克劳德·索内特(人格API)10分钟
TTSCartesia 或 ElevenLabs15分钟
编曲配置派普卡特30分钟
下文AWS/GCP + Docker1-2小时

合理的时间线:

  • 概念验证工作:1-2天
  • 单次使用生产代理:1-2 周
  • 具备分析功能的完整多用例平台:4-8 周

常見問題解答

问:我没有编程经验,可以搭建一个AI通话平台吗? 答:就这里描述的基础设施层面而言,实际上不太可能。对于无代码方案,Vapi、Bland AI 和 Synthflow 都是专门构建的托管平台。如果您想自行构建并拥有开发团队,本指南涵盖了您所需的一切。

问:为什么音频编解码器对人工智能通话很重要? 答:AI语音转文本引擎在G.711未压缩音频上的性能明显优于G.729压缩音频。压缩编解码器会引入失真,导致转录准确率降低高达15%,从而降低LLM的输入质量,并产生更差的客服响应。IDT Express Platinum默认使用G.711编码。

问:我的AI呼叫平台如何获取电话号码? 答:IDT Express 在 140 多个国家/地区提供 DID(直接拨入)号码,可通过 API 进行配置。号码即时激活。您可以将它们分配给呼入流程、分配给特定的 AI 客服人员,或用于呼出来电显示。

问:我的AI呼叫平台是否需要符合STIR/SHAKEN标准? 答:是的,美国境内拨出电话需要进行STIR/SHAKEN签名。根据FCC规定,所有拨出电话都必须进行STIR/SHAKEN签名。IDT Express会自动处理此项签名——所有拨出流量均以A级认证进行签名。不符合规定的拨出电话越来越多地被各大运营商标记为“疑似垃圾电话”。


下一步

如果您准备好开始建造:

  1. 创建免费的 IDT Express 帐户 — 获取您的 SIP 凭证和 25 美元免费额度。只需 60 秒。
  2. 注册 Anthropic API 访问权限 — 您的 Claude API 密钥可立即在 console.anthropic.com 获取。
  3. 安装 Pipecat — 使用 pip 安装 pipecat-ai 并运行快速入门指南
  4. 拨打你的第一个人工智能电话 — 一天之内即可完成一个可行的概念验证

对于运营商层——将你的人工智能连接到真实手机网络的底层基础设施—— IDT Express语音终止SIP中继 专为 AI 语音工作负载而设计:包括 G.711 音频、弹性并发、全球 DID 号码和 STIR/SHAKEN 合规性。

开始构建——免费 ccount →

分享此文章

发表评论

必填项 *

对本文的评价

标签

认识我们的批发语音路由

使用我们领先的批发 AZ 语音终端来满足您的所有语音呼叫需求。
尝试 IDT Express 即可获得 25 美元积分

获得 25 美元免费试用积分

在您的收件箱中获取 IDT Express 文章

电信行业的最佳信息来源。 加入我们。

    最受欢迎的产品

    webrtc 与 sip 在语音机器人中的比较
    |
    | 9分钟
    大多数文章将其描述为一种选择。但事实并非如此。WebRTC……
    2026 年 WhatsApp Business API 的成本是多少?
    |
    | 7分钟
    问“WhatsApp Business API 的费用是多少?”然后……
    2026 年 WhatsApp Business 应用与 API 的比较
    |
    | 8分钟
    搜索“WhatsApp Business 应用与 API”,你就会找到……