NYSE: IDT
Mantenha-se à frente com a IDT Express
Produtos

Descubra como nossos produtos podem revolucionar a maneira como você se comunica e colabora.

voz

Explore nossas soluções de voz avançadas projetadas para otimizar seus fluxos de trabalho de comunicação.

Gama diversificada de soluções de números DID projetadas para aprimorar seus recursos de comunicação.

Experimente uma eficiência de comunicação incomparável com nossas soluções avançadas de entroncamento SIP.

Tecnologia de ponta para detectar e neutralizar proativamente sinalizadores de spam em seus números DID.

Permita que seus clientes se conectem com sua empresa discando um número gratuito.

Agentes de voz com inteligência artificial que atendem chamadas, capturam leads e fornecem suporte ao cliente automaticamente, a qualquer hora.
Mensagens

Onde quer que seu público esteja, nossa plataforma garante mensagens perfeitas em diversos canais.

Crie jornadas do cliente promovendo conversas interativas, tudo dentro da estrutura do seu aplicativo. 

Conecte-se com seu público de forma simples e eficaz através de nossa plataforma de SMS de última geração. 

BYOC

Aproveite o poder do IDT como sua operadora escolhida enquanto aproveita os recursos e serviços avançados de sua plataforma.

Integre o Twilio com nossa robusta plataforma de roteamento de operadora para obter um sistema de terminação de voz inigualável.

Experimente serviços de comunicação confiáveis ​​e de alta qualidade enquanto aproveita os recursos avançados da Genesys. 

Integre o IDT com a força colaborativa do MS Teams, desbloqueando uma comunicação eficiente e rica em recursos. 

Experimente o poder de nossa rede de operadoras perfeitamente conectada ao Plivo por meio de nossa solução BYOC de ponta. 

Ferramentas

Experimente o poder de nossas ferramentas de voz online, projetadas para simplificar o gerenciamento de comunicações. 

Garanta a autenticidade e a integridade das chamadas de saída com nossa ferramenta STIR/SHAKEN Verification Check. 

Ferramenta amigável para verificar a reputação do seu número comercial, garantindo que ele permaneça confiável. 

Compare e obtenha informações sobre despesas com chamadas efetuadas, otimize o orçamento e tome decisões informadas. 

Estime e compare facilmente os custos associados a diferentes provedores de números DID. 

Compare as taxas de VoIP de entrada entre os principais provedores de CPaaS e otimize seus custos de chamadas de entrada. 

Gere modelos de SMS personalizados. 

Recursos

Capacite-se com os recursos necessários para prosperar no cenário dinâmico da comunicação.

Artigos que cobrem uma ampla gama de tópicos.

Descubra nossos guias em vídeo.

Obtenha respostas para perguntas comuns.

Encontre instruções para aproveitar ao máximo nossos produtos.

Mantenha-se informado com as notícias mais importantes de hoje

Descubra insights e tendências de telecomunicações.

Encontre definições de termos populares de telecomunicações.

Descubra os próximos eventos em nosso calendário.
Empresa

Um parceiro global de telecomunicações criado para atender às suas necessidades. 

Descubra a história por trás do nosso compromisso em fornecer soluções inovadoras para conectar pessoas e empresas em todo o mundo. 

Saiba mais sobre nossa infraestrutura de rede robusta que se estende por todo o mundo, garantindo conectividade confiável e segura. 

Tem uma pergunta, feedback ou precisa de ajuda? Nossa equipe dedicada está aqui para ajudar!

Encontre parceiros ou inscreva-se em programas de parceria.

NYSE: IDT
Aprender / Blogar

Como construir uma plataforma de chamadas com IA (2026): Pilha de tecnologias, arquitetura e configuração de operadoras

|
| 8 minutos
|
Neste artigo

Como construir sua própria plataforma de chamadas com IA em 2026

O guia completo da pilha de protocolos — LLM, STT, TTS e a camada portadora que a maioria dos tutoriais ignora.

Em 2024, uma IA fazendo uma ligação telefônica era uma novidade. Em 2026, será infraestrutura padrão nos negócios. Plataformas de chamadas com IA gerenciam o suporte recebido, qualificam leads, agendam compromissos, recebem pagamentos e executam campanhas de prospecção — tudo sem um atendente humano na linha.

A maioria das empresas compra essa funcionalidade pronta para uso em plataformas como Vapi, Bland AI ou Retell. Mas um número crescente de empresas — agências, revendedoras de telecomunicações, desenvolvedoras de SaaS e empresas com alto volume de chamadas — está criando suas próprias soluções. Por quê?

  • Custo. Em grande escala, as plataformas gerenciadas cobram de US$ 0.07 a US$ 0.15 por minuto, tudo incluído. Crie sua própria infraestrutura e a mesma chamada custará de US$ 0.02 a US$ 0.04.
  • Ao controle. Você escolhe cada componente — LLM, voz, telefonia, lógica de roteamento.
  • Vantagem competitiva. Sua infraestrutura de chamadas se torna uma vantagem competitiva exclusiva, e não um serviço genérico que todos os concorrentes podem comprar.

Este guia descreve a arquitetura completa: o que cada camada faz, quais ferramentas usar, como elas se conectam e — crucialmente — a camada de infraestrutura da operadora, que a maioria dos tutoriais ignora, mas que determina se sua plataforma realmente funciona em escala.

As quatro camadas de toda plataforma de chamadas com IA

Antes de escolher as ferramentas, entenda a arquitetura. Toda plataforma de chamadas de IA — seja ela desenvolvida por você ou adquirida — opera em quatro camadas que funcionam em sequência:

Caller's phone
[Layer 1] Telephony / Carrier
      │  SIP trunk, PSTN gateway, DID numbers
[Layer 2] Speech-to-Text (STT)
      │  Transcribes caller audio in real time
[Layer 3] LLM (Large Language Model)
      │  Understands intent, decides response
[Layer 4] Text-to-Speech (TTS)
      │  Converts response to natural voice audioT
Back to caller

O áudio flui continuamente em duas direções. O interlocutor fala → o STT transcreve → o LLM gera uma resposta → o TTS sintetiza o áudio → o interlocutor ouve a resposta. Seu servidor orquestra todas as quatro camadas em tempo real. A meta de ponta a ponta é de menos de 800 ms, desde o momento em que o interlocutor para de falar até o momento em que o agente começa a falar. Qualquer tempo acima de 1,000 ms fará com que o interlocutor assuma que a conexão caiu.

Vamos construir cada camada.

Camada 1: Telefonia — A Base que Todos Subestimam

Essa é a camada que a maioria dos tutoriais ignora rapidamente, dizendo apenas "use o Twilio" e seguindo em frente. É também a camada que determina seu custo por minuto, a qualidade do seu áudio e se o seu agente de IA soa natural ou robótico.

O que esta camada faz:

  • Recebe chamadas de números de telefone reais (PSTN).
  • Encaminha chamadas de saída para qualquer destino.
  • Transmite áudio para o seu servidor via WebSocket ou SIP.
  • Fornece os números de telefone que seus chamadores discam.

Suas duas opções:

Opção A — Telefonia gerenciada (Twilio, etc.)

Configuração rápida. Pague as tarifas de varejo do CPaaS (US$ 0.013/min + chamadas de saída, além das taxas da plataforma). Excelente para prototipagem e baixos volumes. Com mais de 100,000 minutos por mês, os custos aumentam rapidamente.

Conecte sua plataforma diretamente a um provedor de terminação SIP por atacado. Tarifas por minuto mais baixas, controle total sobre o roteamento, sem margem de lucro da plataforma. Configuração em apenas 10 minutos. Economia de 30 a 60% em larga escala.

Para versões de produção, o IDT Express é a camada de suporte recomendada.

A IDT Express é uma provedora de terminação de voz por atacado, apoiada pela IDT Corporation (NYSE: IDT) — uma das maiores operadoras de voz por atacado do mundo, com mais de 25 anos de infraestrutura de operadoras. Tronco SIP e terminação de voz fornece à sua plataforma de chamadas com IA:

  • Rotas Platinum — Áudio G.711 não comprimido, com atraso pós-discagem inferior a 3 segundos, otimizado especificamente para cargas de trabalho de agentes de voz de IA, onde a qualidade do codec afeta diretamente a precisão da transcrição de fala.
  • Mais de 1,000 rotas de linha de comando Em mais de 200 países, sua plataforma pode fazer e receber chamadas globalmente desde o primeiro dia.
  • Números DID em mais de 140 países — Forneça aos seus agentes números de telefone locais reais em qualquer mercado instantaneamente via API
  • Concorrência elástica — escalabilidade de 10 a mais de 10,000 chamadas simultâneas sem provisionamento prévio
  • MEXA/AGITE assinado Chamadas de saída — as chamadas são assinadas com nível de atestação A, evitando rótulos de spam que reduzem as taxas de atendimento.

Configuração SIP (funciona com qualquer framework compatível com SIP):

SIP Server: sip.idtexpress.com
Transport: TLS (recommended) or UDP
Codec: G.711 ulaw (PCMU) — critical for AI workloads
Authentication: Digest auth with your IDT Express credentials
DTMF: RFC 2833Linguagem de código: APF (css)

Obtenha suas credenciais SIP gratuitamente em idtexpress.com/sign-upAs credenciais ficam disponíveis imediatamente após o cadastro — sem necessidade de contato com a equipe de vendas.

Camada 2: Voz para Texto — Ouvindo seus interlocutores

A camada STT converte o áudio da chamada em texto que seu LLM pode processar. Para chamadas telefônicas com IA, isso é mais difícil do que parece — o áudio da telefonia opera em 8 kHz mulaw, e não nos 16 kHz PCM que a maioria das ferramentas de áudio espera.

Requisitos essenciais para telefonia STT:

  • Suporte nativo a mulaw de 8kHz (sem etapa de reamostragem = menor latência)
  • Transcrição em tempo real (palavra por palavra, conforme o interlocutor fala, e não depois que ele para de falar)
  • Latência mediana inferior a 300 ms
  • Precisão em dados alfanuméricos — números de telefone, códigos de confirmação, endereços de e-mail
  • Robustez ao ruído — as linhas telefônicas apresentam ruído de fundo e artefatos de compressão.

Opções recomendadas:

ProvedorLatênciaDestaques
Deepgram Nova-2~200msProdução, melhor relação custo-benefício
AssemblyAI Universal-3~307msMáxima precisão em alfanuméricos
OpenAI Whisper (hospedado)~400msUso geral, fácil integração
Streaming STT do Google~250msMultilíngue, empresarial

Para a maioria das plataformas de chamadas com IA, o Deepgram Nova-2 é a escolha padrão — ele aceita nativamente mulaw de 8kHz, oferece latência P50 de aproximadamente 200ms e possui excelente precisão no tipo de dados estruturados que os usuários compartilham por telefone (números, códigos, endereços).

Integração rápida (Python, Deepgram):

import deepgram

dg_client = deepgram.Deepgram(DEEPGRAM_API_KEY)

async def transcribe_stream(audio_stream):
    response = await dg_client.transcription.live({
        'encoding': 'mulaw',
        'sample_rate': 8000,
        'model': 'nova-2',
        'interim_results': True,
        'endpointing': 300,
    })
    # Send audio chunks as they arrive from your SIP/WebSocket layer
    async for chunk in audio_stream:
        response.send(chunk)
Linguagem de código: Python (python)

Camada 3: O Cérebro LLM — Claude para Chamadas de IA

O sistema de gerenciamento de linguagem (LLM) recebe a transcrição da conversa do interlocutor, mantém o contexto da conversa, decide o que dizer em seguida e, opcionalmente, aciona ferramentas externas (seu CRM, calendário, sistema de pagamento).

Por que Claude para chamadas de IA:

Claude (Anthropic) se destacou como uma excelente opção para LLMs de agentes de voz por diversos motivos específicos para casos de uso de chamadas:

  • Instrução a seguir — Claude segue com precisão as instruções complexas do sistema que definem o perfil do agente, o fluxo da chamada, as regras de escalonamento e o uso das ferramentas. Em contextos de atendimento telefônico, um agente que se desvia do roteiro é um problema sério. A adesão de Claude às instruções é exemplar.
  • Respostas concisas — Claude tende a dar respostas mais curtas e conversacionais quando solicitado corretamente — algo essencial para a voz, onde respostas longas soam artificiais e aumentam a latência da síntese de voz.
  • Uso da ferramenta — A chamada de função do Claude (API de uso da ferramenta) lida com pesquisas em tempo real — verificando a disponibilidade do calendário, consultando registros do CRM, verificando o status do pedido — de forma confiável e com formatação JSON correta.
  • Contexto de múltiplas voltas — mantém um contexto de conversa coerente ao longo de toda a chamada, sem "esquecer" as interações anteriores.

Seleção do modelo para chamada:

  • Claude Haiku — Latência mais baixa (~150ms), ideal para fluxos de entrada simples (FAQ, roteamento, confirmação de agendamento)
  • Claude Soneto — Latência e raciocínio equilibrados, ideal para a maioria dos casos de uso de chamadas
  • Claude Opus — Raciocínio de altíssima qualidade, usar somente quando a complexidade da chamada exigir (vendas complexas, negociações)

Estrutura de prompt do sistema para um agente de chamada:

You are [Agent Name], a [role] for [Company].

PERSONALITY: [tone, style — e.g., "professional but warm, concise"]

YOUR GOAL: [primary objective — e.g., "qualify inbound leads and book a demo"]

CALL FLOW:
1. Greet caller by name if available
2. Identify their need in one open question
3. [flow logic...]
4. If you cannot resolve: transfer to human agent

RULES:
- Keep all responses under 3 sentences
- Never fabricate informationif unsure, say so
- Always confirm before taking any action (booking, updating records)
- End the call professionally if the caller asks to stop

TOOLS AVAILABLE:
- check_calendar(date, time) → returns availability
- create_booking(name, email, date, time) → books appointment
- lookup_customer(phone_number) → returns CRM recordLinguagem de código: APF (css)

Camada 4: Texto para Fala — A Voz do Seu Agente

A camada TTS converte a resposta de texto de Claude em áudio com som natural, reproduzido para quem ligou. A qualidade da voz impacta diretamente na confiança e no engajamento dos clientes com o seu agente.

Requisitos-chave:

  • Streaming TTS (inicia a reprodução antes da resposta completa ser gerada — reduz a latência em cerca de 40%)
  • Geração do primeiro byte com baixa latência (<300ms)
  • Prosódia natural — pausas, ênfase, ritmo
  • Saída compatível com telefonia (8kHz ou conversível)

Opções recomendadas:

ProvedorQualidade de vozLatênciaDestaques
OnzeLabsA maior~250msAtendimento ao cliente, premium
CartesiaExcelente~100msChamadas sensíveis à latência
OpenAI TTSmuito bom~300msFácil integração, consistente
TTS Neural do Azuremuito bom~200msEmpresa, multilíngue

Para plataformas de chamadas com IA, o Cartesia ganhou destaque especificamente por causa de sua latência de menos de 100 ms no primeiro byte de áudio — isso faz toda a diferença quando você precisa que o agente comece a falar imediatamente após o processamento.

Orquestração: Conectando as Quatro Camadas

Seu servidor é a camada de orquestração — a ponte WebSocket que roteia o áudio entre a telefonia e seu pipeline de IA. Dois frameworks principais:

Pipecat (código aberto, recomendado)

from pipecat.pipeline.pipeline import Pipeline
from pipecat.services.deepgram import DeepgramSTTService
from pipecat.services.anthropic import AnthropicLLMService
from pipecat.services.cartesia import CartesiaTTSService
from pipecat.transports.network.fastapi_websocket import FastAPIWebsocketTransport

async def run_agent(websocket):
    transport = FastAPIWebsocketTransport(websocket)

    pipeline = Pipeline([
        transport.input(),           # Audio in from SIP/WebSocket
        DeepgramSTTService(),        # Speech to text
        AnthropicLLMService(         # Claude LLM
            model="claude-sonnet-4-20250514",
            system=SYSTEM_PROMPT
        ),
        CartesiaTTSService(),        # Text to speech
        transport.output()           # Audio out to caller
    ])

    await pipeline.run()Linguagem de código: Python (python)

Agentes LiveKit (código aberto, para maior escalabilidade) Ideal para lidar com milhares de chamadas simultâneas usando WebRTC e SIP. Apresenta maior sobrecarga de infraestrutura, mas gerenciamento de simultaneidade significativamente melhor.

Colocando Tudo em Prática: A Arquitetura Completa

Caller dials DID number (IDT Express)
              │
              ▼
    IDT Express SIP Trunk
    (G.711 audio, Platinum route)
              │
              ▼
    Your SIP Gateway / WebSocket Server
    (Pipecat or LiveKit orchestration)
         │            │
         ▼            ▼
  Deepgram STT    Cartesia TTS
  (transcribe)    (synthesise)
         │            ▲
         ▼            │
    Claude Sonnet (Anthropic)
    (understand + decide + respond)
         │
         ▼
    Tool calls (CRM, calendar, payments)

Orçamento de latência de ponta a ponta (meta: menos de 800 ms):

  • Telefonia para servidor: ~50ms (rota IDT Platinum)
  • STT (Deepgram): ~200ms
  • LLM (Soneto de Claude): ~200ms
  • Primeiro byte TTS (Cartesia): ~100ms
  • Tempo de resposta do servidor para a telefonia: aproximadamente 50 ms
  • Total: ~600ms

Dimensionando sua plataforma

Após o sucesso da prova de conceito com um único agente, a escalabilidade requer:

Chamadas simultâneas: Cada chamada é executada em seu próprio processo/container. Os troncos SIP do IDT Express são elásticos — nenhum provisionamento prévio é necessário. Dimensione sua capacidade computacional (e não sua operadora) para lidar com picos de demanda.

Alcance global: Os números DID da IDT Express em mais de 140 países significam que sua plataforma pode aceitar chamadas locais em qualquer mercado sem a necessidade de contratos com operadoras diferentes em cada país. Uma conta, uma API, cobertura global.

Otimização de custos em grande escala:

  • Use Claude Haiku para tipos de chamada simples (economiza cerca de 70% no custo do LLM em comparação com o Sonnet).
  • Rotas IDT Express Instant para campanhas de envio em massa (tarifas por minuto mais baixas)
  • Rotas IDT Express Platinum para atendimento ao cliente receptivo (a qualidade é fundamental para a fidelização)
  • Armazenar em cache o TTS para frases comuns (saudações, mensagens de espera) economiza cerca de 15% do custo do TTS.

MEXA/AGITE: Todas as chamadas efetuadas pelo IDT Express são automaticamente assinadas com STIR/SHAKEN. Para plataformas de chamadas com IA, isso é imprescindível — chamadas não assinadas são cada vez mais classificadas como spam pelas principais operadoras, prejudicando as taxas de atendimento de chamadas antes mesmo que o agente fale.

Primeiros passos: sua lista de verificação de compatibilidade

ComponenteFerramenta recomendadaHora de começar a montar
Tronco de operadora/SIPIDT Expresso10 minutos
Números DIDIDT ExpressoInstantaneamente via API
STTDeepgram Nova-215 minutos
LLMClaude Sonnet (API Antrópico)10 minutos
TTSCartesia ou ElevenLabs15 minutos
OrquestraçãoPipecat30 minutos
InfraAWS/GCP + Docker1 – 2 horas

Cronograma realista:

  • Prova de conceito funcional: 1 a 2 dias
  • Agente de produção para uso único: 1 a 2 semanas
  • Plataforma completa com múltiplos casos de uso e análises: 4 a 8 semanas

Perguntas frequentes

P: Posso criar uma plataforma de chamadas com IA sem experiência em programação? R: Não é realista no nível de infraestrutura descrito aqui. Para opções sem código, Vapi, Bland AI e Synthflow são plataformas gerenciadas desenvolvidas especificamente para esse fim. Se você deseja criar a sua própria solução e possui uma equipe de desenvolvimento, este guia abrange tudo o que você precisa.

P: Por que o codec de áudio é importante para chamadas de IA? A: Os mecanismos de IA para transcrição de fala em texto têm um desempenho significativamente melhor com áudio não comprimido G.711 do que com áudio comprimido G.729. Os codecs comprimidos introduzem artefatos que reduzem a precisão da transcrição em até 15% — o que degrada a entrada do seu LLM e produz respostas piores do agente. As rotas do IDT Express Platinum usam G.711 por padrão.

P: Como obtenho números de telefone para minha plataforma de chamadas com IA? A: O IDT Express fornece números DID (Discagem Direta para o Interior) em mais de 140 países, provisionáveis ​​via API. Os números são ativados instantaneamente. Você pode atribuí-los a fluxos de chamadas de entrada, fornecê-los a agentes de IA específicos ou usá-los para identificação de chamadas de saída.

P: Minha plataforma de chamadas com IA precisa ser compatível com STIR/SHAKEN? R: Sim, para chamadas de saída nos EUA. As regulamentações da FCC exigem a assinatura STIR/SHAKEN em todas as chamadas de saída. O IDT Express lida com isso automaticamente — todo o tráfego de saída é assinado com o nível de atestação A. Chamadas de saída não conformes são cada vez mais rotuladas como "Possível Spam" pelas principais operadoras.


Próximos Passos

Se você estiver pronto para construir:

  1. Crie uma conta IDT Express gratuita — Obtenha suas credenciais SIP e US$ 25 de crédito grátis. Leva apenas 60 segundos.
  2. Inscreva-se para obter acesso à API da Anthropic. — Sua chave de API do Claude está disponível imediatamente em console.anthropic.com
  3. Instale o Pipecat — Instale o pipecat-ai com o pip e execute o guia de início rápido.
  4. Faça sua primeira chamada de IA — uma prova de conceito funcional em menos de um dia

Para a camada de operadora — a infraestrutura que conecta sua IA à rede telefônica real — Terminação de voz IDT Express e Tronco SIP Foi desenvolvido especificamente para cargas de trabalho de voz com IA: inclui áudio G.711, concorrência elástica, números DID globais e conformidade com STIR/SHAKEN.

Comece a construir — liberte um conta →

Compartilhe este artigo

Deixa um comentário

Os campos obrigatórios são marcados com *

Classifique este artigo

Tags

Conheça nosso roteamento de voz no atacado

Satisfaça todas as suas necessidades de chamadas de voz com nossa terminação de voz AZ líder na categoria.
Experimente o IDT Express por um crédito de $ 25

Obtenha $ 25 de crédito de teste gratuito

Receba os artigos do IDT Express em sua caixa de entrada

A melhor fonte de informação na indústria de telecomunicações. Junte-se a nós.

    Popular

    WhatsApp Business App vs. API em 2026
    |
    | 8 minutos
    Pesquise “WhatsApp Business app vs API” e você encontrará...
    melhores-provedores-de-api-de-whatsapp-para-empresas-em-2026 (3)
    |
    | 7 minutos
    Eis um fato que deve reformular toda a sua lista de opções: cada...
    mensagens-rcs-em-2026
    |
    | 8 minutos
    A cada poucos meses, surge uma nova manchete declarando o RCS o "assassino do SMS"...