Como construir sua própria plataforma de chamadas com IA em 2026
O guia completo da pilha de protocolos — LLM, STT, TTS e a camada portadora que a maioria dos tutoriais ignora.
Em 2024, uma IA fazendo uma ligação telefônica era uma novidade. Em 2026, será infraestrutura padrão nos negócios. Plataformas de chamadas com IA gerenciam o suporte recebido, qualificam leads, agendam compromissos, recebem pagamentos e executam campanhas de prospecção — tudo sem um atendente humano na linha.
A maioria das empresas compra essa funcionalidade pronta para uso em plataformas como Vapi, Bland AI ou Retell. Mas um número crescente de empresas — agências, revendedoras de telecomunicações, desenvolvedoras de SaaS e empresas com alto volume de chamadas — está criando suas próprias soluções. Por quê?
- Custo. Em grande escala, as plataformas gerenciadas cobram de US$ 0.07 a US$ 0.15 por minuto, tudo incluído. Crie sua própria infraestrutura e a mesma chamada custará de US$ 0.02 a US$ 0.04.
- Ao controle. Você escolhe cada componente — LLM, voz, telefonia, lógica de roteamento.
- Vantagem competitiva. Sua infraestrutura de chamadas se torna uma vantagem competitiva exclusiva, e não um serviço genérico que todos os concorrentes podem comprar.
Este guia descreve a arquitetura completa: o que cada camada faz, quais ferramentas usar, como elas se conectam e — crucialmente — a camada de infraestrutura da operadora, que a maioria dos tutoriais ignora, mas que determina se sua plataforma realmente funciona em escala.
As quatro camadas de toda plataforma de chamadas com IA
Antes de escolher as ferramentas, entenda a arquitetura. Toda plataforma de chamadas de IA — seja ela desenvolvida por você ou adquirida — opera em quatro camadas que funcionam em sequência:
Caller's phone
│
▼
[Layer 1] Telephony / Carrier
│ SIP trunk, PSTN gateway, DID numbers
▼
[Layer 2] Speech-to-Text (STT)
│ Transcribes caller audio in real time
▼
[Layer 3] LLM (Large Language Model)
│ Understands intent, decides response
▼
[Layer 4] Text-to-Speech (TTS)
│ Converts response to natural voice audioT
│
▼
Back to caller
O áudio flui continuamente em duas direções. O interlocutor fala → o STT transcreve → o LLM gera uma resposta → o TTS sintetiza o áudio → o interlocutor ouve a resposta. Seu servidor orquestra todas as quatro camadas em tempo real. A meta de ponta a ponta é de menos de 800 ms, desde o momento em que o interlocutor para de falar até o momento em que o agente começa a falar. Qualquer tempo acima de 1,000 ms fará com que o interlocutor assuma que a conexão caiu.
Vamos construir cada camada.
Camada 1: Telefonia — A Base que Todos Subestimam
Essa é a camada que a maioria dos tutoriais ignora rapidamente, dizendo apenas "use o Twilio" e seguindo em frente. É também a camada que determina seu custo por minuto, a qualidade do seu áudio e se o seu agente de IA soa natural ou robótico.
O que esta camada faz:
- Recebe chamadas de números de telefone reais (PSTN).
- Encaminha chamadas de saída para qualquer destino.
- Transmite áudio para o seu servidor via WebSocket ou SIP.
- Fornece os números de telefone que seus chamadores discam.
Suas duas opções:
Opção A — Telefonia gerenciada (Twilio, etc.)
Configuração rápida. Pague as tarifas de varejo do CPaaS (US$ 0.013/min + chamadas de saída, além das taxas da plataforma). Excelente para prototipagem e baixos volumes. Com mais de 100,000 minutos por mês, os custos aumentam rapidamente.
Opção B — Tronco SIP direto (Recomendado para produção)
Conecte sua plataforma diretamente a um provedor de terminação SIP por atacado. Tarifas por minuto mais baixas, controle total sobre o roteamento, sem margem de lucro da plataforma. Configuração em apenas 10 minutos. Economia de 30 a 60% em larga escala.
Para versões de produção, o IDT Express é a camada de suporte recomendada.
A IDT Express é uma provedora de terminação de voz por atacado, apoiada pela IDT Corporation (NYSE: IDT) — uma das maiores operadoras de voz por atacado do mundo, com mais de 25 anos de infraestrutura de operadoras. Tronco SIP e terminação de voz fornece à sua plataforma de chamadas com IA:
- Rotas Platinum — Áudio G.711 não comprimido, com atraso pós-discagem inferior a 3 segundos, otimizado especificamente para cargas de trabalho de agentes de voz de IA, onde a qualidade do codec afeta diretamente a precisão da transcrição de fala.
- Mais de 1,000 rotas de linha de comando Em mais de 200 países, sua plataforma pode fazer e receber chamadas globalmente desde o primeiro dia.
- Números DID em mais de 140 países — Forneça aos seus agentes números de telefone locais reais em qualquer mercado instantaneamente via API
- Concorrência elástica — escalabilidade de 10 a mais de 10,000 chamadas simultâneas sem provisionamento prévio
- MEXA/AGITE assinado Chamadas de saída — as chamadas são assinadas com nível de atestação A, evitando rótulos de spam que reduzem as taxas de atendimento.
Configuração SIP (funciona com qualquer framework compatível com SIP):
SIP Server: sip.idtexpress.com
Transport: TLS (recommended) or UDP
Codec: G.711 ulaw (PCMU) — critical for AI workloads
Authentication: Digest auth with your IDT Express credentials
DTMF: RFC 2833Linguagem de código: APF (css)
Obtenha suas credenciais SIP gratuitamente em idtexpress.com/sign-upAs credenciais ficam disponíveis imediatamente após o cadastro — sem necessidade de contato com a equipe de vendas.
Camada 2: Voz para Texto — Ouvindo seus interlocutores
A camada STT converte o áudio da chamada em texto que seu LLM pode processar. Para chamadas telefônicas com IA, isso é mais difícil do que parece — o áudio da telefonia opera em 8 kHz mulaw, e não nos 16 kHz PCM que a maioria das ferramentas de áudio espera.
Requisitos essenciais para telefonia STT:
- Suporte nativo a mulaw de 8kHz (sem etapa de reamostragem = menor latência)
- Transcrição em tempo real (palavra por palavra, conforme o interlocutor fala, e não depois que ele para de falar)
- Latência mediana inferior a 300 ms
- Precisão em dados alfanuméricos — números de telefone, códigos de confirmação, endereços de e-mail
- Robustez ao ruído — as linhas telefônicas apresentam ruído de fundo e artefatos de compressão.
Opções recomendadas:
| Provedor | Latência | Destaques |
|---|---|---|
| Deepgram Nova-2 | ~200ms | Produção, melhor relação custo-benefício |
| AssemblyAI Universal-3 | ~307ms | Máxima precisão em alfanuméricos |
| OpenAI Whisper (hospedado) | ~400ms | Uso geral, fácil integração |
| Streaming STT do Google | ~250ms | Multilíngue, empresarial |
Para a maioria das plataformas de chamadas com IA, o Deepgram Nova-2 é a escolha padrão — ele aceita nativamente mulaw de 8kHz, oferece latência P50 de aproximadamente 200ms e possui excelente precisão no tipo de dados estruturados que os usuários compartilham por telefone (números, códigos, endereços).
Integração rápida (Python, Deepgram):
import deepgram
dg_client = deepgram.Deepgram(DEEPGRAM_API_KEY)
async def transcribe_stream(audio_stream):
response = await dg_client.transcription.live({
'encoding': 'mulaw',
'sample_rate': 8000,
'model': 'nova-2',
'interim_results': True,
'endpointing': 300,
})
# Send audio chunks as they arrive from your SIP/WebSocket layer
async for chunk in audio_stream:
response.send(chunk)
Linguagem de código: Python (python)
Camada 3: O Cérebro LLM — Claude para Chamadas de IA
O sistema de gerenciamento de linguagem (LLM) recebe a transcrição da conversa do interlocutor, mantém o contexto da conversa, decide o que dizer em seguida e, opcionalmente, aciona ferramentas externas (seu CRM, calendário, sistema de pagamento).
Por que Claude para chamadas de IA:
Claude (Anthropic) se destacou como uma excelente opção para LLMs de agentes de voz por diversos motivos específicos para casos de uso de chamadas:
- Instrução a seguir — Claude segue com precisão as instruções complexas do sistema que definem o perfil do agente, o fluxo da chamada, as regras de escalonamento e o uso das ferramentas. Em contextos de atendimento telefônico, um agente que se desvia do roteiro é um problema sério. A adesão de Claude às instruções é exemplar.
- Respostas concisas — Claude tende a dar respostas mais curtas e conversacionais quando solicitado corretamente — algo essencial para a voz, onde respostas longas soam artificiais e aumentam a latência da síntese de voz.
- Uso da ferramenta — A chamada de função do Claude (API de uso da ferramenta) lida com pesquisas em tempo real — verificando a disponibilidade do calendário, consultando registros do CRM, verificando o status do pedido — de forma confiável e com formatação JSON correta.
- Contexto de múltiplas voltas — mantém um contexto de conversa coerente ao longo de toda a chamada, sem "esquecer" as interações anteriores.
Seleção do modelo para chamada:
- Claude Haiku — Latência mais baixa (~150ms), ideal para fluxos de entrada simples (FAQ, roteamento, confirmação de agendamento)
- Claude Soneto — Latência e raciocínio equilibrados, ideal para a maioria dos casos de uso de chamadas
- Claude Opus — Raciocínio de altíssima qualidade, usar somente quando a complexidade da chamada exigir (vendas complexas, negociações)
Estrutura de prompt do sistema para um agente de chamada:
You are [Agent Name], a [role] for [Company].
PERSONALITY: [tone, style — e.g., "professional but warm, concise"]
YOUR GOAL: [primary objective — e.g., "qualify inbound leads and book a demo"]
CALL FLOW:
1. Greet caller by name if available
2. Identify their need in one open question
3. [flow logic...]
4. If you cannot resolve: transfer to human agent
RULES:
- Keep all responses under 3 sentences
- Never fabricate information — if unsure, say so
- Always confirm before taking any action (booking, updating records)
- End the call professionally if the caller asks to stop
TOOLS AVAILABLE:
- check_calendar(date, time) → returns availability
- create_booking(name, email, date, time) → books appointment
- lookup_customer(phone_number) → returns CRM recordLinguagem de código: APF (css)
Camada 4: Texto para Fala — A Voz do Seu Agente
A camada TTS converte a resposta de texto de Claude em áudio com som natural, reproduzido para quem ligou. A qualidade da voz impacta diretamente na confiança e no engajamento dos clientes com o seu agente.
Requisitos-chave:
- Streaming TTS (inicia a reprodução antes da resposta completa ser gerada — reduz a latência em cerca de 40%)
- Geração do primeiro byte com baixa latência (<300ms)
- Prosódia natural — pausas, ênfase, ritmo
- Saída compatível com telefonia (8kHz ou conversível)
Opções recomendadas:
| Provedor | Qualidade de voz | Latência | Destaques |
|---|---|---|---|
| OnzeLabs | A maior | ~250ms | Atendimento ao cliente, premium |
| Cartesia | Excelente | ~100ms | Chamadas sensíveis à latência |
| OpenAI TTS | muito bom | ~300ms | Fácil integração, consistente |
| TTS Neural do Azure | muito bom | ~200ms | Empresa, multilíngue |
Para plataformas de chamadas com IA, o Cartesia ganhou destaque especificamente por causa de sua latência de menos de 100 ms no primeiro byte de áudio — isso faz toda a diferença quando você precisa que o agente comece a falar imediatamente após o processamento.
Orquestração: Conectando as Quatro Camadas
Seu servidor é a camada de orquestração — a ponte WebSocket que roteia o áudio entre a telefonia e seu pipeline de IA. Dois frameworks principais:
Pipecat (código aberto, recomendado)
from pipecat.pipeline.pipeline import Pipeline
from pipecat.services.deepgram import DeepgramSTTService
from pipecat.services.anthropic import AnthropicLLMService
from pipecat.services.cartesia import CartesiaTTSService
from pipecat.transports.network.fastapi_websocket import FastAPIWebsocketTransport
async def run_agent(websocket):
transport = FastAPIWebsocketTransport(websocket)
pipeline = Pipeline([
transport.input(), # Audio in from SIP/WebSocket
DeepgramSTTService(), # Speech to text
AnthropicLLMService( # Claude LLM
model="claude-sonnet-4-20250514",
system=SYSTEM_PROMPT
),
CartesiaTTSService(), # Text to speech
transport.output() # Audio out to caller
])
await pipeline.run()Linguagem de código: Python (python)
Agentes LiveKit (código aberto, para maior escalabilidade) Ideal para lidar com milhares de chamadas simultâneas usando WebRTC e SIP. Apresenta maior sobrecarga de infraestrutura, mas gerenciamento de simultaneidade significativamente melhor.
Colocando Tudo em Prática: A Arquitetura Completa
Caller dials DID number (IDT Express)
│
▼
IDT Express SIP Trunk
(G.711 audio, Platinum route)
│
▼
Your SIP Gateway / WebSocket Server
(Pipecat or LiveKit orchestration)
│ │
▼ ▼
Deepgram STT Cartesia TTS
(transcribe) (synthesise)
│ ▲
▼ │
Claude Sonnet (Anthropic)
(understand + decide + respond)
│
▼
Tool calls (CRM, calendar, payments)
Orçamento de latência de ponta a ponta (meta: menos de 800 ms):
- Telefonia para servidor: ~50ms (rota IDT Platinum)
- STT (Deepgram): ~200ms
- LLM (Soneto de Claude): ~200ms
- Primeiro byte TTS (Cartesia): ~100ms
- Tempo de resposta do servidor para a telefonia: aproximadamente 50 ms
- Total: ~600ms ✓
Dimensionando sua plataforma
Após o sucesso da prova de conceito com um único agente, a escalabilidade requer:
Chamadas simultâneas: Cada chamada é executada em seu próprio processo/container. Os troncos SIP do IDT Express são elásticos — nenhum provisionamento prévio é necessário. Dimensione sua capacidade computacional (e não sua operadora) para lidar com picos de demanda.
Alcance global: Os números DID da IDT Express em mais de 140 países significam que sua plataforma pode aceitar chamadas locais em qualquer mercado sem a necessidade de contratos com operadoras diferentes em cada país. Uma conta, uma API, cobertura global.
Otimização de custos em grande escala:
- Use Claude Haiku para tipos de chamada simples (economiza cerca de 70% no custo do LLM em comparação com o Sonnet).
- Rotas IDT Express Instant para campanhas de envio em massa (tarifas por minuto mais baixas)
- Rotas IDT Express Platinum para atendimento ao cliente receptivo (a qualidade é fundamental para a fidelização)
- Armazenar em cache o TTS para frases comuns (saudações, mensagens de espera) economiza cerca de 15% do custo do TTS.
MEXA/AGITE: Todas as chamadas efetuadas pelo IDT Express são automaticamente assinadas com STIR/SHAKEN. Para plataformas de chamadas com IA, isso é imprescindível — chamadas não assinadas são cada vez mais classificadas como spam pelas principais operadoras, prejudicando as taxas de atendimento de chamadas antes mesmo que o agente fale.
Primeiros passos: sua lista de verificação de compatibilidade
| Componente | Ferramenta recomendada | Hora de começar a montar |
|---|---|---|
| Tronco de operadora/SIP | IDT Expresso | 10 minutos |
| Números DID | IDT Expresso | Instantaneamente via API |
| STT | Deepgram Nova-2 | 15 minutos |
| LLM | Claude Sonnet (API Antrópico) | 10 minutos |
| TTS | Cartesia ou ElevenLabs | 15 minutos |
| Orquestração | Pipecat | 30 minutos |
| Infra | AWS/GCP + Docker | 1 – 2 horas |
Cronograma realista:
- Prova de conceito funcional: 1 a 2 dias
- Agente de produção para uso único: 1 a 2 semanas
- Plataforma completa com múltiplos casos de uso e análises: 4 a 8 semanas
Perguntas frequentes
P: Posso criar uma plataforma de chamadas com IA sem experiência em programação? R: Não é realista no nível de infraestrutura descrito aqui. Para opções sem código, Vapi, Bland AI e Synthflow são plataformas gerenciadas desenvolvidas especificamente para esse fim. Se você deseja criar a sua própria solução e possui uma equipe de desenvolvimento, este guia abrange tudo o que você precisa.
P: Por que o codec de áudio é importante para chamadas de IA? A: Os mecanismos de IA para transcrição de fala em texto têm um desempenho significativamente melhor com áudio não comprimido G.711 do que com áudio comprimido G.729. Os codecs comprimidos introduzem artefatos que reduzem a precisão da transcrição em até 15% — o que degrada a entrada do seu LLM e produz respostas piores do agente. As rotas do IDT Express Platinum usam G.711 por padrão.
P: Como obtenho números de telefone para minha plataforma de chamadas com IA? A: O IDT Express fornece números DID (Discagem Direta para o Interior) em mais de 140 países, provisionáveis via API. Os números são ativados instantaneamente. Você pode atribuí-los a fluxos de chamadas de entrada, fornecê-los a agentes de IA específicos ou usá-los para identificação de chamadas de saída.
P: Minha plataforma de chamadas com IA precisa ser compatível com STIR/SHAKEN? R: Sim, para chamadas de saída nos EUA. As regulamentações da FCC exigem a assinatura STIR/SHAKEN em todas as chamadas de saída. O IDT Express lida com isso automaticamente — todo o tráfego de saída é assinado com o nível de atestação A. Chamadas de saída não conformes são cada vez mais rotuladas como "Possível Spam" pelas principais operadoras.
Próximos Passos
Se você estiver pronto para construir:
- Crie uma conta IDT Express gratuita — Obtenha suas credenciais SIP e US$ 25 de crédito grátis. Leva apenas 60 segundos.
- Inscreva-se para obter acesso à API da Anthropic. — Sua chave de API do Claude está disponível imediatamente em console.anthropic.com
- Instale o Pipecat — Instale o pipecat-ai com o pip e execute o guia de início rápido.
- Faça sua primeira chamada de IA — uma prova de conceito funcional em menos de um dia
Para a camada de operadora — a infraestrutura que conecta sua IA à rede telefônica real — Terminação de voz IDT Express e Tronco SIP Foi desenvolvido especificamente para cargas de trabalho de voz com IA: inclui áudio G.711, concorrência elástica, números DID globais e conformidade com STIR/SHAKEN.


