Come creare la propria piattaforma di chiamate basata sull'intelligenza artificiale nel 2026
La guida completa allo stack: LLM, STT, TTS e il livello portante che la maggior parte dei tutorial tralascia.
Nel 2024, un'intelligenza artificiale in grado di effettuare una telefonata era una novità. Entro il 2026, sarà diventata una prassi aziendale standard. Chiamata AI Le piattaforme gestiscono l'assistenza in entrata, qualificano i lead, prenotano appuntamenti, riscuotono pagamenti e conducono campagne in uscita, il tutto senza l'intervento di un operatore umano.
La maggior parte delle aziende acquista questa funzionalità già pronta da piattaforme come Vapi, Bland AI o Retell. Ma un numero crescente di aziende – agenzie, rivenditori di telecomunicazioni, sviluppatori di SaaS e imprese con elevati volumi di chiamate – sta sviluppando soluzioni interne. Perché?
- Costo. Su larga scala, le piattaforme gestite applicano tariffe tutto compreso tra $0.07 e $0.15 al minuto. Creando la propria infrastruttura, la stessa chiamata costa tra $0.02 e $0.04.
- Controllo. Puoi scegliere ogni singolo componente: LLM, voce, telefonia, logica di instradamento.
- Vantaggio competitivo. La vostra infrastruttura di chiamata diventa un vantaggio competitivo proprietario, non un servizio standard che ogni concorrente può acquistare.
Questa guida illustra l'architettura completa: la funzione di ogni livello, gli strumenti da utilizzare, le loro connessioni e, aspetto fondamentale, il livello dell'infrastruttura del fornitore di servizi, che la maggior parte dei tutorial trascura ma che determina se la piattaforma funziona effettivamente su larga scala.
I quattro livelli di ogni piattaforma di chiamate basata sull'intelligenza artificiale
Prima di scegliere gli strumenti, è importante comprenderne la struttura. Ogni Chiamata AI La piattaforma, che tu la crei o la acquisti, si basa su quattro livelli che lavorano in sequenza:
Caller's phone
│
▼
[Layer 1] Telephony / Carrier
│ SIP trunk, PSTN gateway, DID numbers
▼
[Layer 2] Speech-to-Text (STT)
│ Transcribes caller audio in real time
▼
[Layer 3] LLM (Large Language Model)
│ Understands intent, decides response
▼
[Layer 4] Text-to-Speech (TTS)
│ Converts response to natural voice audioT
│
▼
Back to caller
Il flusso audio si sviluppa continuamente in due direzioni. Il chiamante parla → il sistema STT trascrive → il sistema LLM genera una risposta → il sistema TTS sintetizza l'audio → il chiamante ascolta la risposta. Il server gestisce tutti e quattro i livelli in tempo reale. L'obiettivo end-to-end è di impiegare meno di 800 ms tra "il chiamante smette di parlare" e "l'operatore inizia a parlare". Qualsiasi intervallo superiore a 1,000 ms indica che la connessione è stata interrotta.
Costruiamo ogni strato.
Livello 1: La telefonia — Il fondamento che tutti sottovalutano
Questo è il livello che la maggior parte dei tutorial tralascia con "usa Twilio" e andare avanti. È anche il livello che determina il costo al minuto, la qualità audio e se l'agente AI suona naturale o robotico.
Cosa fa questo livello:
- Riceve chiamate in entrata da numeri di telefono reali (PSTN)
- Instrada le chiamate in uscita verso qualsiasi destinazione
- Trasmette l'audio al tuo server tramite WebSocket o SIP.
- Fornisce i numeri di telefono che i tuoi chiamanti compongono
Le tue due opzioni:
Opzione A — Telefonia gestita (Twilio, ecc.)
Configurazione rapida. Tariffe CPaaS al dettaglio (0.013 $/minuto + chiamate in uscita, più commissioni della piattaforma). Ottimo per la prototipazione e bassi volumi. Con oltre 100,000 minuti al mese, i costi aumentano rapidamente.
Opzione B — Trunk SIP diretto (consigliato per ambienti di produzione)
Collega la tua piattaforma direttamente a un fornitore di terminazione SIP all'ingrosso. Tariffe al minuto più basse, pieno controllo sull'instradamento, nessun ricarico della piattaforma. Configurazione in 10 minuti. Risparmio del 30-60% su larga scala.
Per le build di produzione, IDT Express è il livello di supporto consigliato.
IDT Express è un fornitore di servizi di terminazione voce all'ingrosso supportato da IDT Corporation (NYSE: IDT), uno dei più grandi operatori di telefonia vocale all'ingrosso al mondo con oltre 25 anni di esperienza nelle infrastrutture di trasporto. Trunking SIP and terminazione vocale dà il tuo Chiamata AI piattaforma:
- Percorsi Platinum — Audio non compresso G.711, ritardo post-composizione inferiore a 3 secondi, ottimizzato specificamente per i carichi di lavoro degli agenti vocali AI in cui la qualità del codec influisce direttamente sulla precisione STT
- Oltre 1,000 percorsi CLI In oltre 200 paesi, la tua piattaforma ti permette di effettuare e ricevere chiamate in tutto il mondo fin dal primo giorno.
- Numeri DID in oltre 140 paesi — Fornisci ai tuoi agenti numeri di telefono locali reali in qualsiasi mercato, istantaneamente tramite API
- Concorrenza elastica — scalabile da 10 a oltre 10,000 chiamate simultanee senza pre-configurazione
- MESCOLARE / AGITARE firmato Le chiamate in uscita sono firmate con livello di attestazione A, impedendo l'etichettatura come spam che riduce drasticamente il tasso di risposta.
Configurazione SIP (compatibile con qualsiasi framework SIP):
SIP Server: sip.idtexpress.com
Transport: TLS (recommended) or UDP
Codec: G.711 ulaw (PCMU) — critical for AI workloads
Authentication: Digest auth with your IDT Express credentials
DTMF: RFC 2833Linguaggio di codifica: CSS (css)Ottieni gratuitamente le tue credenziali SIP su idtexpress.com/sign-upLe credenziali sono disponibili immediatamente dopo la registrazione, senza bisogno di alcuna chiamata commerciale.
Livello 2: Dal parlato al testo — Ascoltare chi chiama
Il livello STT converte l'audio del chiamante in testo che il tuo LLM può elaborare. Per le chiamate AI basate su telefono, questo è più difficile di quanto sembri: l'audio telefonico viene trasmesso a 8 kHz mulaw, non ai 16 kHz PCM previsti dalla maggior parte degli strumenti audio.
Requisiti fondamentali per i sistemi STT di telefonia:
- Supporto nativo per mulaw a 8 kHz (nessun passaggio di ricampionamento = latenza inferiore)
- Trascrizione in streaming (parola per parola mentre il chiamante parla, non dopo che ha smesso)
- Latenza media inferiore a 300 ms
- Precisione sui dati alfanumerici: numeri di telefono, codici di conferma, indirizzi e-mail
- Robustezza al rumore: le linee telefoniche presentano rumore di fondo e artefatti di compressione.
Opzioni consigliate:
| Provider | Latenza | Ideale per |
|---|---|---|
| Deepgram Nova-2 | ~200 ms | Produzione, miglior rapporto qualità/prezzo |
| AssemblyAI Universal-3 | ~307 ms | Massima precisione sui caratteri alfanumerici. |
| OpenAI Whisper (ospitato) | ~400 ms | Uso generale, facile integrazione |
| Google STT Streaming | ~250 ms | Multilingue, aziendale |
Per la maggior parte delle piattaforme di chiamata basate sull'intelligenza artificiale, Deepgram Nova-2 è la scelta predefinita: accetta nativamente mulaw a 8 kHz, offre una latenza P50 di circa 200 ms e ha un'eccellente precisione sui dati strutturati che i chiamanti condividono al telefono (numeri, prefissi, indirizzi).
Integrazione rapida (Python, Deepgram):
import deepgram
dg_client = deepgram.Deepgram(DEEPGRAM_API_KEY)
async def transcribe_stream(audio_stream):
response = await dg_client.transcription.live({
'encoding': 'mulaw',
'sample_rate': 8000,
'model': 'nova-2',
'interim_results': True,
'endpointing': 300,
})
# Send audio chunks as they arrive from your SIP/WebSocket layer
async for chunk in audio_stream:
response.send(chunk)
Linguaggio di codifica: Python (python)Livello 3: Il cervello LLM — Claude per AI Calling
Il sistema LLM riceve la trascrizione del testo del chiamante, mantiene il contesto della conversazione, decide cosa dire successivamente e, facoltativamente, richiama strumenti esterni (il tuo CRM, il calendario, il sistema di pagamento).
Perché Claude per le chiamate tramite intelligenza artificiale:
Claude (Anthropic) si è affermato come una valida alternativa per i modelli LLM di agenti vocali per diverse ragioni specifiche relative ai casi d'uso delle chiamate:
- Istruzioni seguenti Claude segue con precisione le complesse istruzioni di sistema che definiscono il profilo dell'agente, il flusso delle chiamate, le regole di escalation e l'utilizzo degli strumenti. In un contesto di chiamata, un agente che si discosta dal copione rappresenta un problema serio. L'aderenza di Claude alle istruzioni è ai massimi livelli.
- Risposte concise — Claude tende a fornire risposte più brevi e colloquiali quando viene sollecitato correttamente — aspetto essenziale per la voce, dove le risposte lunghe risultano innaturali e aumentano la latenza della sintesi vocale.
- Uso dello strumento — La funzione di chiamata di Claude (utilizza l'API dello strumento) gestisce le ricerche in tempo reale — verifica della disponibilità del calendario, interrogazione dei record CRM, verifica dello stato degli ordini — in modo affidabile e con la corretta formattazione JSON.
- Contesto multi-turno — mantiene un contesto di conversazione coerente per tutta la durata della chiamata, senza "dimenticare" gli scambi precedenti.
Selezione del modello da chiamare:
- Claudio Haiku — Latenza minima (~150 ms), ideale per flussi in entrata semplici (FAQ, pianificazione del percorso, conferma dell'appuntamento)
- Claude Sonetto — Latenza e ragionamento bilanciati, ideali per la maggior parte dei casi d'uso delle chiamate.
- Claudio Opus — massima qualità di ragionamento, da utilizzare solo quando la complessità della chiamata lo richiede (vendite complesse, negoziazioni)
Struttura dei messaggi di sistema per l'operatore chiamante:
You are [Agent Name], a [role] for [Company].
PERSONALITY: [tone, style — e.g., "professional but warm, concise"]
YOUR GOAL: [primary objective — e.g., "qualify inbound leads and book a demo"]
CALL FLOW:
1. Greet caller by name if available
2. Identify their need in one open question
3. [flow logic...]
4. If you cannot resolve: transfer to human agent
RULES:
- Keep all responses under 3 sentences
- Never fabricate information — if unsure, say so
- Always confirm before taking any action (booking, updating records)
- End the call professionally if the caller asks to stop
TOOLS AVAILABLE:
- check_calendar(date, time) → returns availability
- create_booking(name, email, date, time) → books appointment
- lookup_customer(phone_number) → returns CRM recordLinguaggio di codifica: CSS (css)Livello 4: Sintesi vocale — La voce del tuo agente
Il livello TTS converte la risposta testuale di Claude in un audio dal suono naturale, che viene trasmesso all'interlocutore. La qualità della voce in questa fase influisce direttamente sulla fiducia e sull'interazione degli interlocutori con il tuo operatore.
Requisiti chiave:
- Streaming TTS (inizia la riproduzione prima che venga generata la risposta completa: riduce la latenza di circa il 40%)
- Generazione del primo byte a bassa latenza (<300 ms)
- Prosodia naturale: pause, enfasi, ritmo
- Uscita compatibile con la telefonia (8 kHz o convertibile)
Opzioni consigliate:
| Provider | Qualità della voce | Latenza | Ideale per |
|---|---|---|---|
| UndiciLabs | Massimo | ~250 ms | Orientato al cliente, premium |
| Cartesia | Ottimo | ~100 ms | Chiamata sensibile alla latenza |
| OpenAI TTS | Molto Buone | ~300 ms | Integrazione semplice, coerente |
| Azure Neural TTS | Molto Buone | ~200 ms | Aziendale, multilingue |
Per le piattaforme di chiamate basate sull'intelligenza artificiale, Cartesia ha guadagnato popolarità soprattutto grazie alla sua latenza del primo byte audio inferiore a 100 ms: un aspetto fondamentale quando è necessario che l'operatore inizi a parlare immediatamente dopo l'elaborazione.
Orchestrazione: Collegare i quattro livelli
Il tuo server è il livello di orchestrazione, ovvero il bridge WebSocket che instrada l'audio tra la telefonia e la tua pipeline di intelligenza artificiale. Due framework principali:
Pipecat (software open source, consigliato)
from pipecat.pipeline.pipeline import Pipeline
from pipecat.services.deepgram import DeepgramSTTService
from pipecat.services.anthropic import AnthropicLLMService
from pipecat.services.cartesia import CartesiaTTSService
from pipecat.transports.network.fastapi_websocket import FastAPIWebsocketTransport
async def run_agent(websocket):
transport = FastAPIWebsocketTransport(websocket)
pipeline = Pipeline([
transport.input(), # Audio in from SIP/WebSocket
DeepgramSTTService(), # Speech to text
AnthropicLLMService( # Claude LLM
model="claude-sonnet-4-20250514",
system=SYSTEM_PROMPT
),
CartesiaTTSService(), # Text to speech
transport.output() # Audio out to caller
])
await pipeline.run()Linguaggio di codifica: Python (python)Agenti LiveKit (open source, per una scalabilità maggiore) Ideale quando è necessario gestire migliaia di chiamate simultanee con WebRTC e SIP. Richiede un'infrastruttura più complessa, ma offre una gestione della concorrenza nettamente superiore.
Assemblaggio: l'architettura completa
Caller dials DID number (IDT Express)
│
▼
IDT Express SIP Trunk
(G.711 audio, Platinum route)
│
▼
Your SIP Gateway / WebSocket Server
(Pipecat or LiveKit orchestration)
│ │
▼ ▼
Deepgram STT Cartesia TTS
(transcribe) (synthesise)
│ ▲
▼ │
Claude Sonnet (Anthropic)
(understand + decide + respond)
│
▼
Tool calls (CRM, calendar, payments)Budget di latenza end-to-end (obiettivo: inferiore a 800 ms):
- Tempo di connessione telefonica al server: ~50 ms (percorso IDT Platinum)
- STT (Deepgram): ~200ms
- LLM (Sonetto di Claude): ~200 ms
- Primo byte TTS (Cartesia): ~100ms
- Tempo di risposta dal server alla telefonia: ~50 ms
- Totale: ~600 ms ✓
Scalabilità della piattaforma
Una volta che la prova di concetto con un singolo agente funziona, la scalabilità richiede:
Chiamate simultanee: Ogni chiamata viene eseguita in un processo/container separato. I trunk SIP di IDT Express sono elastici: non è necessario alcun pre-configuramento. Scalate la vostra potenza di calcolo (non il vostro operatore) per gestire i picchi di traffico.
Portata globale: IDT espresso Numeri DID In oltre 140 paesi, la tua piattaforma può accettare chiamate locali in qualsiasi mercato senza dover stipulare contratti separati con operatori telefonici per ogni paese. Un unico account, un'unica API, copertura globale.
Ottimizzazione dei costi su larga scala:
- Utilizza Claude Haiku per i tipi di chiamata semplici (risparmia circa il 70% sui costi di LLM rispetto a Sonnet)
- IDT Express Percorsi istantanei per campagne di chiamate in uscita di massa (tariffe al minuto più basse)
- Percorsi IDT Express Platinum per il contatto diretto con i clienti (la qualità è fondamentale per la fidelizzazione)
- Memorizza nella cache la sintesi vocale per le frasi comuni (saluti, messaggi in attesa): consente di risparmiare circa il 15% sui costi della sintesi vocale.
MESCOLARE/AGITARE: Tutte le chiamate in uscita effettuate tramite IDT Express vengono automaticamente firmate con STIR/SHAKEN. Per le piattaforme di chiamata basate sull'intelligenza artificiale, questo è un requisito imprescindibile: le chiamate non firmate vengono sempre più spesso etichettate come spam dai principali operatori telefonici, compromettendo il tasso di risposta alle chiamate in uscita ancor prima che l'operatore possa parlare.
Per iniziare: la tua lista di controllo Stack
| Componente | Strumento consigliato | È ora di impostare |
|---|---|---|
| Trasportatore / Tronco SIP | IDT espresso | 10 minuti |
| Numeri DID | IDT espresso | Istantaneo tramite API |
| STT | Deepgram Nova-2 | 15 minuti |
| LLM | Claude Sonnet (Anthropic API) | 10 minuti |
| TTS | Cartesia o ElevenLabs | 15 minuti |
| Orchestrazione | Pipecat | 30 minuti |
| Infra | AWS/GCP + Docker | 1-2 ore |
Cronologia realistica:
- Prova di fattibilità: 1-2 giorni
- Agente di produzione monouso: 1-2 settimane
- Piattaforma completa multi-caso d'uso con funzionalità di analisi: 4-8 settimane
Domande frequenti
D: Posso creare una piattaforma di chiamate basata sull'intelligenza artificiale senza esperienza di programmazione? R: Non realisticamente, con l'infrastruttura descritta qui. Per le soluzioni senza codice, Vapi, Bland AI e Synthflow sono piattaforme gestite create appositamente. Se desideri crearne una tua e disponi di un team di sviluppo, questa guida copre tutto ciò che ti serve.
D: Perché il codec audio è importante per le chiamate tramite intelligenza artificiale? A: I motori di riconoscimento vocale basati sull'IA offrono prestazioni significativamente migliori con l'audio non compresso G.711 rispetto all'audio compresso G.729. I codec compressi introducono artefatti che riducono la precisione della trascrizione fino al 15%, il che degrada l'input del sistema LLM e produce risposte meno accurate da parte dell'agente. I percorsi di IDT Express Platinum utilizzano di default il codec G.711.
D: Come posso ottenere i numeri di telefono per la mia piattaforma di chiamate basata sull'intelligenza artificiale? A: IDT Express fornisce numeri DID (Direct Inward Dialing) in oltre 140 paesi, attivabili tramite API. I numeri si attivano istantaneamente. È possibile assegnarli ai flussi di chiamate in entrata, fornirli a specifici agenti AI o utilizzarli per l'identificazione del chiamante in uscita.
D: La mia piattaforma di chiamate basata sull'intelligenza artificiale deve essere conforme agli standard STIR/SHAKEN? R: Sì, per le chiamate in uscita dagli Stati Uniti. Le normative FCC richiedono la firma STIR/SHAKEN su tutte le chiamate in uscita. IDT Express gestisce questo aspetto automaticamente: tutto il traffico in uscita è firmato con il livello di attestazione A. Le chiamate in uscita non conformi vengono sempre più spesso etichettate come "Probabilmente spam" dai principali operatori.
Passi successivi
Se sei pronto a costruire:
- Crea un account IDT Express gratuito — Ottieni le tue credenziali SIP e un credito gratuito di 25 $. Bastano 60 secondi.
- Registrati per accedere all'API di Anthropologie — La tua chiave API Claude è disponibile immediatamente su console.anthropic.com
- Installare Pipecat — pip install pipecat-ai ed esegui la guida rapida
- Effettua la tua prima chiamata AI — una prova di concetto funzionante in meno di un giorno
Per il livello di trasporto — l'infrastruttura che collega la tua IA alla rete telefonica reale — Terminazione voce IDT Express and Trunking SIP È stato progettato specificamente per i carichi di lavoro vocali basati sull'intelligenza artificiale: include audio G.711, concorrenza elastica, numeri DID globali e conformità STIR/SHAKEN.


