Borsa di New York: IDT
Mantieniti sempre un passo avanti con IDT Express.
Prodotti

Scopri come i nostri prodotti possono rivoluzionare il modo in cui comunichi e collabori.

Voce

Esplora le nostre soluzioni vocali avanzate progettate per ottimizzare i tuoi flussi di lavoro di comunicazione.

Ampia gamma di soluzioni di numeri DID progettate per migliorare le tue capacità di comunicazione.

Sperimenta un'efficienza di comunicazione senza precedenti con le nostre soluzioni avanzate di trunking SIP.

Tecnologia all'avanguardia per rilevare e neutralizzare in modo proattivo i flag di spam sui tuoi numeri DID.

Consenti ai tuoi clienti di entrare in contatto con la tua attività componendo un numero verde.

Agenti vocali dotati di intelligenza artificiale che gestiscono le chiamate, acquisiscono lead e forniscono assistenza clienti automaticamente, in qualsiasi momento.
Messaging

Ovunque sia il tuo pubblico, la nostra piattaforma garantisce messaggi senza soluzione di continuità su diversi canali.

Costruisci i percorsi dei clienti promuovendo conversazioni interattive, il tutto all'interno della struttura della tua app. 

Connettiti con il tuo pubblico in modo semplice ed efficace attraverso la nostra piattaforma SMS all'avanguardia. 

BYOC

Sfrutta la potenza di IDT come vettore prescelto sfruttando le funzionalità e i servizi avanzati della tua piattaforma.

Integra Twilio con la nostra robusta piattaforma di routing del vettore per ottenere un sistema di terminazione vocale senza pari.

Sperimenta servizi di comunicazione affidabili e di alta qualità sfruttando le capacità avanzate di Genesys. 

Integra IDT con la forza collaborativa di MS Teams, sbloccando una comunicazione efficiente e ricca di funzionalità. 

Sperimenta la potenza della nostra rete di corrieri perfettamente connessa a Plivo attraverso la nostra soluzione BYOC all'avanguardia. 

Strumenti

Sperimenta la potenza dei nostri strumenti vocali online, progettati per semplificare la gestione delle comunicazioni. 

Garantisci l'autenticità e l'integrità delle chiamate in uscita con il nostro strumento di verifica STIR/SHAKEN. 

Strumento intuitivo per verificare la reputazione del tuo numero aziendale, assicurandoti che rimanga affidabile. 

Confronta e ottieni informazioni dettagliate sulle spese delle chiamate in uscita, ottimizza il budget e prendi decisioni informate. 

Stima e confronta facilmente i costi associati a diversi fornitori di numeri DID. 

Confronta le tariffe VoIP in entrata tra i principali fornitori di CPaaS e ottimizza i costi delle chiamate in entrata. 

Genera modelli SMS personalizzati. 

Risorse

Potenzia te stesso con le risorse di cui hai bisogno per prosperare nel panorama dinamico della comunicazione.

Articoli che coprono una vasta gamma di argomenti.

Scopri le nostre video guide.

Ottieni risposte a domande comuni.

Trova le istruzioni per sfruttare al meglio i nostri prodotti.

Rimani informato sulle notizie più importanti di oggi

Scopri approfondimenti e tendenze nel settore delle telecomunicazioni.

Trova le definizioni dei termini più diffusi nel settore delle telecomunicazioni.

Scopri i prossimi eventi nel nostro calendario
Azienda

Un partner di telecomunicazioni globale creato per soddisfare le tue esigenze. 

Scopri la storia dietro il nostro impegno nel fornire soluzioni innovative per connettere persone e aziende in tutto il mondo. 

Scopri la nostra solida infrastruttura di rete che si estende in tutto il mondo, garantendo una connettività affidabile e sicura. 

Hai una domanda, un feedback o hai bisogno di assistenza? Il nostro team dedicato è qui per aiutarti!

Trova partner o iscriviti ai programmi di partnership.

Borsa di New York: IDT
Impara / Blog

Come costruire una piattaforma di chiamate basata sull'IA (2026): Stack, architettura e configurazione dell'operatore

|
| 8 minuti
|
In questo articolo

Come creare la propria piattaforma di chiamate basata sull'intelligenza artificiale nel 2026

La guida completa allo stack: LLM, STT, TTS e il livello portante che la maggior parte dei tutorial tralascia.

Nel 2024, un'intelligenza artificiale in grado di effettuare una telefonata era una novità. Entro il 2026, sarà diventata una prassi aziendale standard. Chiamata AI Le piattaforme gestiscono l'assistenza in entrata, qualificano i lead, prenotano appuntamenti, riscuotono pagamenti e conducono campagne in uscita, il tutto senza l'intervento di un operatore umano.

La maggior parte delle aziende acquista questa funzionalità già pronta da piattaforme come Vapi, Bland AI o Retell. Ma un numero crescente di aziende – agenzie, rivenditori di telecomunicazioni, sviluppatori di SaaS e imprese con elevati volumi di chiamate – sta sviluppando soluzioni interne. Perché?

  • Costo. Su larga scala, le piattaforme gestite applicano tariffe tutto compreso tra $0.07 e $0.15 al minuto. Creando la propria infrastruttura, la stessa chiamata costa tra $0.02 e $0.04.
  • Controllo. Puoi scegliere ogni singolo componente: LLM, voce, telefonia, logica di instradamento.
  • Vantaggio competitivo. La vostra infrastruttura di chiamata diventa un vantaggio competitivo proprietario, non un servizio standard che ogni concorrente può acquistare.

Questa guida illustra l'architettura completa: la funzione di ogni livello, gli strumenti da utilizzare, le loro connessioni e, aspetto fondamentale, il livello dell'infrastruttura del fornitore di servizi, che la maggior parte dei tutorial trascura ma che determina se la piattaforma funziona effettivamente su larga scala.

I quattro livelli di ogni piattaforma di chiamate basata sull'intelligenza artificiale

Prima di scegliere gli strumenti, è importante comprenderne la struttura. Ogni Chiamata AI La piattaforma, che tu la crei o la acquisti, si basa su quattro livelli che lavorano in sequenza:

Caller's phone
[Layer 1] Telephony / Carrier
      │  SIP trunk, PSTN gateway, DID numbers
[Layer 2] Speech-to-Text (STT)
      │  Transcribes caller audio in real time
[Layer 3] LLM (Large Language Model)
      │  Understands intent, decides response
[Layer 4] Text-to-Speech (TTS)
      │  Converts response to natural voice audioT
Back to caller

Il flusso audio si sviluppa continuamente in due direzioni. Il chiamante parla → il sistema STT trascrive → il sistema LLM genera una risposta → il sistema TTS sintetizza l'audio → il chiamante ascolta la risposta. Il server gestisce tutti e quattro i livelli in tempo reale. L'obiettivo end-to-end è di impiegare meno di 800 ms tra "il chiamante smette di parlare" e "l'operatore inizia a parlare". Qualsiasi intervallo superiore a 1,000 ms indica che la connessione è stata interrotta.

Costruiamo ogni strato.

Livello 1: La telefonia — Il fondamento che tutti sottovalutano

Questo è il livello che la maggior parte dei tutorial tralascia con "usa Twilio" e andare avanti. È anche il livello che determina il costo al minuto, la qualità audio e se l'agente AI suona naturale o robotico.

Cosa fa questo livello:

  • Riceve chiamate in entrata da numeri di telefono reali (PSTN)
  • Instrada le chiamate in uscita verso qualsiasi destinazione
  • Trasmette l'audio al tuo server tramite WebSocket o SIP.
  • Fornisce i numeri di telefono che i tuoi chiamanti compongono

Le tue due opzioni:

Opzione A — Telefonia gestita (Twilio, ecc.)

Configurazione rapida. Tariffe CPaaS al dettaglio (0.013 $/minuto + chiamate in uscita, più commissioni della piattaforma). Ottimo per la prototipazione e bassi volumi. Con oltre 100,000 minuti al mese, i costi aumentano rapidamente.

Collega la tua piattaforma direttamente a un fornitore di terminazione SIP all'ingrosso. Tariffe al minuto più basse, pieno controllo sull'instradamento, nessun ricarico della piattaforma. Configurazione in 10 minuti. Risparmio del 30-60% su larga scala.

Per le build di produzione, IDT Express è il livello di supporto consigliato.

IDT Express è un fornitore di servizi di terminazione voce all'ingrosso supportato da IDT Corporation (NYSE: IDT), uno dei più grandi operatori di telefonia vocale all'ingrosso al mondo con oltre 25 anni di esperienza nelle infrastrutture di trasporto. Trunking SIP and terminazione vocale dà il tuo Chiamata AI piattaforma:

  • Percorsi Platinum — Audio non compresso G.711, ritardo post-composizione inferiore a 3 secondi, ottimizzato specificamente per i carichi di lavoro degli agenti vocali AI in cui la qualità del codec influisce direttamente sulla precisione STT
  • Oltre 1,000 percorsi CLI In oltre 200 paesi, la tua piattaforma ti permette di effettuare e ricevere chiamate in tutto il mondo fin dal primo giorno.
  • Numeri DID in oltre 140 paesi — Fornisci ai tuoi agenti numeri di telefono locali reali in qualsiasi mercato, istantaneamente tramite API
  • Concorrenza elastica — scalabile da 10 a oltre 10,000 chiamate simultanee senza pre-configurazione
  • MESCOLARE / AGITARE firmato Le chiamate in uscita sono firmate con livello di attestazione A, impedendo l'etichettatura come spam che riduce drasticamente il tasso di risposta.

Configurazione SIP (compatibile con qualsiasi framework SIP):

SIP Server: sip.idtexpress.com
Transport: TLS (recommended) or UDP
Codec: G.711 ulaw (PCMU) — critical for AI workloads
Authentication: Digest auth with your IDT Express credentials
DTMF: RFC 2833Linguaggio di codifica: CSS (css)

Ottieni gratuitamente le tue credenziali SIP su idtexpress.com/sign-upLe credenziali sono disponibili immediatamente dopo la registrazione, senza bisogno di alcuna chiamata commerciale.

Livello 2: Dal parlato al testo — Ascoltare chi chiama

Il livello STT converte l'audio del chiamante in testo che il tuo LLM può elaborare. Per le chiamate AI basate su telefono, questo è più difficile di quanto sembri: l'audio telefonico viene trasmesso a 8 kHz mulaw, non ai 16 kHz PCM previsti dalla maggior parte degli strumenti audio.

Requisiti fondamentali per i sistemi STT di telefonia:

  • Supporto nativo per mulaw a 8 kHz (nessun passaggio di ricampionamento = latenza inferiore)
  • Trascrizione in streaming (parola per parola mentre il chiamante parla, non dopo che ha smesso)
  • Latenza media inferiore a 300 ms
  • Precisione sui dati alfanumerici: numeri di telefono, codici di conferma, indirizzi e-mail
  • Robustezza al rumore: le linee telefoniche presentano rumore di fondo e artefatti di compressione.

Opzioni consigliate:

ProviderLatenzaIdeale per
Deepgram Nova-2~200 msProduzione, miglior rapporto qualità/prezzo
AssemblyAI Universal-3~307 msMassima precisione sui caratteri alfanumerici.
OpenAI Whisper (ospitato)~400 msUso generale, facile integrazione
Google STT Streaming~250 msMultilingue, aziendale

Per la maggior parte delle piattaforme di chiamata basate sull'intelligenza artificiale, Deepgram Nova-2 è la scelta predefinita: accetta nativamente mulaw a 8 kHz, offre una latenza P50 di circa 200 ms e ha un'eccellente precisione sui dati strutturati che i chiamanti condividono al telefono (numeri, prefissi, indirizzi).

Integrazione rapida (Python, Deepgram):

import deepgram

dg_client = deepgram.Deepgram(DEEPGRAM_API_KEY)

async def transcribe_stream(audio_stream):
    response = await dg_client.transcription.live({
        'encoding': 'mulaw',
        'sample_rate': 8000,
        'model': 'nova-2',
        'interim_results': True,
        'endpointing': 300,
    })
    # Send audio chunks as they arrive from your SIP/WebSocket layer
    async for chunk in audio_stream:
        response.send(chunk)
Linguaggio di codifica: Python (python)

Livello 3: Il cervello LLM — Claude per AI Calling

Il sistema LLM riceve la trascrizione del testo del chiamante, mantiene il contesto della conversazione, decide cosa dire successivamente e, facoltativamente, richiama strumenti esterni (il tuo CRM, il calendario, il sistema di pagamento).

Perché Claude per le chiamate tramite intelligenza artificiale:

Claude (Anthropic) si è affermato come una valida alternativa per i modelli LLM di agenti vocali per diverse ragioni specifiche relative ai casi d'uso delle chiamate:

  • Istruzioni seguenti Claude segue con precisione le complesse istruzioni di sistema che definiscono il profilo dell'agente, il flusso delle chiamate, le regole di escalation e l'utilizzo degli strumenti. In un contesto di chiamata, un agente che si discosta dal copione rappresenta un problema serio. L'aderenza di Claude alle istruzioni è ai massimi livelli.
  • Risposte concise — Claude tende a fornire risposte più brevi e colloquiali quando viene sollecitato correttamente — aspetto essenziale per la voce, dove le risposte lunghe risultano innaturali e aumentano la latenza della sintesi vocale.
  • Uso dello strumento — La funzione di chiamata di Claude (utilizza l'API dello strumento) gestisce le ricerche in tempo reale — verifica della disponibilità del calendario, interrogazione dei record CRM, verifica dello stato degli ordini — in modo affidabile e con la corretta formattazione JSON.
  • Contesto multi-turno — mantiene un contesto di conversazione coerente per tutta la durata della chiamata, senza "dimenticare" gli scambi precedenti.

Selezione del modello da chiamare:

  • Claudio Haiku — Latenza minima (~150 ms), ideale per flussi in entrata semplici (FAQ, pianificazione del percorso, conferma dell'appuntamento)
  • Claude Sonetto — Latenza e ragionamento bilanciati, ideali per la maggior parte dei casi d'uso delle chiamate.
  • Claudio Opus — massima qualità di ragionamento, da utilizzare solo quando la complessità della chiamata lo richiede (vendite complesse, negoziazioni)

Struttura dei messaggi di sistema per l'operatore chiamante:

You are [Agent Name], a [role] for [Company].

PERSONALITY: [tone, style — e.g., "professional but warm, concise"]

YOUR GOAL: [primary objective — e.g., "qualify inbound leads and book a demo"]

CALL FLOW:
1. Greet caller by name if available
2. Identify their need in one open question
3. [flow logic...]
4. If you cannot resolve: transfer to human agent

RULES:
- Keep all responses under 3 sentences
- Never fabricate informationif unsure, say so
- Always confirm before taking any action (booking, updating records)
- End the call professionally if the caller asks to stop

TOOLS AVAILABLE:
- check_calendar(date, time) → returns availability
- create_booking(name, email, date, time) → books appointment
- lookup_customer(phone_number) → returns CRM recordLinguaggio di codifica: CSS (css)

Livello 4: Sintesi vocale — La voce del tuo agente

Il livello TTS converte la risposta testuale di Claude in un audio dal suono naturale, che viene trasmesso all'interlocutore. La qualità della voce in questa fase influisce direttamente sulla fiducia e sull'interazione degli interlocutori con il tuo operatore.

Requisiti chiave:

  • Streaming TTS (inizia la riproduzione prima che venga generata la risposta completa: riduce la latenza di circa il 40%)
  • Generazione del primo byte a bassa latenza (<300 ms)
  • Prosodia naturale: pause, enfasi, ritmo
  • Uscita compatibile con la telefonia (8 kHz o convertibile)

Opzioni consigliate:

ProviderQualità della voceLatenzaIdeale per
UndiciLabsMassimo~250 msOrientato al cliente, premium
CartesiaOttimo~100 msChiamata sensibile alla latenza
OpenAI TTSMolto Buone~300 msIntegrazione semplice, coerente
Azure Neural TTSMolto Buone~200 msAziendale, multilingue

Per le piattaforme di chiamate basate sull'intelligenza artificiale, Cartesia ha guadagnato popolarità soprattutto grazie alla sua latenza del primo byte audio inferiore a 100 ms: un aspetto fondamentale quando è necessario che l'operatore inizi a parlare immediatamente dopo l'elaborazione.

Orchestrazione: Collegare i quattro livelli

Il tuo server è il livello di orchestrazione, ovvero il bridge WebSocket che instrada l'audio tra la telefonia e la tua pipeline di intelligenza artificiale. Due framework principali:

Pipecat (software open source, consigliato)

from pipecat.pipeline.pipeline import Pipeline
from pipecat.services.deepgram import DeepgramSTTService
from pipecat.services.anthropic import AnthropicLLMService
from pipecat.services.cartesia import CartesiaTTSService
from pipecat.transports.network.fastapi_websocket import FastAPIWebsocketTransport

async def run_agent(websocket):
    transport = FastAPIWebsocketTransport(websocket)

    pipeline = Pipeline([
        transport.input(),           # Audio in from SIP/WebSocket
        DeepgramSTTService(),        # Speech to text
        AnthropicLLMService(         # Claude LLM
            model="claude-sonnet-4-20250514",
            system=SYSTEM_PROMPT
        ),
        CartesiaTTSService(),        # Text to speech
        transport.output()           # Audio out to caller
    ])

    await pipeline.run()Linguaggio di codifica: Python (python)

Agenti LiveKit (open source, per una scalabilità maggiore) Ideale quando è necessario gestire migliaia di chiamate simultanee con WebRTC e SIP. Richiede un'infrastruttura più complessa, ma offre una gestione della concorrenza nettamente superiore.

Assemblaggio: l'architettura completa

Caller dials DID number (IDT Express)
              │
              ▼
    IDT Express SIP Trunk
    (G.711 audio, Platinum route)
              │
              ▼
    Your SIP Gateway / WebSocket Server
    (Pipecat or LiveKit orchestration)
         │            │
         ▼            ▼
  Deepgram STT    Cartesia TTS
  (transcribe)    (synthesise)
         │            ▲
         ▼            │
    Claude Sonnet (Anthropic)
    (understand + decide + respond)
         │
         ▼
    Tool calls (CRM, calendar, payments)

Budget di latenza end-to-end (obiettivo: inferiore a 800 ms):

  • Tempo di connessione telefonica al server: ~50 ms (percorso IDT Platinum)
  • STT (Deepgram): ~200ms
  • LLM (Sonetto di Claude): ~200 ms
  • Primo byte TTS (Cartesia): ~100ms
  • Tempo di risposta dal server alla telefonia: ~50 ms
  • Totale: ~600 ms

Scalabilità della piattaforma

Una volta che la prova di concetto con un singolo agente funziona, la scalabilità richiede:

Chiamate simultanee: Ogni chiamata viene eseguita in un processo/container separato. I trunk SIP di IDT Express sono elastici: non è necessario alcun pre-configuramento. Scalate la vostra potenza di calcolo (non il vostro operatore) per gestire i picchi di traffico.

Portata globale: IDT espresso Numeri DID In oltre 140 paesi, la tua piattaforma può accettare chiamate locali in qualsiasi mercato senza dover stipulare contratti separati con operatori telefonici per ogni paese. Un unico account, un'unica API, copertura globale.

Ottimizzazione dei costi su larga scala:

  • Utilizza Claude Haiku per i tipi di chiamata semplici (risparmia circa il 70% sui costi di LLM rispetto a Sonnet)
  • IDT Express Percorsi istantanei per campagne di chiamate in uscita di massa (tariffe al minuto più basse)
  • Percorsi IDT Express Platinum per il contatto diretto con i clienti (la qualità è fondamentale per la fidelizzazione)
  • Memorizza nella cache la sintesi vocale per le frasi comuni (saluti, messaggi in attesa): consente di risparmiare circa il 15% sui costi della sintesi vocale.

MESCOLARE/AGITARE: Tutte le chiamate in uscita effettuate tramite IDT Express vengono automaticamente firmate con STIR/SHAKEN. Per le piattaforme di chiamata basate sull'intelligenza artificiale, questo è un requisito imprescindibile: le chiamate non firmate vengono sempre più spesso etichettate come spam dai principali operatori telefonici, compromettendo il tasso di risposta alle chiamate in uscita ancor prima che l'operatore possa parlare.

Per iniziare: la tua lista di controllo Stack

ComponenteStrumento consigliatoÈ ora di impostare
Trasportatore / Tronco SIPIDT espresso10 minuti
Numeri DIDIDT espressoIstantaneo tramite API
STTDeepgram Nova-215 minuti
LLMClaude Sonnet (Anthropic API)10 minuti
TTSCartesia o ElevenLabs15 minuti
OrchestrazionePipecat30 minuti
InfraAWS/GCP + Docker1-2 ore

Cronologia realistica:

  • Prova di fattibilità: 1-2 giorni
  • Agente di produzione monouso: 1-2 settimane
  • Piattaforma completa multi-caso d'uso con funzionalità di analisi: 4-8 settimane

Domande frequenti

D: Posso creare una piattaforma di chiamate basata sull'intelligenza artificiale senza esperienza di programmazione? R: Non realisticamente, con l'infrastruttura descritta qui. Per le soluzioni senza codice, Vapi, Bland AI e Synthflow sono piattaforme gestite create appositamente. Se desideri crearne una tua e disponi di un team di sviluppo, questa guida copre tutto ciò che ti serve.

D: Perché il codec audio è importante per le chiamate tramite intelligenza artificiale? A: I motori di riconoscimento vocale basati sull'IA offrono prestazioni significativamente migliori con l'audio non compresso G.711 rispetto all'audio compresso G.729. I codec compressi introducono artefatti che riducono la precisione della trascrizione fino al 15%, il che degrada l'input del sistema LLM e produce risposte meno accurate da parte dell'agente. I percorsi di IDT Express Platinum utilizzano di default il codec G.711.

D: Come posso ottenere i numeri di telefono per la mia piattaforma di chiamate basata sull'intelligenza artificiale? A: IDT Express fornisce numeri DID (Direct Inward Dialing) in oltre 140 paesi, attivabili tramite API. I numeri si attivano istantaneamente. È possibile assegnarli ai flussi di chiamate in entrata, fornirli a specifici agenti AI o utilizzarli per l'identificazione del chiamante in uscita.

D: La mia piattaforma di chiamate basata sull'intelligenza artificiale deve essere conforme agli standard STIR/SHAKEN? R: Sì, per le chiamate in uscita dagli Stati Uniti. Le normative FCC richiedono la firma STIR/SHAKEN su tutte le chiamate in uscita. IDT Express gestisce questo aspetto automaticamente: tutto il traffico in uscita è firmato con il livello di attestazione A. Le chiamate in uscita non conformi vengono sempre più spesso etichettate come "Probabilmente spam" dai principali operatori.


Passi successivi

Se sei pronto a costruire:

  1. Crea un account IDT Express gratuito — Ottieni le tue credenziali SIP e un credito gratuito di 25 $. Bastano 60 secondi.
  2. Registrati per accedere all'API di Anthropologie — La tua chiave API Claude è disponibile immediatamente su console.anthropic.com
  3. Installare Pipecat — pip install pipecat-ai ed esegui la guida rapida
  4. Effettua la tua prima chiamata AI — una prova di concetto funzionante in meno di un giorno

Per il livello di trasporto — l'infrastruttura che collega la tua IA alla rete telefonica reale — Terminazione voce IDT Express and Trunking SIP È stato progettato specificamente per i carichi di lavoro vocali basati sull'intelligenza artificiale: include audio G.711, concorrenza elastica, numeri DID globali e conformità STIR/SHAKEN.

Inizia a costruire — gratis un conto →

Condividi questo articolo

Lascia un Commento

I campi obbligatori sono contrassegnati con *

Valuta questo articolo

Tags

Incontra il nostro instradamento vocale all'ingrosso

Soddisfa tutte le tue esigenze di chiamate vocali con la nostra terminazione vocale AZ all'ingrosso leader di categoria.
Prova IDT Express per un credito di $ 25

Ottieni $ 25 di credito di prova gratuito

Ricevi articoli IDT Express nella tua casella di posta

La migliore fonte di informazioni nel settore delle telecomunicazioni. Unisciti a noi.

    Più popolare

    WebRTC contro SIP per i bot vocali
    |
    | 9 minuti
    La maggior parte degli articoli lo presenta come una scelta. Non lo è. WebRTC...
    Quanto costa l'API di WhatsApp Business nel 2026?
    |
    | 7 minuti
    Chiedi "quanto costa l'API WhatsApp Business?" e...
    WhatsApp Business contro API nel 2026
    |
    | 8 minuti
    Cerca "App WhatsApp Business vs API" e otterrai...