Как создать собственную платформу для звонков с использованием ИИ в 2026 году
Полное руководство по стеку технологий — LLM, STT, TTS и уровень оператора связи, который в большинстве руководств пропускается.
В 2024 году телефонный звонок, совершаемый искусственным интеллектом, был в новинку. К 2026 году это станет стандартной бизнес-инфраструктурой. Искусственный интеллект Платформы обрабатывают входящие запросы в службу поддержки, квалифицируют потенциальных клиентов, назначают встречи, принимают платежи и проводят исходящие кампании — и все это без участия человека на линии.
Большинство компаний приобретают подобные возможности готовыми решения на таких платформах, как Vapi, Bland AI или Retell. Но все большее число компаний — агентства, реселлеры телекоммуникационных услуг, разработчики SaaS-решений и предприятия с большим объемом звонков — создают собственные решения. Почему?
- Стоимость. В больших масштабах управляемые платформы взимают 0.07–0.15 доллара США в минуту за все услуги. Если вы создадите собственную систему обработки вызовов, то тот же вызов обойдется вам в 0.02–0.04 доллара США.
- Контроль. Вы выбираете каждый компонент — LLM, голосовую связь, телефонию, логику маршрутизации.
- Конкурентное преимущество. Ваша инфраструктура для совершения звонков превращается в защищенный от внешних воздействий барьер, а не в общедоступную услугу, которую может приобрести каждый конкурент.
В этом руководстве подробно рассматривается вся архитектура: что делает каждый слой, какие инструменты использовать, как они взаимодействуют и — что особенно важно — слой инфраструктуры оператора связи, который в большинстве руководств опускается на второй план, но который определяет, будет ли ваша платформа действительно работать в масштабе.
Четыре уровня каждой платформы для звонков с использованием ИИ.
Прежде чем выбирать инструменты, разберитесь в их наборе. Каждый Искусственный интеллект Платформа — независимо от того, создаете вы ее сами или покупаете — работает на четырех уровнях, функционирующих последовательно:
Caller's phone
│
▼
[Layer 1] Telephony / Carrier
│ SIP trunk, PSTN gateway, DID numbers
▼
[Layer 2] Speech-to-Text (STT)
│ Transcribes caller audio in real time
▼
[Layer 3] LLM (Large Language Model)
│ Understands intent, decides response
▼
[Layer 4] Text-to-Speech (TTS)
│ Converts response to natural voice audioT
│
▼
Back to caller
Аудиопоток непрерывно передается в двух направлениях. Звонящий говорит → STT транскрибирует → LLM генерирует ответ → TTS синтезирует аудио → звонящий слышит ответ. Ваш сервер управляет всеми четырьмя уровнями в режиме реального времени. Целевой показатель сквозного соединения: менее 800 мс от момента, когда «звонящий перестает говорить», до момента, когда «оператор начинает говорить». Если время превышает 1,000 мс, звонящий считает, что соединение разорвано.
Давайте построим каждый слой.
Уровень 1: Телефония — Основа, которую все недооценивают
Этот уровень большинство руководств пропускают, переходя к разделу «использование». Twilio«Идите дальше». Это также слой, определяющий вашу поминутную стоимость, качество звука и то, будет ли ваш ИИ-агент звучать естественно или роботизированно.
Что делает этот слой:
- Принимает входящие звонки с реальных телефонных номеров (PSTN).
- Направляет исходящие звонки в любой пункт назначения.
- Передает аудиопоток на ваш сервер через WebSocket или SIP.
- Предоставляет номера телефонов, по которым звонят ваши абоненты.
У вас два варианта:
Вариант А — Управляемая телефония (Twilio и др.)
Быстрая настройка. Оплата по розничным тарифам CPaaS (0.013 долл./мин+ исходящие звонки, плюс плата за платформу). Отлично подходит для прототипирования и небольших объемов. При объеме звонков более 100 000 минут в месяц затраты быстро растут.
Вариант B — Прямой SIP-транк (рекомендуется для использования в производственной среде)
Подключите свою платформу напрямую к оптовому поставщику услуг SIP-терминации. Более низкие поминутные тарифы, полный контроль над маршрутизацией, отсутствие наценки платформы. Настройка занимает 10 минут. Экономия 30–60% в масштабе предприятия.
Для производственных сборок рекомендуется использовать IDT Express в качестве несущего слоя.
IDT Express — это оптовый поставщик услуг по завершению голосовых вызовов, поддерживаемый корпорацией IDT (NYSE: IDT) — одним из крупнейших в мире оптовых операторов голосовой связи с более чем 25-летним опытом работы в сфере инфраструктуры операторов связи. SIP-транкинг и голосовое завершение дает ваш Искусственный интеллект Платформа:
- Платиновые маршруты — Несжатый звук G.711, задержка после набора номера менее 3 секунд, оптимизирован специально для рабочих нагрузок голосовых агентов с искусственным интеллектом, где качество кодека напрямую влияет на точность передачи данных.
- Более 1,000 маршрутов CLI В более чем 200 странах — ваша платформа сможет совершать и принимать звонки по всему миру с первого дня.
- DID номера в 140+ странах — Мгновенно предоставляйте своим агентам реальные местные телефонные номера на любом рынке через API.
- Эластичная параллельность — масштабируемость от 10 до 10 000+ одновременных вызовов без предварительной настройки.
- ВМЕШАТЬ / ВСТРЕШАТЬ подписанный Исходящие звонки подписываются с уровнем аттестации A, что предотвращает появление спам-меток, снижающих процент ответов.
Настройка SIP (работает с любой SIP-совместимой средой):
SIP Server: sip.idtexpress.com
Transport: TLS (recommended) or UDP
Codec: G.711 ulaw (PCMU) — critical for AI workloads
Authentication: Digest auth with your IDT Express credentials
DTMF: RFC 2833Язык программирования: CSS (CSS)Получите бесплатные SIP-учетные данные на idtexpress.com/sign-upУчетные данные доступны сразу после регистрации — никаких звонков от отдела продаж не требуется.
Уровень 2: Преобразование речи в текст — Прослушивание разговоров ваших собеседников
Слой STT преобразует аудиосигнал звонящего в текст, который может обработать ваш LLM. Для телефонных звонков с использованием ИИ это сложнее, чем кажется — телефонный звук работает на частоте 8 кГц mulaw, а не на 16 кГц PCM, как ожидают большинство аудиоинструментов.
Основные требования к STT для телефонии:
- Встроенная поддержка 8 кГц mulaw (отсутствие этапа передискретизации = меньшая задержка)
- Транскрипция в режиме реального времени (пословно по мере того, как говорит звонящий, а не после того, как он закончит).
- Средняя задержка менее 300 мс
- Точность буквенно-цифровых символов — номера телефонов, коды подтверждения, адреса электронной почты.
- Устойчивость к шуму — телефонные линии подвержены фоновому шуму и артефактам сжатия.
Рекомендуемые варианты:
| Разработчик | Задержка | Лучше всего |
|---|---|---|
| Дипграм Нова-2 | ~200 мс | Производство, лучшее соотношение цены и качества. |
| AssemblyAI Universal-3 | ~307 мс | Максимальная точность при работе с буквенно-цифровыми символами. |
| OpenAI Whisper (размещенный на хостинге) | ~400 мс | Универсальное применение, простая интеграция |
| Google STT Streaming | ~250 мс | Многоязычный, корпоративный |
Для большинства платформ для звонков с использованием ИИ Deepgram Nova-2 является выбором по умолчанию — он изначально поддерживает частоту 8 кГц mulaw, обеспечивает задержку P50 около 200 мс и обладает превосходной точностью при обработке структурированных данных, которыми обмениваются абоненты по телефону (номера, коды, адреса).
Быстрая интеграция (Python, Deepgram):
import deepgram
dg_client = deepgram.Deepgram(DEEPGRAM_API_KEY)
async def transcribe_stream(audio_stream):
response = await dg_client.transcription.live({
'encoding': 'mulaw',
'sample_rate': 8000,
'model': 'nova-2',
'interim_results': True,
'endpointing': 300,
})
# Send audio chunks as they arrive from your SIP/WebSocket layer
async for chunk in audio_stream:
response.send(chunk)
Язык программирования: Питон (питон)Третий уровень: Мозг магистра права — Клод о зове ИИ
Система LLM получает расшифрованный текст звонящего, сохраняет контекст разговора, решает, что сказать дальше, и при необходимости подключается к внешним инструментам (вашей CRM-системе, календарю, платежной системе).
Почему стоит выбрать Claude для звонков с использованием ИИ:
Клод (Anthropic) стал отличным выбором для магистерских программ по голосовым агентам по нескольким причинам, связанным с конкретными сценариями использования голосовых вызовов:
- Инструкция следующая — Клод неизменно следует сложным системным подсказкам, определяющим профиль оператора, схему обработки звонков, правила эскалации и использование инструментов. В контексте телефонных звонков отклонение оператора от сценария — серьезная проблема. Приверженность Клода инструкциям — лучшая в своем классе.
- Краткие ответы — Клод, как правило, предпочитает более короткие, разговорные ответы, если его правильно подсказать, — это особенно важно для голосовой связи, где длинные ответы звучат неестественно и увеличивают задержку синтеза речи.
- Использование инструмента — Функция вызова, созданная Клодом (API инструмента), обеспечивает надежный и корректный поиск в режиме реального времени — проверку доступности календаря, запросы к записям CRM, проверку статуса заказа — с правильным форматированием JSON.
- Многоходовой контекст — Поддерживает связный контекст разговора на протяжении всего звонка, не «забывая» предыдущие обмены репликами.
Выбор модели для звонка:
- Клод Хайку — Минимальная задержка (~150 мс), идеально подходит для простых входящих потоков (FAQ, маршрутизация, подтверждение записи на прием).
- Клод Сонет — Сбалансированная задержка и обоснованность, оптимально подходит для большинства сценариев использования звонков.
- Клод Опус — Высочайшее качество рассуждений, использовать только тогда, когда этого требует сложность звонка (сложные продажи, переговоры).
Структура подсказок системы для оператора колл-центра:
You are [Agent Name], a [role] for [Company].
PERSONALITY: [tone, style — e.g., "professional but warm, concise"]
YOUR GOAL: [primary objective — e.g., "qualify inbound leads and book a demo"]
CALL FLOW:
1. Greet caller by name if available
2. Identify their need in one open question
3. [flow logic...]
4. If you cannot resolve: transfer to human agent
RULES:
- Keep all responses under 3 sentences
- Never fabricate information — if unsure, say so
- Always confirm before taking any action (booking, updating records)
- End the call professionally if the caller asks to stop
TOOLS AVAILABLE:
- check_calendar(date, time) → returns availability
- create_booking(name, email, date, time) → books appointment
- lookup_customer(phone_number) → returns CRM recordЯзык программирования: CSS (CSS)Уровень 4: Преобразование текста в речь — Голос вашего агента
Слой преобразования текста в речь (TTS) преобразует текстовый ответ Клода в естественное звучание, передаваемое обратно звонящему. Качество голоса здесь напрямую влияет на то, насколько звонящие доверяют вашему оператору и насколько активно взаимодействуют с ним.
Основные требования:
- Потоковая передача синтеза речи (начало воспроизведения до генерации полного ответа — сокращает задержку примерно на 40%)
- Генерация первого байта с низкой задержкой (<300 мс)
- Естественная стихосложение — паузы, ударение, темп.
- Выход, совместимый с телефонией (8 кГц или с возможностью преобразования).
Рекомендуемые варианты:
| Разработчик | Качество голоса | Задержка | Лучше всего |
|---|---|---|---|
| Одиннадцать лабораторий | Наивысший | ~250 мс | Клиентоориентированный, премиальный |
| Cartesia | Прекрасно | ~100 мс | звонки, чувствительные к задержке |
| OpenAI TTS | Очень хорошо | ~300 мс | Простая интеграция, стабильная работа |
| Azure Neural TTS | Очень хорошо | ~200 мс | Предприятие, многоязычный |
Для платформ, использующих ИИ для обработки звонков, Cartesia получила широкое распространение именно благодаря задержке первого аудиобайта менее 100 мс — это важно, когда необходимо, чтобы оператор начал говорить сразу после обработки.
Оркестровка: соединение четырех уровней
Ваш сервер — это уровень оркестровки, мост WebSocket, который передает аудиосигнал между телефонией и вашим конвейером обработки ИИ. Существует две основные платформы:
Pipecat (открытый исходный код, рекомендуется)
from pipecat.pipeline.pipeline import Pipeline
from pipecat.services.deepgram import DeepgramSTTService
from pipecat.services.anthropic import AnthropicLLMService
from pipecat.services.cartesia import CartesiaTTSService
from pipecat.transports.network.fastapi_websocket import FastAPIWebsocketTransport
async def run_agent(websocket):
transport = FastAPIWebsocketTransport(websocket)
pipeline = Pipeline([
transport.input(), # Audio in from SIP/WebSocket
DeepgramSTTService(), # Speech to text
AnthropicLLMService( # Claude LLM
model="claude-sonnet-4-20250514",
system=SYSTEM_PROMPT
),
CartesiaTTSService(), # Text to speech
transport.output() # Audio out to caller
])
await pipeline.run()Язык программирования: Питон (питон)Агенты LiveKit (с открытым исходным кодом, для масштабируемости) Наилучший вариант, когда необходимо обрабатывать тысячи одновременных вызовов с использованием WebRTC и SIP. Требуются дополнительные инфраструктурные затраты, но значительно улучшается управление параллельным доступом.
Собираем всё воедино: Полная архитектура
Caller dials DID number (IDT Express)
│
▼
IDT Express SIP Trunk
(G.711 audio, Platinum route)
│
▼
Your SIP Gateway / WebSocket Server
(Pipecat or LiveKit orchestration)
│ │
▼ ▼
Deepgram STT Cartesia TTS
(transcribe) (synthesise)
│ ▲
▼ │
Claude Sonnet (Anthropic)
(understand + decide + respond)
│
▼
Tool calls (CRM, calendar, payments)Целевой показатель сквозной задержки (менее 800 мс):
- Время передачи данных по телефонной линии на сервер: ~50 мс (маршрут IDT Platinum)
- STT (Deepgram): ~200 мс
- LLM (Клод Сонет): ~200 мс
- Первый байт TTS (картезия): ~100 мс
- Время отклика сервера на телефонную линию: ~50 мс
- Всего: ~600 мс ✓
Масштабирование вашей платформы
После того, как ваша экспериментальная версия с использованием одного агента заработает, для масштабирования потребуется:
Одновременные вызовы: Каждый вызов выполняется в собственном процессе/контейнере. SIP-транки IDT Express обладают эластичностью — предварительная настройка не требуется. Масштабируйте свои вычислительные ресурсы (а не ресурсы оператора связи) для обработки пиковых нагрузок.
Глобальный охват: ИДТ Экспресс DID номера Более чем в 140 странах мира ваша платформа может принимать местные звонки на любом рынке без необходимости заключения отдельных договоров с операторами связи для каждой страны. Один аккаунт, один API, глобальное покрытие.
Оптимизация затрат в масштабе:
- Используйте хайку Клода для простых типов звонков (экономия на стоимости LLM составляет примерно 70% по сравнению с сонетом).
- IDT Express: Мгновенные маршруты для исходящих массовых кампаний (самые низкие поминутные тарифы)
- Маршруты IDT Express Platinum для входящих звонков от клиентов (качество имеет значение для удержания клиентов)
- Кэширование TTS для распространенных фраз (приветствия, сообщения во время ожидания) — экономия примерно 15% затрат на TTS.
ПЕРЕМЕШИВАНИЕ/ВЗБОЛТАНИЕ: Все исходящие звонки через IDT Express автоматически подписываются STIR/SHAKEN. Для платформ обработки звонков с использованием ИИ это не подлежит обсуждению — неподписанные звонки всё чаще помечаются крупными операторами связи как спам, что снижает процент ответов на исходящие звонки ещё до того, как оператор начнёт говорить.
Начало работы: ваш контрольный список инструментов.
| Компонент | Рекомендуемый инструмент | Пора настраивать |
|---|---|---|
| Перевозчик / SIP-транк | ИДТ Экспресс | 10 минут |
| DID номера | ИДТ Экспресс | Мгновенно через API |
| STT | Дипграм Нова-2 | 15 минут |
| LLM | Клод Сонне (Антропический API) | 10 минут |
| TTS | Cartesia или ElevenLabs | 15 минут |
| оркестровка | Трубопроводчик | 30 минут |
| Ниже | AWS/GCP + Docker | 1-2 часов |
Реалистичные сроки:
- Рабочий прототип: 1–2 дня
- Производственный агент для одноразового использования: 1–2 недели
- Полноценная многофункциональная платформа с аналитикой: 4–8 недель
Часто задаваемые вопросы
В: Могу ли я создать платформу для звонков с использованием ИИ, не имея опыта программирования? A: На уровне инфраструктуры, описанном здесь, это нереалистично. Что касается вариантов без программирования, Vapi, Bland AI и Synthflow — это специализированные управляемые платформы. Если вы хотите создать свою собственную платформу и у вас есть команда разработчиков, это руководство охватывает все необходимое.
В: Почему аудиокодек важен для звонков с использованием ИИ? A: Системы преобразования речи в текст с использованием ИИ работают значительно лучше с несжатым аудиоформатом G.711, чем со сжатым аудиоформатом G.729. Сжатые кодеки вносят артефакты, которые снижают точность транскрипции до 15%, что ухудшает качество входных данных для вашего LLM и приводит к худшим ответам агента. Маршруты IDT Express Platinum по умолчанию используют G.711.
В: Как получить телефонные номера для моей платформы обработки звонков с использованием ИИ? A: IDT Express предоставляет номера DID (прямой входящий набор) в более чем 140 странах, которые можно активировать через API. Номера активируются мгновенно. Вы можете назначать их для входящих вызовов, передавать определенным агентам ИИ или использовать для определения номера звонящего при исходящих звонках.
В: Должна ли моя платформа для звонков с использованием ИИ соответствовать стандарту STIR/SHAKEN? A: Да, для исходящих звонков из США. Правила FCC требуют подписи STIR/SHAKEN для всех исходящих звонков. IDT Express обрабатывает это автоматически — весь исходящий трафик подписывается с уровнем аттестации A. Несоответствующие требованиям исходящие звонки все чаще помечаются крупными операторами связи как «вероятный спам».
Следующие шаги
Если вы готовы к строительству:
- Создайте бесплатный аккаунт IDT Express. — Получите свои SIP-учетные данные и бесплатный кредит в размере 25 долларов. Займет 60 секунд.
- Зарегистрируйтесь для доступа к Anthropic API. — Ваш API-ключ Клода доступен прямо сейчас на console.anthropic.com
- Установите Pipecat — Установите pipecat-ai с помощью pip и запустите быстрый старт.
- Совершите свой первый звонок с использованием ИИ. — Рабочий прототип менее чем за день
Что касается уровня оператора связи — инфраструктуры, которая соединяет ваш ИИ с реальной телефонной сетью — IDT Express завершение голосовой связи и SIP-транкинг Разработан специально для задач обработки голоса с использованием ИИ: включает поддержку аудиоформата G.711, эластичную параллельность, глобальные номера DID и соответствие стандартам STIR/SHAKEN.


