AI Голосовой Ассистент
Поговорите с AI в реальном времени
🔐 Токен авторизации:
⚙️ Настройки
▼
STT Провайдер (распознавание речи):
Deepgram
Yandex SpeechKit
T-one (локальная модель)
Local (GigaAM, self-hosted)
Local (Parakeet-TDT, self-hosted)
GigaAM v3 (on-prem, свой end-of-turn)
Gemini 3.5 Transcribe
Модель:
nova-2
Модель Deepgram:
Nova-2 (стабильная)
Nova-3 (новая, ru/en)
Язык распознавания:
Русский
English
LLM Провайдер:
GigaChat (Sber)
OpenAI
Anthropic (Claude)
YandexGPT
Google Gemini
GLM (Z.ai / Zhipu)
Qwen (Alibaba DashScope)
Gemini Live (voice-to-voice) 🚀
Grok Voice (voice-to-voice) ⚡
Local LLM 🏠
Модель:
Температура
ⓘ
0.9
Уровень «думания»
ⓘ
По умолчанию (модель сама)
Minimal (быстрее всего)
Low
Medium
High (глубже, медленнее)
TTS Провайдер (синтез речи):
OpenAI
Yandex SpeechKit
ElevenLabs
Local (F5-TTS, self-hosted)
Модель:
tts-1
Голос TTS:
Alloy (нейтральный)
Echo (мужской)
Fable (британский)
Onyx (глубокий)
Nova (женский)
Shimmer (мягкий)
Амплуа (роль):
Нейтральная
Промпт для настройки голоса Gemini TTS (необязательно):
ⓘ
Промпт для агента (необязательно):
Ты тренер по тайм-менеджменту. Тема тренировки — как собеседник планирует свою ближайшую неделю: задачи, приоритеты, встречи. Задавай уточняющие вопросы строго по теме планирования недели, помогай структурировать план, давай короткий конкретный фидбэк. Не давай собеседнику надолго уходить в посторонние темы (отпуск, отношения, жалобы на жизнь). Говори кратко, по-русски, 1-2 предложения за реплику.
🎙️ Микрофон по кнопке (push-to-talk)
Включить режим push-to-talk
ⓘ
💡 Во время звонка появится кнопка: зажмите её — говорите, отпустите — агент ответит.
🧠 Контекстный turn-detector
Режим определения конца реплики
ⓘ
LiveKit MultilingualModel (локальная модель)
LLM-судья (Qwen)
Выключен (фиксированная пауза 2.0с)
Модель LLM-судьи (DashScope)
ⓘ
qwen3.7-flash — новейшая flash
qwen3.6-flash
qwen3.5-35b-a3b — открытая MoE (3B активных)
qwen3-8b — открытая dense 8B
qwen3.8-max — флагман (медленный, для сравнения)
max_delay — ждать продолжения, если «не договорил» (сек)
ⓘ
Настройки VAD (Voice Activity Detection)
▼
Минимальная длительность речи
ⓘ
0.05 сек
Длительность тишины для конца речи
ⓘ
0.55 сек
Паддинг в начале речи
ⓘ
0.5 сек
Порог активации VAD
ⓘ
0.5
Частота дискретизации
ⓘ
16000 Hz
8000 Hz
Подключиться
Отключиться
Готов к подключению
ID сессии:
-
Комната:
-
Статус:
-
Перебиваний:
0
🛑 Агент перебил пользователя
Причина (Grok):
🎙️ Зажмите, чтобы говорить
Кнопка отпущена — агент отвечает. Можно удерживать пробел.
📝 Транскрипт разговора
⚖️ LLM-судья: договорил ли юзер?