Как начать работать с Yandex SpeechSense

Сервис Yandex SpeechSense позволяет анализировать каналы коммуникации вашего бизнеса на основе записей разговоров или текстовых сообщений из чатов и интегрируется с вашими АТС и CRM-системами. SpeechSense использует голосовые технологии Yandex SpeechKit для расшифровки аудиозаписей диалогов, их статистического и качественного анализа.

SpeechSense поддерживает анализ аудиозаписей и текстовых диалогов на русском и казахском языках.

Вы можете загрузить в SpeechSense свои данные или воспользоваться демонстрационным примером, который был синтезирован с помощью SpeechKit.

Перед началом работы

  1. Перейдите в консоль управления, затем войдите в Yandex Cloud или зарегистрируйтесь, если вы еще не зарегистрированы. О том, как начать работать с Yandex Cloud, читайте в документе Начало работы с Yandex Cloud.

  2. Примите пользовательское соглашение.

  3. В сервисе Yandex Cloud Billing убедитесь, что у вас подключен платежный аккаунт и он находится в статусе ACTIVE или TRIAL_ACTIVE. Если платежного аккаунта нет, создайте его.

  4. Назначьте вашему аккаунту в Yandex Cloud роль speech-sense.spaces.creator.

    Примечание

    Если вы не можете управлять ролями, обратитесь к администратору вашего облака или организации.

  5. Откройте главную страницу SpeechSense.

  6. Выберите организацию, в которой вы будете работать со SpeechSense, или создайте новую.

Настройте окружение

  1. Создайте пространство, в котором будут находиться все ваши проекты: выберите Создать пространство, введите название, при необходимости добавьте описание и нажмите кнопку Создать.

  2. К пространству привяжите платежный аккаунт, с которого будет оплачиваться использование SpeechSense.

    Примечание

    Для управления платежным аккаунтом у пользователя должна быть назначена роль billing.accounts.editor, billing.accounts.admin или billing.accounts.owner на нужный платежный аккаунт.

  3. Перейдите на вкладку Подключения и выберите шаблон для создания подключения на основе метаинформации ваших аудиозаписей или переписок из чатов:

    • Пустая форма — подключение с возможностью добавить ваши собственные ключи для метаданных.
    • Bitrix24 — подключение с предустановленным набором ключей для Битрикс24. Дополнительно можно добавить собственные ключи.
    • AmoCRM — подключение с предустановленным набором ключей для amoCRM. Дополнительно можно добавить собственные ключи.
    1. Введите Название подключения.
    2. Выберите тип данных Двухканальное аудио, Одноканальное аудио или Чат.
    3. Задайте параметры подключения. Процесс подробно рассмотрен в разделе Создать подключение.
    4. Нажмите кнопку Создать подключение.
    Пример metadata.json для загрузки аудиоданных

    Даты указываются в формате ISO 8601 UTC с нулевым смещением времени. Если необходимо указать московское время, добавьте +03:00 вместо Z в конец строки: 2025-04-24T14:34:19+03:00.

    {
       "direction_outgoung": "true",
       "client_id": "456",
       "client_name": "Павел Иванов",
       "date": "2023-09-29T09:08:38.958Z",
       "date_to": "2023-09-29T09:15:07.897Z",
       "language": "RU",
       "operator_id": "123",
       "operator_name": "Мария Федорова"
    }
    
  4. Создайте проект:

    1. На странице пространства перейдите на вкладку Проекты.
    2. Выберите шаблон проекта для своей задачи, например «Продажи» или «Поддержка». В проект автоматически добавятся готовые теги, ассистенты и отчеты. Ассистенты из шаблона включены сразу, их использование тарифицируется. Чтобы настроить проект самостоятельно, выберите Пустой проект.
    3. Укажите уникальное в пределах пространства имя проекта. В блоке Подключение нажмите Выбрать из списка и выберите созданное подключение. При необходимости настройте правила фильтрации диалогов.
    4. Нажмите кнопку Создать и дождитесь завершения создания проекта.

    Проект по шаблону создается без диалогов. Диалоги, ранее загруженные в выбранное подключение, автоматически в проект не добавляются. После создания проекта самостоятельно загрузите диалоги.

Загрузите данные

Для загрузки данных в SpeechSense используется gRPC API.

Чтобы загрузить данные:

  1. Создайте сервисный аккаунт.

  2. Добавьте сервисный аккаунт в пространство с ролью speech-sense.data.editor. Подробнее о ролях, действующих в сервисе, смотрите в разделе Управление доступом в SpeechSense.

  3. Создайте для сервисного аккаунта API-ключ с заданной областью действия yc.speech-sense.use или IAM-токен, чтобы аутентифицироваться в API. Подробнее об аутентификации в API SpeechSense.

  4. Загрузите аудиоданные (без разбиения или с разбиением на отрезки) или переписку из чата с помощью скрипта отправки данных на Python.

    Аудио передается целиком в одном сообщении.

    SpeechSense поддерживает следующие форматы аудиофайлов:

    • LPCM — AUDIO_ENCODING_LINEAR16_PCM
    • WAV — CONTAINER_AUDIO_TYPE_WAV
    • OggOpus — CONTAINER_AUDIO_TYPE_OGG_OPUS
    • MP3 — CONTAINER_AUDIO_TYPE_MP3

    Максимальная длительность аудио — 4 часа.

Следующая