← all papers · overview

Research of online speaker diarization algorithms for the task of automatic speech recognition

Abstract

Despite the advances in the field of automatic speech recognition, there are a large number of scenarios (spontaneous speech, an overlapping of speakers, interruptions, etc.) in which modern systems work unstable, failing to accurately convey the intended meaning of the utterance. The task of speaker diarization, which involves splitting an audio stream into segments corresponding to individual speakers, remains one of the most difficult and relevant problems in real-time speech processing. Particularly challenging are cases of prolonged multi-speaker recordings, which are typical for forums, corporate events, and panel discussions. Existing streaming solutions are often limited in the number of speakers, require high computing resources, or have a significant delay in processing the audio stream. This paper presents an algorithm for cascaded processing of streaming speech recognition with online diarization, consisting of a voice activity detector (VAD), an embedding extraction model, and online clustering based on Probabilistic Spherical Discriminant Analysis (PSDA). To increase reliability in streaming mode, stability heuristics are proposed that reduce the number of false speaker switches and ensure consistent model behavior under a limited temporal context. The results obtained using the proposed cascade algorithm for online speaker diarization significantly outperform those of existing systems based on own Russian-language multi-speaker dataset. The effectiveness of cascade approaches for stream diarization in conditions of limited computing resources is also demonstrated. Несмотря на успехи в области автоматического распознавания речи, существует большое количество сценариев (спонтанная речь, смесь дикторов, перебивания и др.), в которых современные системы работают нестабильно, не позволяя качественно передать смысл сказанного. Задача диаризации спикеров, состоящая в разбиении аудиопотока на сегменты, относящиеся к разным говорящим, остается одной из наиболее сложных и актуальных проблем в обработке речи в режиме реального времени. Особенно трудными являются случаи длительных многоспикерных записей, которые типичны для форумов, корпоративных мероприятий и панельных дискуссий. Существующие потоковые решения часто ограничены по числу спикеров, требуют высоких вычислительных ресурсов или обладают значительной задержкой при обработке звукового потока. В данной работе представлен алгоритм каскадной обработки потокового распознавания речи с онлайн-диаризацией, состоящий из детектора голосовой активности (VAD), модели извлечения эмбеддингов и онлайн-кластеризации на основе Probabilistic Spherical Discriminant Analysis (PSDA). Для повышения стабильности в потоковом режиме предложены эвристики устойчивости, уменьшающие количество ложных переключений спикеров и обеспечивающие согласованное поведение модели при ограниченном временном контексте. Результаты, полученные при помощи предложенного каскадного алгоритма онлайн-диаризации спикеров, значительно превосходят результаты существующих систем на собственном русско-язычном наборе многоспикерных данных. Также демонстрируется эффективность каскадных подходов для потоковой диаризации в условиях ограниченных вычислительных ресурсов.

Related papers

Ranked by semantic similarity — how closely each paper's abstract matches this one (100% = near-identical topic).