Konuşmacı Diarizasyonundaki Zorlukların Çözümünde Geleneksel Yöntemler ile Derin Öğrenme Yöntemlerinin Karşılaştırılması
Afyon Kocatepe Üniversitesi Fen ve Mühendislik Bilimleri Dergisi, cilt.25, sa.5, ss.1095-1105, 2025 (TRDizin)
- Yayın Türü: Makale / Tam Makale
- Cilt numarası: 25 Sayı: 5
- Basım Tarihi: 2025
- Doi Numarası: 10.35414/akufemubid.1565447
- Dergi Adı: Afyon Kocatepe Üniversitesi Fen ve Mühendislik Bilimleri Dergisi
- Derginin Tarandığı İndeksler: TR DİZİN (ULAKBİM)
- Sayfa Sayıları: ss.1095-1105
- Süleyman Demirel Üniversitesi Adresli: Evet
Özet
Konuşmacı günlüğü oluşturma, bir ses kaydında birden fazla konuşmacıdan gelen konuşmayı ayırt etme ve bölümlere ayırma görevidir ve toplantı transkripsiyonu, sesle etkinleştirilen sistemler ve ses indeksleme gibi çeşitli uygulamalar için çok kritik bir bileşendir. Geleneksel kümeleme tabanlı yöntemler yaygın olarak kullanılmaktadır, ancak gürültülü ortamlar, örtüşen konuşma, konuşmacı değişkenliği ve değişken kayıt koşulları gibi gerçek dünya senaryolarındaki zorluklarla karşılaşmaktadır. Bu araştırma, birden fazla konuşmacının bulunduğu senaryolarda diarizasyon doğruluğunu artırmada dikkate değer gelişmeler gösteren derin öğrenme tabanlı yaklaşımlara odaklanarak bu sınırlamaları ele almaktadır. Bu çalışma, geleneksel kümeleme algoritmaları ile Zaman Gecikmeli Sinir Ağları (TDNN), Uçtan Uca Sinirsel Diarizasyon (EEND) ve Tam Denetimli UIS-RNN gibi çağdaş derin öğrenme yaklaşımlarını kapsamlı bir şekilde karşılaştırmaktadır. Performanslarını CallHome veri seti üzerinde değerlendirerek, geleneksel yöntemlerin sınırlamalarını ve derin öğrenme tekniklerinin sağladığı önemli ilerlemeleri vurgulamaktadır. Sonuçlar, TDNN'nin örtüşmeyen konuşma durumlarında hafif iyileştirmeler sağladığını, EEND'in örtüşen konuşma senaryolarında dikkate değer performans kazançları göstererek, geleneksel yöntemlerin %23,7'lik oranına kıyasla %12,6'lık bir Diarizasyon Hata 0ranı (DER) elde ettiğini ortaya koymaktadır. Tam Denetimli UIS-RNN modeli, %7,6'lık bir DER ile tüm teknikler arasında en iyi performansı sergileyerek karmaşık akustik koşulları yönetmedeki etkinliğini göstermektedir. Bu çalışma, konuşmacı diarizasyonunun çok yönlü zorluklarını ele almadaki derin öğrenmenin dönüştürücü potansiyelini vurgulamakta ve bu gelişen alandaki gelecekteki araştırmalar için bir temel oluşturmaktadır.
Speaker diarization is the task of distinguishing and segmenting speech from multiple speakers in an audio recording, a critical component for various applications such as meeting transcription, voice activated systems, and audio indexing. Traditional clustering-based methods have been widely adopted, but face challenges in real-world scenarios, including noisy environments, overlapping speech, speaker variability and variable recording conditions. This research addresses these limitations by examining deep learning-based approaches, which have demonstrated notable advancements in enhancing multi-speaker diarization accuracy. This study provides a comprehensive comparison between traditional clustering algorithms and contemporary deep learning approaches, including Time-Delay Neural Networks (TDNN), End-to-End Neural Diarization (EEND), and Fully Supervised UIS-RNN. By evaluating their performance on the CallHome dataset, the study highlights the limitations of traditional methods and the significant advancements offered by deep learning techniques. Results show that TDNN achieves slight improvements in non- overlapping speech, EEND demonstrates notable performance gains in overlapping speech scenarios, achieving a Diarization Error Rate (DER) of 12.6% compared to 23.7% for traditional methods. The UIS-RNN model outperforms all other techniques with a DER of 7.6%, showcasing its efficacy in handling complex acoustic conditions. This study underscores the transformative potential of deep learning in addressing the multifaceted challenges of speaker diarization and lays the foundation for future research in this evolving domain.