


default search action
24th Interspeech 2023: Dublin, Ireland
- Naomi Harte, Julie Carson-Berndsen, Gareth Jones:

24th Annual Conference of the International Speech Communication Association, Interspeech 2023, Dublin, Ireland, August 20-24, 2023. ISCA 2023
Keynote 1 ISCA Medallist
- Shrikanth Narayanan:

Bridging Speech Science and Technology - Now and Into the Future. 1
Speech Synthesis: Prosody and Emotion
- Jianrong Wang, Yaxin Zhao, Li Liu

, Tianyi Xu, Qi Li, Sen Li:
Emotional Talking Head Generation based on Memory-Sharing and Attention-Augmented Networks. 2-6 - Zhaoci Liu, Zhen-Hua Ling, Ya-Jun Hu, Jia Pan, Jin-Wei Wang, Yun-Di Wu:

Speech Synthesis with Self-Supervisedly Learnt Prosodic Representations. 7-11 - Haobin Tang, Xulong Zhang

, Jianzong Wang, Ning Cheng, Jing Xiao:
EmoMix: Emotion Mixing via Diffusion Models for Emotional Speech Synthesis. 12-16 - Detai Xin, Shinnosuke Takamichi, Ai Morimatsu, Hiroshi Saruwatari:

Laughter Synthesis using Pseudo Phonetic Tokens with a Large-scale In-the-wild Laughter Corpus. 17-21 - Rui Liu

, Haolin Zuo, De Hu, Guanglai Gao, Haizhou Li:
Explicit Intensity Control for Accented Text-to-speech. 22-26 - Guangyan Zhang, Thomas Merritt, Manuel Sam Ribeiro, Biel Tura Vecino, Kayoko Yanagisawa, Kamil Pokora, Abdelhamid Ezzerg, Sebastian Cygert, Ammar Abbas, Piotr Bilinski

, Roberto Barra-Chicote, Daniel Korzekwa, Jaime Lorenzo-Trueba:
Comparing normalizing flows and diffusion models for prosody and acoustic modelling in text-to-speech. 27-31
Statistical Machine Translation
- Paul-Ambroise Duquenne, Holger Schwenk, Benoît Sagot:

Modular Speech-to-Text Translation for Zero-Shot Cross-Modal Transfer. 32-36 - Proyag Pal, Brian Thompson, Yogesh Virkar, Prashant Mathur, Alexandra Chronopoulou

, Marcello Federico:
Improving Isochronous Machine Translation with Target Factors and Auxiliary Counters. 37-41 - Kun Song, Yi Ren, Yi Lei, Chunfeng Wang, Kun Wei, Lei Xie, Xiang Yin, Zejun Ma:

StyleS2ST: Zero-shot Style Transfer for Direct Speech-to-speech Translation. 42-46 - Marco Gaido

, Sara Papi
, Matteo Negri, Marco Turchi:
Joint Speech Translation and Named Entity Recognition. 47-51 - Gerard Sant, Carlos Escolano:

Analysis of Acoustic information in End-to-End Spoken Language Translation. 52-56 - Peidong Wang, Eric Sun, Jian Xue, Yu Wu, Long Zhou, Yashesh Gaur, Shujie Liu, Jinyu Li:

LAMASSU: A Streaming Language-Agnostic Multilingual Speech Recognition and Translation Model Using Neural Transducers. 57-61
Self-Supervised Learning in ASR
- Yifan Peng

, Yui Sudo
, Muhammad Shakeel
, Shinji Watanabe
:
DPHuBERT: Joint Distillation and Pruning of Self-Supervised Speech Models. 62-66 - Salah Zaiem, Titouan Parcollet, Slim Essid:

Automatic Data Augmentation for Domain Adapted Fine-Tuning of Self-Supervised Speech Representations. 67-71 - Zhao Yang, Dianwen Ng, Chong Zhang

, Xiao Fu, Rui Jiang, Wei Xi, Yukun Ma, Chongjia Ni, Eng Siong Chng, Bin Ma, Jizhong Zhao:
Dual Acoustic Linguistic Self-supervised Representation Learning for Cross-Domain Speech Recognition. 72-76 - Murali Karthick Baskar, Andrew Rosenberg, Bhuvana Ramabhadran, Kartik Audhkhasi:

O-1: Self-training with Oracle and 1-best Hypothesis. 77-81 - Ziyang Ma, Zhisheng Zheng, Changli Tang, Yujin Wang, Xie Chen:

MT4SSL: Boosting Self-Supervised Speech Representation Learning by Integrating Multiple Targets. 82-86 - Léa-Marie Lam-Yee-Mui, Lucas Ondel Yang

, Ondrej Klejch:
Comparing Self-Supervised Pre-Training and Semi-Supervised Training for Speech Recognition in Languages with Weak Language Models. 87-91
Prosody
- Xinya Zhang, Ying Chen:

Chinese EFL Learners' Perception of English Prosodic Focus. 92-96 - Thomas Sostarics

, Jennifer Cole:
Pitch Accent Variation and the Interpretation of Rising and Falling Intonation in American English. 97-101 - Jianjing Kuang, May Pik Yu Chan, Nari Rhee:

Tonal coarticulation as a cue for upcoming prosodic boundary. 102-106 - Sophie Repp, Lara Muhtz, Johannes M. Heim

:
Alignment of Beat Gestures and Prosodic Prominence in German. 107-111 - Hannah White

, Joshua Penney
, Andy Gibson
, Anita Szakay
, Felicity Cox
:
Creak Prevalence and Prosodic Context in Australian English. 112-116 - Kübra Bodur

, Roxane Bertrand, James Sneed German, Stéphane Rauzy, Corinne Fredouille, Christine Meunier:
Speech reduction: position within French prosodic structure. 117-121
Speech Production
- Ziyu Zhu, Yujie Chi, Zhao Zhang, Kiyoshi Honda, Jianguo Wei:

Transvelar Nasal Coupling Contributing to Speaker Characteristics in Non-nasal Vowels. 122-126 - Yuto Otani

, Shun Sawada, Hidefumi Ohmura, Kouichi Katsurada:
Speech Synthesis from Articulatory Movements Recorded by Real-time MRI. 127-131 - Zheng Yuan

, Aldo Pastore
, Dorina De Jong, Hao Xu, Luciano Fadiga
, Alessandro D'Ausilio
:
The ART of Conversation: Measuring Phonetic Convergence and Deliberate Imitation in L2-Speech with a Siamese RNN. 132-136 - James J. Mahshie, Michael Larsen:

Did you see that? Exploring the role of vision in the development of consonant feature contrasts in children with cochlear implants. 137-140
Dysarthric Speech Assessment
- Loes van Bemmel

, Chiara Pesenti, Xue Wei
, Helmer Strik:
Automatic assessments of dysarthric speech: the usability of acoustic-phonetic features. 141-145 - Chowdam Venkata Thirumala Kumar, Tanuka Bhattacharjee, Yamini Belur, Atchayaram Nalini, Ravi Yadav

, Prasanta Kumar Ghosh:
Classification of Multi-class Vowels and Fricatives From Patients Having Amyotrophic Lateral Sclerosis with Varied Levels of Dysarthria Severity. 146-150 - Jinzi Qi, Hugo Van hamme

:
Parameter-efficient Dysarthric Speech Recognition Using Adapter Fusion and Householder Transformation. 151-155 - Enno Hermann

, Mathew Magimai-Doss
:
Few-shot Dysarthric Speech Recognition with Text-to-Speech Data Augmentation. 156-160 - Dianna Yee, Colin Lea, Jaya Narain, Zifang Huang, Lauren Tooley, Jeffrey P. Bigham, Leah Findlater:

Latent Phrase Matching for Dysarthric Speech. 161-165 - Eun Jung Yeo, Kwanghee Choi, Sunhee Kim, Minhwa Chung:

Speech Intelligibility Assessment of Dysarthric Speech by using Goodness of Pronunciation with Uncertainty Quantification. 166-170
Speech Coding: Transmission and Enhancement
- Youqiang Zheng, Li Xiao, Weiping Tu, Yuhong Yang, Xinmeng Xu:

CQNV: A Combination of Coarsely Quantized Bitstream and Neural Vocoder for Low Rate Speech Coding. 171-175 - Naoyuki Kamo, Marc Delcroix, Tomohiro Nakatani:

Target Speech Extraction with Conditional Diffusion Model. 176-180 - Elad Cohen, Hai Victor Habi, Arnon Netzer:

Towards Fully Quantized Neural Networks For Speech Enhancement. 181-185 - Youshan Zhang, Jialu Li:

Complex Image Generation SwinTransformer Network for Audio Denoising. 186-190
Speech Recognition: Signal Processing, Acoustic Modeling, Robustness, Adaptation 1
- Yochai Blau, Rohan Agrawal, Lior Madmony, Gary Wang, Andrew Rosenberg, Zhehuai Chen, Zorik Gekhman, Genady Beryozkin, Parisa Haghani, Bhuvana Ramabhadran:

Using Text Injection to Improve Recognition of Personal Identifiers in Speech. 191-195 - Tamás Grósz

, Yaroslav Getman
, Ragheb Al-Ghezi, Aku Rouhe, Mikko Kurimo:
Investigating wav2vec2 context representations and the effects of fine-tuning, a case-study of a Finnish model. 196-200 - Jan Lehecka, Jan Svec

, Josef V. Psutka, Pavel Ircing:
Transformer-based Speech Recognition Models for Oral History Archives in English, German, and Czech. 201-205 - Mayank Kumar Singh, Naoya Takahashi, Naoyuki Onoe:

Iteratively Improving Speech Recognition and Voice Conversion. 206-210 - Kavan Fatehi, Ayse Küçükyilmaz:

LABERT: A Combination of Local Aggregation and Self-Supervised Speech Representation Learning for Detecting Informative Hidden Units in Low-Resource ASR Systems. 211-215 - Hongfei Xue

, Qijie Shao, Peikun Chen, Pengcheng Guo, Lei Xie, Jie Liu:
TranUSR: Phoneme-to-word Transcoder Based Unified Speech Representation Learning for Cross-lingual Speech Recognition. 216-220 - Zelin Wu, Tsendsuren Munkhdalai, Pat Rondon, Golan Pundak, Khe Chai Sim, Christopher Li:

Dual-Mode NAM: Effective Top-K Context Injection for End-to-End ASR. 221-225 - Hang Zhou, Xiaoxu Zheng, Yunhe Wang, Michael Bi Mi, Deyi Xiong, Kai Han:

GhostRNN: Reducing State Redundancy in RNN with Cheap Operations. 226-230 - Haoyu Wang, Siyuan Wang, Wei-Qiang Zhang, Hongbin Suo, Yulong Wan:

Task-Agnostic Structured Pruning of Speech Representation Models. 231-235 - Naoyuki Kanda, Takuya Yoshioka, Yang Liu:

Factual Consistency Oriented Speech Recognition. 236-240 - Yassir Fathullah, Chunyang Wu, Yuan Shangguan, Junteng Jia, Wenhan Xiong, Jay Mahadeokar, Chunxi Liu, Yangyang Shi, Ozlem Kalinli, Mike Seltzer, Mark J. F. Gales:

Multi-Head State Space Model for Speech Recognition. 241-245 - Yingying Gao, Shilei Zhang, Zihao Cui, Chao Deng, Junlan Feng:

Cascaded Multi-task Adaptive Learning Based on Neural Architecture Search. 246-250 - Kinan Martin, Jon Gauthier

, Canaan Breiss
, Roger Levy:
Probing Self-supervised Speech Models for Phonetic and Phonemic Information: A Case Study in Aspiration. 251-255 - Philip Harding, Sibo Tong, Simon Wiesler:

Selective Biasing with Trie-based Contextual Adapters for Personalised Speech Recognition using Neural Transducers. 256-260
Analysis of Speech and Audio Signals 1
- Xiao-Min Zeng, Yan Song, Ian McLoughlin

, Lin Liu, Li-Rong Dai:
Robust Prototype Learning for Anomalous Sound Detection. 261-265 - Saksham Singh Kushwaha, Magdalena Fuentes:

A multimodal prototypical approach for unsupervised sound classification. 266-270 - Penghui Wen

, Kun Hu
, Wenxi Yue, Sen Zhang, Wanlei Zhou, Zhiyong Wang:
Robust Audio Anti-Spoofing with Fusion-Reconstruction Learning on Multi-Order Spectrograms. 271-275 - Jinhua Liang, Xubo Liu, Haohe Liu, Huy Phan, Emmanouil Benetos, Mark D. Plumbley, Wenwu Wang:

Adapting Language-Audio Models as Few-Shot Audio Learners. 276-280 - Mengwei Wang, Zhe Yang:

TFECN: Time-Frequency Enhanced ConvNet for Audio Classification. 281-285 - Won-Gook Choi, Joon-Hyuk Chang:

Resolution Consistency Training on Time-Frequency Domain for Semi-Supervised Sound Event Detection. 286-290 - Kang Li, Yan Song, Ian McLoughlin

, Lin Liu, Jin Li, Li-Rong Dai:
Fine-tuning Audio Spectrogram Transformer with Task-aware Adapters for Sound Event Detection. 291-295 - Dianwen Ng, Yang Xiao

, Jia Qi Yip, Zhao Yang, Biao Tian, Qiang Fu, Eng Siong Chng, Bin Ma:
Small Footprint Multi-channel Network for Keyword Spotting with Centroid Based Awareness. 296-300 - Wei Xie, Yanxiong Li

, Qianhua He, Wenchang Cao, Tuomas Virtanen
:
Few-shot Class-incremental Audio Classification Using Adaptively-refined Prototypes. 301-305 - Mohammad Hassan Vali

, Tom Bäckström
:
Interpretable Latent Space Using Space-Filling Curves for Phonetic Analysis in Voice Conversion. 306-310 - Eduard Tulchinskii

, Kristian Kuznetsov, Laida Kushnareva, Daniil Cherniavskii, Serguei Barannikov, Irina Piontkovskaya, Sergey I. Nikolenko, Evgeny Burnaev
:
Topological Data Analysis for Speech Processing. 311-315 - Kangwook Jang, Sungnyun Kim, Se-Young Yun, Hoirin Kim:

Recycle-and-Distill: Universal Compression Strategy for Transformer-based Speech SSL Models with Attention Map Reusing and Masking Distillation. 316-320 - Timm Koppelmann, Semih Agcaer

, Rainer Martin
:
Personalized Acoustic Scene Classification in Ultra-low Power Embedded Devices Using Privacy-preserving Data Augmentation. 321-325 - Wei-Cheng Lin, Luca Bondi

, Shabnam Ghaffarzadegan:
Background Domain Switch: A Novel Data Augmentation Technique for Robust Sound Event Detection. 326-330 - Yuanbo Hou, Siyang Song, Cheng Luo, Andrew Mitchell

, Qiaoqiao Ren, Weicheng Xie, Jian Kang
, Wenwu Wang, Dick Botteldooren
:
Joint Prediction of Audio Event and Annoyance Rating in an Urban Soundscape by Hierarchical Graph Representation Learning. 331-335 - Hejing Zhang, Jian Guan, Qiaoxi Zhu, Feiyang Xiao, Youde Liu:

Anomalous Sound Detection Using Self-Attention-Based Frequency Pattern Analysis of Machine Sounds. 336-340 - Yifei Xin, Yuexian Zou:

Improving Audio-Text Retrieval via Hierarchical Cross-Modal Interaction and Auxiliary Captions. 341-345 - Suhas BN, Sarah Rajtmajer, Saeed Abdullah:

Differential Privacy enabled Dementia Classification: An Exploration of the Privacy-Accuracy Trade-off in Speech Signal Data. 346-350 - Shijun Wang, Jón Guðnason, Damian Borth:

Learning Emotional Representations from Imbalanced Speech Data for Speech Emotion Recognition and Emotional Text-to-Speech. 351-355 - Swarup Ranjan Behera, Pailla Balakrishna Reddy, Achyut Mani Tripathi, Megavath Bharadwaj Rathod, Tejesh Karavadi:

Towards Multi-Lingual Audio Question Answering. 356-360
Speech Recognition: Architecture, Search, and Linguistic Components 1
- Hanan Aldarmaki

, Ahmad Ghannam
:
Diacritic Recognition Performance in Arabic ASR. 361-365 - Jari Kolehmainen, Yile Gu, Aditya Gourav, Prashanth Gurunath Shivakumar, Ankur Gandhe, Ariya Rastrow, Ivan Bulyko:

Personalization for BERT-based Discriminative Speech Recognition Rescoring. 366-370 - Aravind Krishnan, Jesujoba O. Alabi, Dietrich Klakow:

On the N-gram Approximation of Pre-trained Language Models. 371-375 - Tianyu Huang, Chung Hoon Hong, Carl Wivagg, Kanna Shimizu:

Record Deduplication for Entity Distribution Modeling in ASR Transcripts. 376-380 - Aakriti Agrawal, Milind Rao, Anit Kumar Sahu, Gopinath Chennupati, Andreas Stolcke:

Learning When to Trust Which Teacher for Weakly Supervised ASR. 381-385 - Lu Huang, Boyu Li, Jun Zhang, Lu Lu, Zejun Ma:

Text-only Domain Adaptation using Unified Speech-Text Representation in Transducer. 386-390
Speech Recognition: Technologies and Systems for New Applications 1
- Puyuan Peng, Shang-Wen Li, Okko Räsänen

, Abdelrahman Mohamed, David Harwath:
Syllable Discovery and Cross-Lingual Generalization in a Visually Grounded, Self-Supervised Speech Model. 391-395 - Puyuan Peng, Brian Yan, Shinji Watanabe

, David Harwath:
Prompting the Hidden Talent of Web-Scale Speech Models for Zero-Shot Task Generalization. 396-400 - Roger K. Moore

, Ricard Marxer
:
Progress and Prospects for Spoken Language Technology: Results from Five Sexennial Surveys. 401-405 - Ramon Sanabria, Ondrej Klejch, Hao Tang, Sharon Goldwater:

Acoustic Word Embeddings for Untranscribed Target Languages with Continued Pretraining and Learned Pooling. 406-410 - Mohan Shi, Zhihao Du, Qian Chen, Fan Yu, Yangze Li, Shiliang Zhang, Jie Zhang, Li-Rong Dai:

CASA-ASR: Context-Aware Speaker-Attributed ASR. 411-415 - Shun Takahashi, Sakriani Sakti:

Unsupervised Learning of Discrete Latent Representations with Data-Adaptive Dimensionality from Continuous Speech Streams. 416-420 - Gaobin Yang, Jun Du, Maokui He, Shutong Niu, Baoxiang Li, Jiakui Li, Chin-Hui Lee:

AD-TUNING: An Adaptive CHILD-TUNING Approach to Efficient Hyperparameter Optimization of Child Networks for Speech Processing Tasks in the SUPERB Benchmark. 421-425 - Jeremy H. M. Wong, Huayun Zhang, Nancy F. Chen

:
Distilling knowledge from Gaussian process teacher to neural network student. 426-430 - Saurabhchand Bhati, Jesús Villalba, Laureano Moro-Velázquez, Thomas Thebaud, Najim Dehak:

Segmental SpeechCLIP: Utilizing Pretrained Image-text Models for Audio-Visual Learning. 431-435 - Christiaan Jacobs, Nathanaël Carraz Rakotonirina, Everlyn Asiko Chimoto, Bruce A. Bassett

, Herman Kamper
:
Towards hate speech detection in low-resource languages: Comparing ASR to acoustic word embeddings on Wolof and Swahili. 436-440 - Ruan van der Merwe, Herman Kamper

:
Mitigating Catastrophic Forgetting for Few-Shot Spoken Word Classification Through Meta-Learning. 441-445 - Martin Polácek

, Petr Cerva, Jindrich Zdánský, Lenka Weingartová:
Online Punctuation Restoration using ELECTRA Model for streaming ASR Systems. 446-450 - Szu-Jui Chen, Debjyoti Paul, Yutong Pang, Peng Su, Xuedong Zhang:

Language Agnostic Data-Driven Inverse Text Normalization. 451-455 - Zih-Ching Chen, Chao-Han Huck Yang, Bo Li, Yu Zhang, Nanxin Chen, Shuo-Yiin Chang, Rohit Prabhavalkar, Hung-yi Lee, Tara N. Sainath:

How to Estimate Model Transferability of Pre-Trained Speech Models? 456-460 - Mana Ihori, Hiroshi Sato, Tomohiro Tanaka, Ryo Masumura, Saki Mizuno, Nobukatsu Hojo:

Transcribing Speech as Spoken and Written Dual Text Using an Autoregressive Model. 461-465
Lexical and Language Modeling for ASR
- Kamer Ali Yuksel, Thiago Castro Ferreira, Golara Javadi, Mohamed Al-Badrashiny, Ahmet Gunduz:

NoRefER: a Referenceless Quality Metric for Automatic Speech Recognition via Semi-Supervised Language Model Fine-Tuning with Contrastive Learning. 466-470 - Yile Gu, Prashanth Gurunath Shivakumar, Jari Kolehmainen, Ankur Gandhe, Ariya Rastrow, Ivan Bulyko:

Scaling Laws for Discriminative Speech Recognition Rescoring Models. 471-475 - Hong Liu, Zhaobiao Lv, Zhijian Ou, Wenbo Zhao, Qing Xiao:

Exploring Energy-based Language Models with Different Architectures and Training Methods for Speech Recognition. 476-480 - Yukun Feng, Ming Tu, Rui Xia, Chuanzeng Huang, Yuxuan Wang:

Memory Augmented Lookup Dictionary Based Language Modeling for Automatic Speech Recognition. 481-485 - Yu Iwamoto, Takahiro Shinozaki:

Memory Network-Based End-To-End Neural ES-KMeans for Improved Word Segmentation. 486-490 - Yui Sudo

, Kazuya Hata, Kazuhiro Nakadai:
Retraining-free Customized ASR for Enharmonic Words Based on a Named-Entity-Aware Model and Phoneme Similarity Estimation. 491-495
Language Identification and Diarization
- Winstead Zhu, Md. Iftekhar Tanveer, Yang Janet Liu, Seye Ojumu, Rosie Jones:

Lightweight and Efficient Spoken Language Identification of Long-form Audio. 496-500 - Jagabandhu Mishra, Jayadev N. Patil, Amartya Chowdhury, S. R. Mahadeva Prasanna:

End to End Spoken Language Diarization with Wav2vec Embeddings. 501-505 - Oriol Nieto, Zeyu Jin, Franck Dernoncourt, Justin Salamon:

Efficient Spoken Language Recognition via Multilabel Classification. 506-510 - Pavel Matejka, Anna Silnova, Josef Slavícek, Ladislav Mosner, Oldrich Plchot, Michal Klco, Junyi Peng

, Themos Stafylakis
, Lukás Burget:
Description and Analysis of ABC Submission to NIST LRE 2022. 511-515 - Tanel Alumäe, Kunnar Kukk

, Viet Bac Le, Claude Barras, Abdel Messaoudi, Waad Ben Kheder:
Exploring the Impact of Pretrained Models and Web-Scraped Data for the 2022 NIST Language Recognition Evaluation. 516-520 - Jesús Villalba, Jonas Borgstrom, Maliha Jahan

, Saurabh Kataria
, Leibny Paola García, Pedro A. Torres-Carrasquillo, Najim Dehak:
Advances in Language Recognition in Low Resource African Languages: The JHU-MIT Submission for NIST LRE22. 521-525
Speech Quality Assessment
- Xinyu Liang, Fredrik Cumlin, Christian Schüldt, Saikat Chatterjee:

DeePMOS: Deep Posterior Mean-Opinion-Score of Speech. 526-530 - Ashwini Dasare, Pradyoth Hegde

, Supritha M. Shetty, Deepak K. T.:
The Role of Formant and Excitation Source Features in Perceived Naturalness of Low Resource Tribal Language TTS: An Empirical Study. 531-535 - Wuxuan Gong, Jing Wang, Yitong Liu, Hongwen Yang:

A no-reference speech quality assessment method based on neural network with densely connected convolutional architecture. 536-540 - Bao Thang Ta

, Minh Tu Le, Nhat Minh Le, Van Hai Do:
Probing Speech Quality Information in ASR Systems. 541-545 - Cheng-Hung Hu, Yusuke Yasuda, Tomoki Toda:

Preference-based training framework for automatic speech quality assessment using deep neural network. 546-550 - Wannaphong Phatthiyaphaibun, Chompakorn Chaksangchaichot, Thanawin Rakthanmanon, Ekapol Chuangsuwanich

, Sarana Nutanong:
Crowdsourced Data Validation for ASR Training. 551-555
Feature Modeling for ASR
- Zhouyuan Huo, Khe Chai Sim, Dongseong Hwang, Tsendsuren Munkhdalai, Tara N. Sainath, Pedro Moreno Mengibar:

Re-investigating the Efficient Transfer Learning of Speech Foundation Model using Feature Fusion Methods. 556-560 - Gege Qi, Yuefeng Chen, Xiaofeng Mao, Xiaojun Jia, Ranjie Duan, Rong Zhang, Hui Xue:

Robust Automatic Speech Recognition via WavAugment Guided Phoneme Adversarial Training. 561-565 - Zhi-Hao Lai, Tian-Hao Zhang, Qi Liu, Xinyuan Qian, Li-Fang Wei, Feng Chen, Song-Lu Chen, Xu-Cheng Yin:

InterFormer: Interactive Local and Global Features Fusion for Automatic Speech Recognition. 566-570 - Yizhou Tan, Haojun Ai, Shengchen Li, Feng Zhang:

Transductive Feature Space Regularization for Few-shot Bioacoustic Event Detection. 571-575 - Jisung Wang, Haram Lee, Myungwoo Oh

:
Incorporating L2 Phonemes Using Articulatory Features for Robust Speech Recognition. 576-580 - Titouan Parcollet, Shucong Zhang, Rogier van Dalen, Alberto Gil C. P. Ramos, Sourav Bhattacharya:

On the (In)Efficiency of Acoustic Feature Extractors for Self-Supervised Speech Representation Learning. 581-585
Interfacing Speech Technology and Phonetics
- Louis ten Bosch, Martijn Bentum, Lou Boves:

Phonemic competition in end-to-end ASR models. 586-590 - Vincent Hughes, Jessica Wormald

, Paul Foulkes, Philip Harrison, Finnian Kelly
, David van der Vloed, Poppy Welch, Chenzi Xu
:
Automatic speaker recognition with variation across vocal conditions: a controlled experiment with implications for forensics. 591-595 - Bernhard C. Geiger, Barbara Schuppler

:
Exploring Graph Theory Methods For the Analysis of Pronunciation Variation in Spontaneous Speech. 596-600 - Bryony Nuttall, Philip Harrison, Vincent Hughes:

Automatic Speaker Recognition performance with matched and mismatched female bilingual speech data. 601-605
Speech Synthesis: Multilinguality
- Hongsun Yang, Ji-Hoon Kim, Yooncheol Ju, Ilhwan Kim, Byeong-Yeol Kim, Shukjae Choi, Hyung Yong Kim:

FACTSpeech: Speaking a Foreign Language Pronunciation Using Only Your Native Characters. 606-610 - Hoyeon Lee

, Hyun-Wook Yoon, Jong-Hwan Kim, Jae-Min Kim:
Cross-Lingual Transfer Learning for Phrase Break Prediction with Multilingual Language Model. 611-615 - Sen Liu, Yiwei Guo, Chenpeng Du, Xie Chen, Kai Yu:

DSE-TTS: Dual Speaker Embedding for Cross-Lingual Text-to-Speech. 616-620 - Konstantinos Markopoulos, Georgia Maniati, Georgios Vamvoukakis, Nikolaos Ellinas, Georgios Vardaxoglou, Panos Kakoulidis

, Junkwang Oh, Gunu Jho, Inchul Hwang, Aimilios Chalamandaris, Pirros Tsiakoulis, Spyros Raptis:
Generating Multilingual Gender-Ambiguous Text-to-Speech Voices. 621-625 - Rohan Badlani, Rafael Valle, Kevin J. Shih, João Felipe Santos, Siddharth Gururani, Bryan Catanzaro:

RAD-MMM: Multilingual Multiaccented Multispeaker Text To Speech. 626-630 - Giulia Comini, Manuel Sam Ribeiro, Fan Yang, Heereen Shim, Jaime Lorenzo-Trueba:

Multilingual context-based pronunciation learning for Text-to-Speech. 631-635
Speech Emotion Recognition 1
- Minh Tran, Yufeng Yin, Mohammad Soleymani:

Personalized Adaptation with Pre-trained Speech Encoders for Continuous Emotion Recognition. 636-640 - Huang-Cheng Chou, Lucas Goncalves, Seong-Gyun Leem, Chi-Chun Lee

, Carlos Busso:
The Importance of Calibration: Rethinking Confidence and Performance of Speech Multi-label Emotion Classifiers. 641-645 - Mohammad Ibrahim Malik, Siddique Latif

, Raja Jurdak
, Björn W. Schuller:
A Preliminary Study on Augmenting Speech Emotion Recognition using a Diffusion Model. 646-650 - Basmah Alsenani

, Tanaya Guha, Alessandro Vinciarelli:
Privacy Risks in Speech Emotion Recognition: A Systematic Study on Gender Inference Attack. 651-655 - James Tavernor

, Matthew Perez
, Emily Mower Provost:
Episodic Memory For Domain-Adaptable, Robust Speech Emotion Recognition. 656-660 - Chaoyue Ding, Jiakui Li, Daoming Zong, Baoxiang Li, Tian-Hao Zhang, Qunyan Zhou:

Stable Speech Emotion Recognition with Head-k-Pooling Loss. 661-665
Show and Tell: Health applications and emotion recognition
- Matthew Gibson, Ievgen Karaulov, Oleksii Zhelo, Filip Jurcícek:

A Personalised Speech Communication Application for Dysarthric Speakers. 666-667 - Sun-Kyung Lee, Jong-Hwan Kim:

Video Multimodal Emotion Recognition System for Real World Applications. 668-669 - Mahdin Rohmatillah, Bobbi Aditya, Li-Jen Yang, Bryan Gautama Ngo, Willianto Sulaiman, Jen-Tzung Chien:

Promoting Mental Self-Disclosure in a Spoken Dialogue System. 670-671 - Pawel Bujnowski, Bartlomiej Kuzma, Bartlomiej Paziewski, Jacek Rutkowski, Joanna Marhula, Zuzanna Bordzicka, Piotr Andruszkiewicz:

"Select language, modality or put on a mask!" Experiments with Multimodal Emotion Recognition. 672-673 - Hannah Valentine, Joel MacAuslan, Maria I. Grigos, Marisha Speights:

My Vowels Matter: Formant Automation Tools for Diverse Child Speech. 674-675 - Nicky Chong-White, Arun Sebastian, Jorge Mejia:

NEMA: An Ecologically Valid Tool for Assessing Hearing Devices, Advanced Algorithms, and Communication in Diverse Listening Environments. 676-677 - Vikram Ramanarayanan, David Pautler, Lakshmi Arbatti, Abhishek Hosamath, Michael Neumann, Hardik Kothare, Oliver Roesler, Jackson Liscombe, Andrew Cornish, Doug Habberstad, Vanessa Richter, David Fox, David Suendermann-Oeft, Ira Shoulson:

When Words Speak Just as Loudly as Actions: Virtual Agent Based Remote Health Assessment Integrating What Patients Say with What They Do. 678-679 - Kowshik Siva Sai Motepalli, Vamshiraghusimha Narasinga, Harsha Pathuri, Hina Khan, Sangeetha Mahesh, Ajish K. Abraham, Anil Kumar Vuppala:

Stuttering Detection Application. 680-681 - Mario Zusag, Laurin Wagner:

Providing Interpretable Insights for Neurological Speech and Cognitive Disorders from Interactive Serious Games. 682-683 - Jacob C. Solinsky, Raymond L. Finzel, Martin Michalowski, Serguei Pakhomov:

Automated Neural Nursing Assistant (ANNA): An Over-The-Phone System for Cognitive Monitoring. 684-685 - Ankit Gupta, Abhijeet Bishnu, Mandar Gogate, Kia Dashtipour, Tughrul Arslan, Ahsan Adeel, Amir Hussain, Tharmalingam Ratnarajah, Mathini Sellathurai:

5G-IoT Cloud based Demonstration of Real-Time Audio-Visual Speech Enhancement for Multimodal Hearing-aids. 686-687 - Mohsin Raza, Adewale Adetomi, Khubaib Ahmed, Amir Hussain, Tughrul Arslan, Ahsan Adeel:

Towards Two-point Neuron-inspired Energy-efficient Multimodal Open Master Hearing Aid. 688-689
Spoken Dialog Systems and Conversational Analysis 1
- Xuxin Cheng, Wanshi Xu, Ziyu Yao, Zhihong Zhu, Yaowei Li, Hongxiang Li, Yuexian Zou:

FC-MTLF: A Fine- and Coarse-grained Multi-Task Learning Framework for Cross-Lingual Spoken Language Understanding. 690-694 - Xuxin Cheng, Ziyu Yao, Zhihong Zhu, Yaowei Li, Hongxiang Li, Yuexian Zou:

C²A-SLU: Cross and Contrastive Attention for Improving ASR Robustness in Spoken Language Understanding. 695-699 - Henry Weld, Sijia Hu, Siqu Long, Josiah Poon, Soyeon Caren Han

:
Tri-level Joint Natural Language Understanding for Multi-turn Conversational Datasets. 700-704 - Gaëlle Laperrière, Ha Nguyen, Sahar Ghannay, Bassam Jabaian, Yannick Estève:

Semantic Enrichment Towards Efficient Speech Representations. 705-709 - Yosuke Kashiwagi, Siddhant Arora, Hayato Futami, Jessica Huynh, Shih-Lun Wu, Yifan Peng

, Brian Yan, Emiru Tsunoo, Shinji Watanabe
:
Tensor decomposition for minimization of E2E SLU model toward on-device processing. 710-714 


Google
Google Scholar
Semantic Scholar
Internet Archive Scholar
CiteSeerX
ORCID