每周精选

近7天内社区解读较多的方向与热门关键词,适合先读一眼再决定是否深入。

以下为搜索结果。

标题 arXiv 发布时间 状态
Your Voice Cloning System is Secretly a Voice Anonymizer
Romolo Muletta, Felix Matthias Saaro, Mark Cieliebak, Jan Deriu
cs.CL cs.CL
2608.27360v1 2026-08-27 16:59:58 待赞助
When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue
Yen-Ju Lu, Yuzhe Wang, Yaohan Guan, Xiluo He, Jiarui Hai, Mingrui Liang, Kaavya Chaparala, Thomas Thebaud, Laureano Moro-Velazquez, Najim Dehak, Jesus Villalba
cs.CL cs.CL cs.AI cs.LG
2608.27176v1 2026-08-27 14:26:46 待赞助
Said Aloud, Read Different: Cross-Modal Instability in Multimodal Models
Basel Mousi, Fahim Dalvi, Shammur Chowdhury, Firoj Alam, Nadir Durrani
cs.CL cs.CL
2608.27135v1 2026-08-27 13:46:49 待赞助
Soft Active Electromyography Interface for Machine Learning-Enabled Silent Speech Recognition
Yuta Kurotaki, Shusuke Yamakoshi, Reitaro Yoshida, Yutaka Isoda, Tamami Takano, Yuji Isano, Yusuke Miyake, Kentaro Kuribayashi, Hiroki Ota
cs.LG cs.LG cs.HC cs.SD
2608.27048v1 2026-08-27 12:36:09 待赞助
Direct or Mediated? Task-Dependent Audio Information Routing in Large Audio Language Models
Yizhou Zhang, Wangjin Zhou, Xin Gu, Yichi Wang, Wei Tan, Yi Zhao, Zhi Gong, Keisuke Imoto, Tatsuya Kawahara
cs.SD cs.SD cs.MM
2608.27026v1 2026-08-27 12:12:26 待赞助
Benchmarking_Fast_Domain_Adaptation_for_Unsupervised_Speech_Units
Robin San Roman, Manel Khentout, Tu Anh Nguyen, Paul Michel, Yossi Adi, Emmanuel Dupoux
cs.LG cs.LG
2608.26992v1 2026-08-27 11:40:18 待赞助
Mapping Written Words to Spoken Words in a Different Language Using Only Visual Grounding
Gabriel Pirlogeanu, Dan Oneata, Horia Cucu, Herman Kamper
cs.CL cs.CL eess.AS
2608.26925v1 2026-08-27 10:22:07 待赞助
Scaling phoneme-based TTS augmentation for ASR: A unified pipeline and controlled study
Zhen Wang, TianRui Wu, RongQi Han, Hao Wu, Wei Liang
cs.CL cs.CL
2608.26697v1 2026-08-27 06:53:32 待赞助
EmoSay: Artificial Intelligence-Driven Text-to-Emotional-Speech System for Affective Communication in Extended Reality
Sikiru Ademola Adewale, Sunday D. Ubur, Nikitha Donekal Chandrashekar, Onyeka Emebo, Denis Gračanin
cs.HC cs.HC
2608.26566v1 2026-08-27 03:17:55 待赞助
AfriSwitch: A Benchmark for In-the-Wild African Code-Switched Speech Recognition
Gabrial Zencha Ashungafac, Busayo Awobade, Tobi Olatunji
cs.CL cs.CL
2608.26434v1 2026-08-26 22:20:58 待赞助
SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning
Jiajun Fan, Jingyuan Li, Prashanth Gurunath Shivakumar, Jia-Hong Huang, Qi Luo, M. Maruf, Ivan Bulyko, Ge Liu, Roger Ren
cs.SD cs.SD cs.AI cs.CL
2608.26432v1 2026-08-26 22:16:05 待赞助
AudioSpan: Spanning the Duration and Depth of Audio Comprehension
Wen Huang, Yunfei Chu, Meng Gao, Haolin He, Jin Xu
cs.SD cs.SD eess.AS
2608.26431v1 2026-08-26 22:15:48 待赞助
Fine-Tuning Whisper for Automatic Speech Recognition in Baniwa: A Preliminary Study
Leonardo Duart, Tiago Fonseca, Thiago Chacón
cs.CL cs.CL stat.ML
2608.26060v1 2026-08-26 17:29:47 待赞助
VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction
Zhifei Xie, Jiaqi Lang, Ze An, Yifan Zhao, Dongchao Yang, Kai Li, Ziyang Ma, Mingbao Lin, Chunyan Miao, Shuicheng Yan
eess.AS eess.AS cs.AI cs.IR
2608.26005v1 2026-08-26 16:50:05 待赞助
Lost but not erased: Finding traces of a forgotten language in neural speech models
Peter Plantinga, Charlotte Moore, Peter W. Donhauser, Krista Byers-Heinlein, Denise Klein
cs.CL cs.CL cs.LG
2608.25976v1 2026-08-26 16:32:41 待赞助
InteractGesture: Progressive Chunk Guidance for Continuous Streaming Co-Speech Gesture Control
Ekkasit Pinyoanuntapong, Ajinkya Deogade, Paul Streli, Wenjing Zhang, Joanna Materzynska, Pu Wang, Vittorio Ferrari, Jie Shen
cs.CV cs.CV
2608.25734v1 2026-08-26 12:46:26 待赞助
From Specialization to Generalization: Instruction-tuned LLMs for Robust Harmful Content Mitigation
Lukas Edman, Daryna Dementieva, Alexander Fraser
cs.CL cs.CL
2608.25605v1 2026-08-26 10:24:31 待赞助
Knowledge Distillation for Efficient Acoustic Echo Control
Ernst Seidel, Pejman Mowlaee, Tim Fingscheidt
eess.AS eess.AS
2608.25596v1 2026-08-26 10:10:08 待赞助
Generative vs. Encoder Large Language Models for ASR Evaluation: A Comparative Study
Thibault Bañeras-Roux, Shashi Kumar, Driss Khalil, Sergio Burdisso, Petr Motlicek, Shiran Liu, Mickael Rouvier, Jane Wottawa, Richard Dufour
cs.CL cs.CL
2608.25574v1 2026-08-26 09:36:48 待赞助
Attention-Guided Reliability Scaling for Contrastive Decoding in Robust Audio-Visual Speech Recognition
YoungChae Kim, Da-Hee Yang, Joon-Hyuk Chang
cs.SD cs.SD cs.CV eess.AS
2608.26213v1 2026-08-26 08:25:15 待赞助