每周精选
近7天内社区解读较多的方向与热门关键词,适合先读一眼再决定是否深入。
以下为搜索结果。
| 标题 | arXiv | 发布时间 | 状态 |
|---|---|---|---|
|
Your Voice Cloning System is Secretly a Voice Anonymizer
Romolo Muletta, Felix Matthias Saaro, Mark Cieliebak, Jan Deriu
cs.CL
cs.CL
|
2608.27360v1 | 2026-08-27 16:59:58 | 待赞助 |
|
When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue
Yen-Ju Lu, Yuzhe Wang, Yaohan Guan, Xiluo He, Jiarui Hai, Mingrui Liang, Kaavya Chaparala, Thomas Thebaud, Laureano Moro-Velazquez, Najim Dehak, Jesus Villalba
cs.CL
cs.CL
cs.AI
cs.LG
|
2608.27176v1 | 2026-08-27 14:26:46 | 待赞助 |
|
Said Aloud, Read Different: Cross-Modal Instability in Multimodal Models
Basel Mousi, Fahim Dalvi, Shammur Chowdhury, Firoj Alam, Nadir Durrani
cs.CL
cs.CL
|
2608.27135v1 | 2026-08-27 13:46:49 | 待赞助 |
|
Soft Active Electromyography Interface for Machine Learning-Enabled Silent Speech Recognition
Yuta Kurotaki, Shusuke Yamakoshi, Reitaro Yoshida, Yutaka Isoda, Tamami Takano, Yuji Isano, Yusuke Miyake, Kentaro Kuribayashi, Hiroki Ota
cs.LG
cs.LG
cs.HC
cs.SD
|
2608.27048v1 | 2026-08-27 12:36:09 | 待赞助 |
|
Direct or Mediated? Task-Dependent Audio Information Routing in Large Audio Language Models
Yizhou Zhang, Wangjin Zhou, Xin Gu, Yichi Wang, Wei Tan, Yi Zhao, Zhi Gong, Keisuke Imoto, Tatsuya Kawahara
cs.SD
cs.SD
cs.MM
|
2608.27026v1 | 2026-08-27 12:12:26 | 待赞助 |
|
Benchmarking_Fast_Domain_Adaptation_for_Unsupervised_Speech_Units
Robin San Roman, Manel Khentout, Tu Anh Nguyen, Paul Michel, Yossi Adi, Emmanuel Dupoux
cs.LG
cs.LG
|
2608.26992v1 | 2026-08-27 11:40:18 | 待赞助 |
|
Mapping Written Words to Spoken Words in a Different Language Using Only Visual Grounding
Gabriel Pirlogeanu, Dan Oneata, Horia Cucu, Herman Kamper
cs.CL
cs.CL
eess.AS
|
2608.26925v1 | 2026-08-27 10:22:07 | 待赞助 |
|
Scaling phoneme-based TTS augmentation for ASR: A unified pipeline and controlled study
Zhen Wang, TianRui Wu, RongQi Han, Hao Wu, Wei Liang
cs.CL
cs.CL
|
2608.26697v1 | 2026-08-27 06:53:32 | 待赞助 |
|
EmoSay: Artificial Intelligence-Driven Text-to-Emotional-Speech System for Affective Communication in Extended Reality
Sikiru Ademola Adewale, Sunday D. Ubur, Nikitha Donekal Chandrashekar, Onyeka Emebo, Denis Gračanin
cs.HC
cs.HC
|
2608.26566v1 | 2026-08-27 03:17:55 | 待赞助 |
|
AfriSwitch: A Benchmark for In-the-Wild African Code-Switched Speech Recognition
Gabrial Zencha Ashungafac, Busayo Awobade, Tobi Olatunji
cs.CL
cs.CL
|
2608.26434v1 | 2026-08-26 22:20:58 | 待赞助 |
|
SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning
Jiajun Fan, Jingyuan Li, Prashanth Gurunath Shivakumar, Jia-Hong Huang, Qi Luo, M. Maruf, Ivan Bulyko, Ge Liu, Roger Ren
cs.SD
cs.SD
cs.AI
cs.CL
|
2608.26432v1 | 2026-08-26 22:16:05 | 待赞助 |
|
AudioSpan: Spanning the Duration and Depth of Audio Comprehension
Wen Huang, Yunfei Chu, Meng Gao, Haolin He, Jin Xu
cs.SD
cs.SD
eess.AS
|
2608.26431v1 | 2026-08-26 22:15:48 | 待赞助 |
|
Fine-Tuning Whisper for Automatic Speech Recognition in Baniwa: A Preliminary Study
Leonardo Duart, Tiago Fonseca, Thiago Chacón
cs.CL
cs.CL
stat.ML
|
2608.26060v1 | 2026-08-26 17:29:47 | 待赞助 |
|
VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction
Zhifei Xie, Jiaqi Lang, Ze An, Yifan Zhao, Dongchao Yang, Kai Li, Ziyang Ma, Mingbao Lin, Chunyan Miao, Shuicheng Yan
eess.AS
eess.AS
cs.AI
cs.IR
|
2608.26005v1 | 2026-08-26 16:50:05 | 待赞助 |
|
Lost but not erased: Finding traces of a forgotten language in neural speech models
Peter Plantinga, Charlotte Moore, Peter W. Donhauser, Krista Byers-Heinlein, Denise Klein
cs.CL
cs.CL
cs.LG
|
2608.25976v1 | 2026-08-26 16:32:41 | 待赞助 |
|
InteractGesture: Progressive Chunk Guidance for Continuous Streaming Co-Speech Gesture Control
Ekkasit Pinyoanuntapong, Ajinkya Deogade, Paul Streli, Wenjing Zhang, Joanna Materzynska, Pu Wang, Vittorio Ferrari, Jie Shen
cs.CV
cs.CV
|
2608.25734v1 | 2026-08-26 12:46:26 | 待赞助 |
|
From Specialization to Generalization: Instruction-tuned LLMs for Robust Harmful Content Mitigation
Lukas Edman, Daryna Dementieva, Alexander Fraser
cs.CL
cs.CL
|
2608.25605v1 | 2026-08-26 10:24:31 | 待赞助 |
|
Knowledge Distillation for Efficient Acoustic Echo Control
Ernst Seidel, Pejman Mowlaee, Tim Fingscheidt
eess.AS
eess.AS
|
2608.25596v1 | 2026-08-26 10:10:08 | 待赞助 |
|
Generative vs. Encoder Large Language Models for ASR Evaluation: A Comparative Study
Thibault Bañeras-Roux, Shashi Kumar, Driss Khalil, Sergio Burdisso, Petr Motlicek, Shiran Liu, Mickael Rouvier, Jane Wottawa, Richard Dufour
cs.CL
cs.CL
|
2608.25574v1 | 2026-08-26 09:36:48 | 待赞助 |
|
Attention-Guided Reliability Scaling for Contrastive Decoding in Robust Audio-Visual Speech Recognition
YoungChae Kim, Da-Hee Yang, Joon-Hyuk Chang
cs.SD
cs.SD
cs.CV
eess.AS
|
2608.26213v1 | 2026-08-26 08:25:15 | 待赞助 |