arXiv cs.CL
7/9/2026

Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts
Short summary
A multimodal approach integrates audio features with automatically generated multilingual text transcripts via cascaded cross-modal transformers for speech sentiment analysis. The teacher multimodal model is distilled into a student audio-only model, boosting inference-time performance without computational overhead. Experiments on a large-scale dataset confirm that both automatic transcripts and translations improve sentiment polarity classification, and code is publicly released.
- •Cross-modal transformers combine audio with ASR-generated multilingual transcripts for sentiment analysis
- •Knowledge distillation from multimodal teacher to audio-only student improves performance at no inference cost
- •Code publicly released for reproducibility
Generated with AI, which can make mistakes.
Is this a good recommendation for you?