Back to feed
arXiv cs.CL
arXiv cs.CL
7/9/2026
Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts

Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts

Short summary

A multimodal approach integrates audio features with automatically generated multilingual text transcripts via cascaded cross-modal transformers for speech sentiment analysis. The teacher multimodal model is distilled into a student audio-only model, boosting inference-time performance without computational overhead. Experiments on a large-scale dataset confirm that both automatic transcripts and translations improve sentiment polarity classification, and code is publicly released.

  • Cross-modal transformers combine audio with ASR-generated multilingual transcripts for sentiment analysis
  • Knowledge distillation from multimodal teacher to audio-only student improves performance at no inference cost
  • Code publicly released for reproducibility

Generated with AI, which can make mistakes.

Is this a good recommendation for you?

Comments

Failed to load comments. Please try again.

Explore more