arXiv cs.CL
7/1/2026

Beyond Clean Text: Evaluating Encoder and Decoder Robustness for Bangla Event Detection in Noisy Text
Short summary
Researchers evaluated event detection models on Bangla text, comparing encoder (BanglaBERT, XLM-R) and decoder (Llama 3, Gemma 3) architectures across clean, noisy, and ASR-transcribed text. Encoder models excelled on clean data but degraded under noise; decoder LLMs proved significantly more robust. Training on mixed clean-noisy data improved encoder robustness, while model scaling consistently benefited decoder architectures.
- •Encoder models (BanglaBERT, XLM-R) perform well on clean text but degrade significantly under noise
- •Decoder-only LLMs (Llama 3, Gemma 3) demonstrate superior robustness to corrupted text and ASR errors
- •Mixed clean-noisy training effectively improves encoder robustness; model scaling benefits decoder robustness
Generated with AI, which can make mistakes.
Is this a good recommendation for you?
