
Figure 1.
LSTM Architecture Diagram

Figure 2.
DMBO Framework Architecture

Figure 3.
Overview of the E2E Speech Recognition Framework with DMBO

Figure 4.
Gender-based distribution of datasets samples

Figure 5.
Accent-based distribution of datasets samples

Figure 6.
Train loss (left), LER (right) for gender-based strategies
TABLE I.
Loss, LER for gender-based strategies during both train and test
| Test Loss | Test LER | Train Loss | Train LER | |
|---|---|---|---|---|
| Standard | 25.69 | 14.62% | 12.72 | 11.14% |
| Homogeneous gender | 13.53 | 6.71% | 6.15 | 5.65% |
| Heterogeneous gender | 24.15 | 13.12% | 11.08 | 9.21% |

Figure 7.
Train loss (left), LER (right) for accent-based strategies