Step-Audio 2 is an end-to-end multi-modal large language model designed for industry-strength audio understanding and speech conversation.
Step-Audio 2 is an end-to-end multi-modal large language model designed for industry-strength audio understanding and speech conversation.
| Category | Test set | Doubao LLM ASR | GPT-4o Transcribe | Kimi-Audio | Qwen-Omni | Step-Audio 2 | Step-Audio 2 mini |
|---|---|---|---|---|---|---|---|
| English | Common Voice | 9.20 | 9.30 | 7.83 | 8.33 | 5.95 | 6.76 |
| FLEURS English | 7.22 | 2.71 | 4.47 | 5.05 | 3.03 | 3.05 | |
| LibriSpeech clean | 2.92 | 1.75 | 1.49 | 2.93 | 1.17 | 1.33 | |
| LibriSpeech other | 5.32 | 4.23 | 2.91 | 5.07 | 2.42 | 2.86 | |
| Average | 6.17 | 4.50 | 4.18 | 5.35 | 3.14 | 3.50 | |
| Chinese | AISHELL | 0.98 | 3.52 | 0.64 | 1.17 | 0.63 | 0.78 |
| AISHELL-2 | 3.10 | 4.26 | 2.67 | 2.40 | 2.10 | 2.16 | |
| FLEURS Chinese | 2.92 | 2.62 | 2.91 | 7.01 | 2.68 | 2.53 | |
| KeSpeech phase1 | 6.48 | 26.80 | 5.11 | 6.45 | 3.63 | 3.97 | |
| WenetSpeech meeting | 4.90 | 31.40 | 5.21 | 6.61 | 4.75 | 4.87 | |
| WenetSpeech net | 4.46 | 15.71 | 5.93 | 5.24 | 4.67 | 4.82 | |
| Average | 3.81 | 14.05 | 3.75 | 4.81 | 3.08 | 3.19 | |
| Multilingual | FLEURS Arabian | N/A | 11.72 | N/A | 25.13 | 14.22 | 16.46 |
| Common Voice yue | 9.20 | 11.10 | 38.90 | 7.89 | 7.90 | 8.32 | |
| FLEURS Japanese | N/A | 3.27 | N/A | 10.49 | 3.18 | 4.67 | |
| In-house | Anhui accent | 8.83 | 50.55 | 22.17 | 18.73 | 10.61 | 11.65 |
| Guangdong accent | 4.99 | 7.83 | 3.76 | 4.03 | 3.81 | 4.44 | |
| Guangxi accent | 3.37 | 7.09 | 4.29 | 3.35 | 4.11 | 3.51 | |
| Shanxi accent | 20.26 | 55.03 | 34.71 | 25.95 | 12.44 | 15.60 |
No open issues yet, or sync has not completed.