| 1 |
x |
Deep Noise Suppression MOS Score of P.835 (DNSMOS) |
pseudo_mos |
dnsmos_overall |
speechmos (MS) |
paper |
| 2 |
x |
Deep Noise Suppression MOS Score of P.808 (DNSMOS) |
pseudo_mos |
dnsmos_p808 |
speechmos (MS) |
paper |
| 3 |
x |
Non-intrusive Speech Quality and Naturalness Assessment (NISQA) |
nisqa |
{nisqa_mos_pred, nisqa_noi_pred, nisqa_dis_pred, nisqa_col_pred, nisqa_loud_pred} |
NISQA |
paper |
| 4 |
x |
UTokyo-SaruLab System for VoiceMOS Challenge 2022 (UTMOS) |
pseudo_mos |
utmos |
speechmos |
paper |
| 5 |
x |
Packet Loss Concealment-related MOS Score (PLCMOS) |
pseudo_mos |
plcmos |
speechmos (MS) |
paper |
| 6 |
x |
PESQ in TorchAudio-Squim |
squim_no_ref |
torch_squim_pesq |
torch_squim |
paper |
| 7 |
x |
STOI in TorchAudio-Squim |
squim_no_ref |
torch_squim_stoi |
torch_squim |
paper |
| 8 |
x |
SI-SDR in TorchAudio-Squim |
squim_no_ref |
torch_squim_si_sdr |
torch_squim |
paper |
| 9 |
x |
Singing voice MOS |
singmos |
singmos |
singmos |
paper |
| 10 |
x |
Sheet SSQA MOS Models |
sheet_ssqa |
sheet_ssqa |
Sheet |
paper |
| 11 |
|
UTMOSv2: UTokyo-SaruLab MOS Prediction System |
utmosv2 |
utmosv2 |
UTMOSv2 |
paper |
| 12 |
|
Speech Contrastive Regression for Quality Assessment without reference (ScoreQ) |
scoreq_nr |
scoreq_nr |
ScoreQ |
paper |
| 13 |
x |
Speech enhancement-based SI-SNR |
se_snr |
se_si_snr |
ESPnet |
|
| 14 |
x |
Speech enhancement-based CI-SDR |
se_snr |
se_ci_sdr |
ESPnet |
|
| 15 |
x |
Speech enhancement-based SAR |
se_snr |
se_sar |
ESPnet |
|
| 16 |
x |
Speech enhancement-based SDR |
se_snr |
se_sdr |
ESPnet |
|
| 17 |
x |
PAM: Prompting Audio-Language Models for Audio Quality Assessment |
pam |
pam |
PAM |
Paper |
| 18 |
|
Speech-to-Reverberation Modulation energy Ratio (SRMR) |
srmr |
srmr |
SRMRpy |
Paper |
| 19 |
x |
Voice Activity Detection (VAD) |
vad |
vad_info |
SileroVAD |
|
| 20 |
|
Speaker Turn Taking (SPK-TT) |
|
|
|
|
| 21 |
x |
Speaking Word/Character Rate (SWR) |
speaking_rate |
speaking_rate |
- |
- |
| 22 |
x |
Auti-spoofing Score (SpoofS) with AASIST: Audio Anti-Spoofing using Integrated Spectro-Temporal Graph Attention Networks |
asvspoof_score |
asvspoof_score |
AASIST |
Paper |
| 23 |
x |
Language Identification |
lid |
language |
ESPnet |
Paper |
| 24 |
|
Audiobox Aesthetics |
audiobox_aesthetics |
{audiobox_aesthetics_CE, audiobox_aesthetics_CU, audiobox_aesthetics_PC, audiobox_aesthetics_PQ} |
Audiobox-Aesthetics |
Paper |
| 25 |
x |
Qwen2 Speaker Characteristics - Count |
qwen2_speaker_count_metric |
qwen2_speaker_count_metric |
Qwen2 Audio |
paper |
| 26 |
x |
Qwen2 Speaker Characteristics - Gender |
qwen2_speaker_gender_metric |
qwen2_speaker_gender_metric |
Qwen2 Audio |
paper |
| 27 |
x |
Qwen2 Speaker Characteristics - Age |
qwen2_speaker_age_metric |
qwen2_speaker_age_metric |
Qwen2 Audio |
paper |
| 28 |
x |
Qwen2 Speaker Characteristics - Speech Impairment |
qwen2_speech_impairment_metric |
qwen2_speech_impairment_metric |
Qwen2 Audio |
paper |
| 29 |
x |
Qwen2 Voice Properties - Pitch |
qwen2_voice_pitch_metric |
qwen2_voice_pitch_metric |
Qwen2 Audio |
paper |
| 30 |
x |
Qwen2 Voice Properties - Pitch Range |
qwen2_pitch_range_metric |
qwen2_pitch_range_metric |
Qwen2 Audio |
paper |
| 31 |
x |
Qwen2 Voice Properties - Voice Type |
qwen2_voice_type_metric |
qwen2_voice_type_metric |
Qwen2 Audio |
paper |
| 32 |
x |
Qwen2 Voice Properties - Volume Level |
qwen2_speech_volume_level_metric |
qwen2_speech_volume_level_metric |
Qwen2 Audio |
paper |
| 33 |
x |
Qwen2 Speech Content - Language |
qwen2_language_metric |
qwen2_language_metric |
Qwen2 Audio |
paper |
| 34 |
x |
Qwen2 Speech Content - Register |
qwen2_speech_register_metric |
qwen2_speech_register_metric |
Qwen2 Audio |
paper |
| 35 |
x |
Qwen2 Speech Content - Vocabulary Complexity |
qwen2_vocabulary_complexity_metric |
qwen2_vocabulary_complexity_metric |
Qwen2 Audio |
paper |
| 36 |
x |
Qwen2 Speech Content - Purpose |
qwen2_speech_purpose_metric |
qwen2_speech_purpose_metric |
Qwen2 Audio |
paper |
| 37 |
x |
Qwen2 Speech Delivery - Emotion |
qwen2_speech_emotion_metric |
qwen2_speech_emotion_metric |
Qwen2 Audio |
paper |
| 38 |
x |
Qwen2 Speech Delivery - Clarity |
qwen2_speech_clarity_metric |
qwen2_speech_clarity_metric |
Qwen2 Audio |
paper |
| 39 |
x |
Qwen2 Speech Delivery - Rate |
qwen2_speech_rate_metric |
qwen2_speech_rate_metric |
Qwen2 Audio |
paper |
| 40 |
x |
Qwen2 Speech Delivery - Style |
qwen2_speaking_style_metric |
qwen2_speaking_style_metric |
Qwen2 Audio |
paper |
| 41 |
x |
Qwen2 Speech Delivery - Emotional Vocalizations |
qwen2_laughter_crying_metric |
qwen2_laughter_crying_metric |
Qwen2 Audio |
paper |
| 42 |
x |
Qwen2 Interaction Patterns - Overlapping Speech |
qwen2_overlapping_speech_metric |
qwen2_overlapping_speech_metric |
Qwen2 Audio |
paper |
| 43 |
x |
Qwen2 Recording Environment - Background |
qwen2_speech_background_environment_metric |
qwen2_speech_background_environment_metric |
Qwen2 Audio |
paper |
| 44 |
x |
Qwen2 Recording Environment - Quality |
qwen2_recording_quality_metric |
qwen2_recording_quality_metric |
Qwen2 Audio |
paper |
| 45 |
x |
Qwen2 Recording Environment - Channel Type |
qwen2_channel_type_metric |
qwen2_channel_type_metric |
Qwen2 Audio |
paper |
| 46 |
x |
Qwen2.5-Omni Speech and Singing Characteristics |
qwen_omni_{sub_metrics}, qwen_omni_{sub_metrics}_metric |
qwen_omni_{sub_metrics} |
Qwen2.5-Omni |
- |
| 47 |
x |
Dimensional Emotion |
emo_vad |
arousal_emo_vad, valence_emo_vad, dominance_emo_vad |
w2v2-how-to |
paper |
| 48 |
x |
Uni-VERSA (Versatile Speech Assessment with a Unified Framework) |
universa, universa_noref, universa_audioref, universa_textref, universa_fullref |
universa_{sub_metrics} |
Uni-VERSA |
paper |
| 49 |
|
ARECHO (Audio Reference Echo Cancellation and Codec Quality Assessment) - No Reference |
arecho, arecho_noref |
arecho_{sub_metrics} |
ARECHO |
paper |
| 50 |
x |
DNSMOS Pro: A Reduced-Size DNN for Probabilistic MOS of Speech |
pseudo_mos |
dnsmos_pro_bvcc |
DNSMOSPro |
paper |
| 51 |
x |
DNSMOS Pro: A Reduced-Size DNN for Probabilistic MOS of Speech |
pseudo_mos |
dnsmos_pro_nisqa |
DNSMOSPro |
paper |
| 52 |
x |
DNSMOS Pro: A Reduced-Size DNN for Probabilistic MOS of Speech |
pseudo_mos |
dnsmos_pro_vcc2018 |
DNSMOSPro |
paper |
| 53 |
|
WV-MOS (MOS score prediction by fine-tuned wav2vec2.0 model) |
wvmos |
wvmos |
wvmos |
paper |
| 54 |
|
SIG-MOS |
sigmos |
{SIGMOS_COL, SIGMOS_DISC, SIGMOS_LOUD, SIGMOS_REVERB, SIGMOS_SIG, SIGMOS_OVRL} |
sigmos |
paper |
| 55 |
x |
VQScore (Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech) |
vqscore |
vqscore |
VQScore |
paper |
| 56 |
x |
Singing voice MOS |
pseudo_mos |
singmos_pro |
singmos |
paper |
| 57 |
|
SongEval (A Benchmark Dataset for Song Aesthetics Evaluation) |
songeval |
{songeval_coherence, songeval_musicality, songeval_memorability, songeval_clarity, songeval_naturalness} |
SongEval |
paper |
| 58 |
|
Multivariate Probabilistic Assessment of Speech Quality |
multigauss |
multigauss_{mos,noi,col,dis,loud}, multigauss_covariance |
MultiGauss |
paper |