Skip to main content
Have a personal or library account? Click to login
Cross-Cultural Music Similarity: Bridging Human Perception, Signal Processing, and Foundation Models Cover

Cross-Cultural Music Similarity: Bridging Human Perception, Signal Processing, and Foundation Models

Open Access
|Jul 2026

Figures & Tables

Table 1

Summary of musical datasets used in cross‑cultural similarity study.

DatasetTraditionHoursRecordings
MagnaTagATune (Law et al., 2009)Western21025,864
FMA‑medium (Defferrard et al., 2017)Western20825,000
CorpusCOFLA (Kroher et al., 2016)Flamenco951,595
Arab‑Andalusian (Repetto et al., 2018)Spanish‑Arabic125164
Lyra (Papaioannou et al., 2022)Greek801,570
Turkish‑makam (Şentürk, 2016; Uyar et al., 2014)Turkish3595,297
Hindustani (Srinivasamurthy et al., 2014b)Indian3431,204
Carnatic (Srinivasamurthy et al., 2014b)Indian5002,612
Jingju (Repetto and Serra, 2014)Chinese71864
Table 2

Summary Statistics of the Human Annotation Study. Comprehensive overview of participant demographics, study design parameters, and data collection metrics.

CategoryCount
Total participants125
Unique annotated audio pairs1,130
Unique annotated audio clips463
Annotated audio pairs per participant10
Annotated similarity types per audio pair3
Participants unique countries of origin21
Participants unique music training levels13
Participants unique familiar music cultures58
Table 3

Signal‑Processing Features Summary. Overview of features extracted for each musical dimension in the cross‑cultural analysis framework.

DimensionFeatures
MelodyPYIN F0 extraction (Mauch and Dixon, 2014), dual‑resolution pitch classes (12/24 bins), melodic intervals, F0 statistics
RhythmDynamic programming beat tracking (McFee et al., 2015), onset detection (Bello et al., 2004, 2005), inter‑onset/beat intervals, tempogram analysis (Grosche et al., 2010)
HarmonyCENS chroma features (Müller and Ewert, 2011) (12/24 bins), chord recognition, Krumhansl–Schmuckler key estimation (Krumhansl and Kessler, 1982), Tonnetz centroids (Harte et al., 2006)
TimbreMFCCs (Logan, 2000; Tzanetakis and Cook, 2002) with delta features, spectral features (Klapuri and Davy, 2006), spectral flatness (Dubnov, 2004), statistical distributions
Table 4

Foundation Models Summary. Overview of the seven foundation models used in cross‑cultural music similarity evaluation. CultureMERT‑TA employs task arithmetic to merge culture‑specific models in weight space.

ModelParamsKey Characteristics
MERT‑95M (Li et al., 2024)95M12‑layer transformer, dual‑teacher masked acoustic modeling
MERT‑330M (Li et al., 2024)330M24‑layer transformer, expanded MERT variant
CultureMERT (Kanatas et al., 2025)95MContinual pre‑training on Greek, Turkish, and Indian music
CultureMERT‑TA (Kanatas et al., 2025)95MTask arithmetic cultural adaptation approach
CLAP‑Music (Wu et al., 2023)194MContrastive audio–text learning, music‑only training
CLAP‑Music&Speech (Wu et al., 2023)194MContrastive audio–text learning, music and speech data
Qwen2‑Audio (Chu et al., 2024)8.4BMultimodal architecture with instruction tuning
Figure 1

Cultural Similarity Matrix Across Datasets. Heat map visualization of human‑perceived cultural similarity ratings. Values represent mean cultural similarity ratings aggregated across all participant annotations for pairs between and within datasets. Clear cultural clusters emerge, with higher similarities (darker blue) indicating stronger cultural relationships.

Figure 2

Multidimensional Scaling Visualization of Musical Datasets. Two‑dimensional projection based on recommendation‑level similarity distances derived from human annotations, revealing clustering patterns across nine musical datasets. Dotted circles around each point represent internal diversity (inverse self‑similarity) within each dataset.

Table 5

Comprehensive Evaluation of Signal‑Processing Features and Foundation Models. Performance comparison against human similarity judgments across three similarity dimensions (overall musical, cultural, and recommendation‑level). Values are shown as percentages (%) for Triplet Agreement, NDCG, and MAE and as correlation values for Spearman and Kendall metrics. Arrows indicate whether higher () or lower () values represent better performance, with the best performance within each similarity dimension and metric shown in bold.

MethodTriplet Agr. (%)NDCG (%)Spearman ρ  (−1, 1)Kendall τ  (−1, 1)MAE (%)
Similarity typeOverallCulturalRecomm.OverallCulturalRecomm.OverallCulturalRecomm.OverallCulturalRecomm.OverallCulturalRecomm.
Signal processing features
Melody61.561.160.788.487.686.80.150.140.150.140.120.1329.530.530.9
Rhythm51.352.150.385.884.084.0−0.00−0.01−0.02−0.00−0.01−0.0232.534.334.6
Harmony51.850.850.785.383.483.60.02−0.000.020.020.000.0232.133.534.3
Timbre54.254.755.686.184.885.3−0.030.040.04−0.030.030.0335.236.436.3
Foundation models
MERT‑9559.859.760.088.287.187.30.060.090.100.050.080.0831.332.432.3
CultureMERT56.357.057.486.886.286.40.040.080.080.030.060.0733.034.134.4
CultureMERT‑TA55.155.856.586.686.086.40.020.060.060.010.050.0533.634.634.8
MERT‑33057.657.358.787.886.586.90.080.050.090.060.040.0835.035.635.7
CLAP‑Music55.656.054.886.885.384.80.050.03−0.010.040.02−0.0140.941.741.6
CLAP‑Music&Speech64.962.664.989.888.088.60.160.110.140.140.090.1229.630.830.9
Qwen2‑Audio58.458.059.588.086.586.90.050.060.080.040.050.0836.737.337.3
Figure 3

Radar Plot Comparison of Top‑Performing Computational Methods. Performance comparison of the eight highest‑ranked methods, averaged across three similarity dimensions, with metrics normalized to [0, 1] scale, where higher values indicate better performance (mean absolute error is inverted).

Table 6

Cross‑Cultural Discrimination Analysis Using Distance‑Based Separation Ratios. Comparison of cultural boundary detection capabilities between humans and all computational methods. Higher values indicate better discrimination between musical traditions. Annotated pairs use only human‑annotated audio pairs (1,130), while all pairs use the complete similarity matrix (100 k pairs).

MethodAnnotated PairsAll Pairs
Human similarities
Overall Music1.803
Cultural2.361
Recommendation‑level2.106
Signal‑processing features
Melody1.2761.180
Rhythm0.9891.037
Harmony1.0181.031
Timbre1.0251.018
Foundation models
MERT‑951.2801.209
CultureMERT1.2591.180
CultureMERT‑TA1.2621.169
MERT‑3301.4011.298
CLAP‑Music1.4151.217
CLAP‑Music&Speech1.3661.318
Qwen2‑Audio1.5791.602
Figure 4

Linear Regression Weights for Signal Processing Features. Bar charts showing the contribution of signal‑processing features (melody, rhythm, harmony, timbre) in predicting human similarity judgments and foundation model similarities. Positive weights indicate that higher feature similarity contributes to greater predicted similarity, with MAE values in parentheses indicating prediction accuracy.

Table 7

Ensemble Regression Results Combining Signal‑Processing Features and Foundation Models. Performance evaluation of ensemble methods for predicting human similarity judgments. Values are shown as percentages (%) for Triplet Agreement, NDCG, and MAE and as correlation values for Spearman and Kendall metrics. Arrows indicate whether higher () or lower () values represent better performance, with the best performance within each similarity dimension and metric shown in bold.

MethodTriplet Agr. (%)NDCG (%)Spearman ρ  (−1, 1)Kendall τ  (−1, 1)MAE (%)
Similarity typeOverallCulturalRecomm.OverallCulturalRecomm.OverallCulturalRecomm.OverallCulturalRecomm.OverallCulturalRecomm.
Linear regression67.066.765.192.591.490.90.190.150.180.180.140.1719.722.223.0
LightGBM67.263.864.492.290.690.10.190.120.130.190.120.1319.822.223.2
DOI: https://doi.org/10.5334/tismir.341 | Journal eISSN: 2514-3298
Language: English
Page range: 347 - 368
Submitted on: Sep 15, 2025
Accepted on: Mar 29, 2026
Published on: Jul 21, 2026
Published by: Ubiquity Press
In partnership with: Paradigm Publishing Services

© 2026 Charilaos Papaioannou, Emmanouil Benetos, Alexandros Potamianos, published by Ubiquity Press
This work is licensed under the Creative Commons Attribution 4.0 License.