Normalized average downstream performance (min-max scaled per benchmark/metric, then averaged across languages and benchmarks) vs. tokens trained.