Empirical Benchmarking of Large Language Models for Data Science Coding: a Multidimensional Evaluation | AMiner