Training machine learning models using task selection policies to increase learning progress | AMiner