Language Model Self-improvement by Reinforcement Learning Contemplation Without External Supervision | AMiner