Bibliography (5):

  1. Synthesizing Programs for Images using Reinforced Adversarial Learning

  2. Qwen3: Think Deeper, Act Faster

  3. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

  4. Wikipedia Bibliography:

    1. Reinforcement learning

    2. Expected value