Bibliography (5):
Synthesizing Programs for Images using Reinforced Adversarial Learning
Qwen3: Think Deeper, Act Faster
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Wikipedia Bibliography:
Reinforcement learning
Expected value