Teaching a Tiny Transformer to Reason: GRPO vs On-Policy Distillation
A toy experiment shows how relative rewards and direct corrections produce very different learning signals.Continue reading on Generative AI »
🔗 Read full article on Generative AI Pub →
Source: Generative AI Pub — Published — Category: Image AI