Atlas · GenAI 2026
GRPO
Group Relative Policy Optimization — critic-free RL used to train reasoning models.
conceptPeak: 2025AlignmentAI consensus: 3/3
Prerequisites
No prerequisites.
Recommended reference
DeepSeek-AI (2025) "DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via RL" — arxiv.org/abs/2501.12948
Notes from AI deep research
Anthropic Opus
Przełom DeepSeek-R1: trening rozumowania bez krytyka, przepisany na nowo koszt RL
OpenAI Deep Research
GRPO stało się kluczowe dla rozumienia treningu modeli rozumujących bez kosztownego krytyka [OA]
Google Deep Think
Najważniejsza nowa metoda optymalizacji polityki pozwalająca na skuteczne uczenie modeli wnioskujących bez kosztownego modelu oceniającego [G]
Related skills
- → is subcategory of: Reinforcement Learning(0/3)