unsloth-grpo

Name: unsloth-grpo
Author: cuba6112

Implementation of Group Relative Policy Optimization (GRPO) for training reasoning models, optimized for 8x memory savings (triggers: GRPO, reasoning, DeepSeek-R1, reinforcement learning, RLVR, GRPOTrainer, thinking tokens).

Посмотреть исходный код llm-ai

maintainer

cuba6112

Обновлено 12/26/2025

Звёзды

Форки

quick start

Installation and usage

Установка

$ install --globalskills.sh

Использование

После установки вы можете использовать этот skill, выполнив следующую команду в терминале:

skills use unsloth-grpo