rloo

Name: rloo
Author: atrawog

Reinforcement Learning with Leave-One-Out estimation for policy optimization. Covers RLOOTrainer, reward function integration, baseline estimation, and variance reduction techniques for stable RL training. Includes thinking-aware patterns.

عرض المصدر machine-learning

maintainer

atrawog

آخر تحديث 1/12/2026

النجوم

التفرعات

quick start

Installation and usage

التثبيت

$ install --globalskills.sh

الاستخدام

بعد التثبيت، يمكنك استخدام هذه المهارة بتشغيل الأمر التالي في الطرفية:

skills use rloo