dpo

Name: dpo
Author: atrawog

Direct Preference Optimization for learning from preference pairs. Covers DPOTrainer, preference dataset preparation, implicit reward modeling, and beta tuning for stable preference learning without explicit reward models. Includes thinking quality patterns.

عرض المصدر machine-learning

maintainer

atrawog

آخر تحديث 1/12/2026

النجوم

التفرعات

quick start

Installation and usage

التثبيت

$ install --globalskills.sh

الاستخدام

بعد التثبيت، يمكنك استخدام هذه المهارة بتشغيل الأمر التالي في الطرفية:

skills use dpo