preference-optimization
نگهدارنده wshobson
همترازسازی مدل fine-tuned با دادهٔ ترجیح
- نسخه فعلی
- نامشخص
- مجوز
- نامشخص
- دسترسی شبکه
- نامشخص / ارزیابینشده
- وضعیت بررسی
- تأیید نشده
چه مسئلهای را حل میکند؟
بهینهسازی مدل fine-tuned بر پایهٔ دادهٔ ترجیح و انتخاب روش مناسب.
چه زمانی مناسب است؟
وقتی زوج ترجیح یا بازخورد thumbs-up/down دارید، برای انتخاب روش، hyperparameterها یا عیبیابی DPO استفاده کنید.
مدل fine-tuned را با دادهٔ ترجیح و روشهای DPO، ORPO، KTO یا SimPO همتراز میکند؛ برای وجود زوجهای ترجیح یا بازخورد thumbs-up/down، انتخاب روش و hyperparameterها یا عیبیابی اجرای DPO است.
نصب و بهروزرسانی
این دستورها فقط برای کپی نمایش داده میشوند و روی سرور RefHub اجرا نمیشوند. پیش از اجرا، منبع بالادستی پیوندشده را بررسی کنید.
دستور نصب
npx skills add wshobson/agents --skill preference-optimization -y
سازگاری با ایجنتها
هنوز تست سازگاری ثبت نشده است
تا وقتی شواهد تست ثبت نشده، سازگاری این مهارت با ایجنتها را تأییدشده فرض نکنید.