grpo-rlvr-training
نگهدارنده wshobson
آموزش reasoning و رفتار task قابلراستیآزمایی با GRPO و RLVR.
- نسخه فعلی
- نامشخص
- مجوز
- نامشخص
- دسترسی شبکه
- نامشخص / ارزیابینشده
- وضعیت بررسی
- تأیید نشده
چه مسئلهای را حل میکند؟
آموزش GRPO/RLVR و طراحی پاداش برای task قابلبررسی را پوشش میدهد.
چه زمانی مناسب است؟
برای task الگوریتمی قابلارزیابی، reward function یا مشکل GRPO run استفاده کنید.
reasoning و رفتار task قابلراستیآزمایی را با GRPO و reinforcement learning from verifiable rewards (RLVR) آموزش میدهد. وقتی موفقیت task بهصورت الگوریتمی قابلبررسی است—مانند math، code، tool call یا structured output—یا هنگام طراحی GRPO reward function، واگرایی GRPO run یا reward-hack بهکار میرود.
نصب و بهروزرسانی
این دستورها فقط برای کپی نمایش داده میشوند و روی سرور RefHub اجرا نمیشوند. پیش از اجرا، منبع بالادستی پیوندشده را بررسی کنید.
دستور نصب
npx skills add wshobson/agents --skill grpo-rlvr-training -y
سازگاری با ایجنتها
هنوز تست سازگاری ثبت نشده است
تا وقتی شواهد تست ثبت نشده، سازگاری این مهارت با ایجنتها را تأییدشده فرض نکنید.