Loading

grpo-rlvr-training

نگه‌دارنده wshobson

آموزش reasoning و رفتار task قابل‌راستی‌آزمایی با GRPO و RLVR.

نسخه فعلی
نامشخص
مجوز
نامشخص
دسترسی شبکه
نامشخص / ارزیابی‌نشده
وضعیت بررسی
تأیید نشده

چه مسئله‌ای را حل می‌کند؟

آموزش GRPO/RLVR و طراحی پاداش برای task قابل‌بررسی را پوشش می‌دهد.

چه زمانی مناسب است؟

برای task الگوریتمی قابل‌ارزیابی، reward function یا مشکل GRPO run استفاده کنید.

reasoning و رفتار task قابل‌راستی‌آزمایی را با GRPO و reinforcement learning from verifiable rewards (RLVR) آموزش می‌دهد. وقتی موفقیت task به‌صورت الگوریتمی قابل‌بررسی است—مانند math، code، tool call یا structured output—یا هنگام طراحی GRPO reward function، واگرایی GRPO run یا reward-hack به‌کار می‌رود.

نصب و به‌روزرسانی

این دستورها فقط برای کپی نمایش داده می‌شوند و روی سرور RefHub اجرا نمی‌شوند. پیش از اجرا، منبع بالادستی پیوندشده را بررسی کنید.

دستور نصب
npx skills add wshobson/agents --skill grpo-rlvr-training -y

سازگاری با ایجنت‌ها

هنوز تست سازگاری ثبت نشده است

تا وقتی شواهد تست ثبت نشده، سازگاری این مهارت با ایجنت‌ها را تأییدشده فرض نکنید.

منبع و وضعیت بررسی

توضیح بالا معرفی ساختاریافتهٔ کاتالوگ است و بازبینی تحریریه‌ای آن ثبت نشده؛ اطلاعات فنی و وضعیت راستی‌آزمایی جداگانه نمایش داده می‌شوند.

آخرین بررسی منبع
ثبت نشده