eval-audit
نگهدارنده hamelsmu
ممیزی خط لولهٔ ارزیابی مدل زبانی و آشکارکردن کاستیهایی مانند نبود تحلیل خطا یا داور اعتبارسنجینشده.
- نسخه فعلی
- نامشخص
- مجوز
- نامشخص
- دسترسی شبکه
- نامشخص / ارزیابینشده
- وضعیت بررسی
- تأیید نشده
چه مسئلهای را حل میکند؟
کاستیهایی را که میتوانند اعتماد به نتایج ارزیابی LLM را بیدلیل بالا نشان دهند پیدا میکند.
چه زمانی مناسب است؟
وقتی خط لولهٔ ارزیابی موجود یا اعتبار داورها و معیارهای آن باید ممیزی شود، نه ساخت ارزیاب از صفر.
خط لولهٔ ارزیابی LLM را ممیزی میکند و مشکلاتی مانند نبود تحلیل خطا، داورهای اعتبارسنجینشده و معیارهای نمایشی را آشکار میسازد. هنگام بهارثبردن سامانهٔ ارزیابی، تردید دربارهٔ اعتمادپذیری ارزیابیها یا نبود زیرساخت ارزیابی از آن بهعنوان نقطهٔ شروع استفاده کنید. برای ساخت ارزیاب از صفر به کار نمیرود؛ برای آن از error-analysis، write-judge-prompt یا validate-evaluator استفاده کنید.
نصب و بهروزرسانی
این دستورها فقط برای کپی نمایش داده میشوند و روی سرور RefHub اجرا نمیشوند. پیش از اجرا، منبع بالادستی پیوندشده را بررسی کنید.
دستور نصب
npx skills add hamelsmu/evals-skills --skill eval-audit -y
سازگاری با ایجنتها
هنوز تست سازگاری ثبت نشده است
تا وقتی شواهد تست ثبت نشده، سازگاری این مهارت با ایجنتها را تأییدشده فرض نکنید.