Loading

eval-audit

نگه‌دارنده hamelsmu

ممیزی خط لولهٔ ارزیابی مدل زبانی و آشکارکردن کاستی‌هایی مانند نبود تحلیل خطا یا داور اعتبارسنجی‌نشده.

نسخه فعلی
نامشخص
مجوز
نامشخص
دسترسی شبکه
نامشخص / ارزیابی‌نشده
وضعیت بررسی
تأیید نشده

چه مسئله‌ای را حل می‌کند؟

کاستی‌هایی را که می‌توانند اعتماد به نتایج ارزیابی LLM را بی‌دلیل بالا نشان دهند پیدا می‌کند.

چه زمانی مناسب است؟

وقتی خط لولهٔ ارزیابی موجود یا اعتبار داورها و معیارهای آن باید ممیزی شود، نه ساخت ارزیاب از صفر.

خط لولهٔ ارزیابی LLM را ممیزی می‌کند و مشکلاتی مانند نبود تحلیل خطا، داورهای اعتبارسنجی‌نشده و معیارهای نمایشی را آشکار می‌سازد. هنگام به‌ارث‌بردن سامانهٔ ارزیابی، تردید دربارهٔ اعتمادپذیری ارزیابی‌ها یا نبود زیرساخت ارزیابی از آن به‌عنوان نقطهٔ شروع استفاده کنید. برای ساخت ارزیاب از صفر به کار نمی‌رود؛ برای آن از error-analysis، write-judge-prompt یا validate-evaluator استفاده کنید.

نصب و به‌روزرسانی

این دستورها فقط برای کپی نمایش داده می‌شوند و روی سرور RefHub اجرا نمی‌شوند. پیش از اجرا، منبع بالادستی پیوندشده را بررسی کنید.

دستور نصب
npx skills add hamelsmu/evals-skills --skill eval-audit -y

سازگاری با ایجنت‌ها

هنوز تست سازگاری ثبت نشده است

تا وقتی شواهد تست ثبت نشده، سازگاری این مهارت با ایجنت‌ها را تأییدشده فرض نکنید.

منبع و وضعیت بررسی

توضیح بالا معرفی ساختاریافتهٔ کاتالوگ است و بازبینی تحریریه‌ای آن ثبت نشده؛ اطلاعات فنی و وضعیت راستی‌آزمایی جداگانه نمایش داده می‌شوند.

آخرین بررسی منبع
ثبت نشده