آرکان‌ایوال

رمز داشبورد لازم است

این داشبورد با رمز محافظت می‌شود چون اجرای ارزیابی با کلید OpenRouter هزینه تولید می‌کند. رمز در مرورگر شما ذخیره می‌شود.

داورِ داور

متا-ارزیابی — سنجش اینکه خودِ داور هوش مصنوعی چقدر با قضاوت انسان می‌خواند.

برچسب انسانی
۵
۲ توافق · ۳ اختلاف
نرخ توافق
۴۰.۰٪
به‌تنهایی کافی نیست
کاپای کوهن
۰.۰۶
ناچیز

ماتریس درهم‌ریختگی

سطرها حکم انسان، ستون‌ها حکم داور. قطر اصلی توافق است؛ هر خانه‌ی خارج از قطر یک مورد اختلاف را نشان می‌دهد.

انسان \ داورموفقنسبیناموفقجمع سطر
موفق۰۰۰۰
نسبی۱۲۱۴
ناموفق۱۰۰۱

موارد اختلاف

۳ مورد

جایی که انسان و داور به یک نتیجه نرسیده‌اند. یادداشت‌ها بهترین راهنما برای اصلاح روبریک‌اند.

  • g31انسان:ناموفقداور:موفق۱۸ روز پیش

    خیلی محترمانه صحبت نکرده . میخوام احترام کامل حفظ بشه

  • b8انسان:نسبیداور:ناموفق۱۹ روز پیش

    با صمیمیت بیشتری صحبت کن

  • a2انسان:نسبیداور:موفق۲۰ روز پیش

    داور سخت‌گیر نبود

یادداشت روی موارد توافق

۲ مورد

جایی که حکم داور و انسان یکی بوده ولی انسان نکته‌ای نوشته است. توافق روی حکم، به‌معنای رضایت از استدلال نیست.

  • a1حکم مشترک:نسبی۱۹ روز پیش

    دوست داشتم که چت بات کمی دقیق تر حرف بزنه و حتما درمورد جلسه مشاوره که چقد باارزش هست بیشتر مانور بده

  • a1حکم مشترک:نسبی۲۰ روز پیش

    دقیق ترش کن

چرا این مهم است
ما داریم با یک مدل، مدل دیگری را نمره می‌دهیم — پس چه کسی داور را داوری می‌کند؟ جواب، همین صفحه است: چند ده کیس را انسان هم برچسب می‌زند و ما هم‌خوانی داور با انسان را می‌سنجیم. اما دقت کنید که نرخ توافق به‌تنهایی گمراه‌کننده است: اگر ۹۰٪ کیس‌ها موفق باشند، داوری که چشم‌بسته همیشه «موفق» بگوید ۹۰٪ توافق می‌گیرد بدون اینکه ذره‌ای فهمیده باشد. دقیقاً به همین دلیل کاپای کوهن را حساب می‌کنیم: کاپا توافقِ فراتر از شانس را اندازه می‌گیرد. تفسیر رایج: زیر ۰٫۴ ضعیف، ۰٫۴ تا ۰٫۶ متوسط، ۰٫۶ تا ۰٫۸ خوب، بالای ۰٫۸ عالی. اگر کاپا پایین باشد، هیچ عددی در کل این داشبورد قابل اعتماد نیست — نه نمره‌ی کل، نه تفکیک دسته‌ای، نه مقایسه‌ی دو اجرا — و کار درست این است که به‌جای خوشحالی از نمره‌ها، روبریک داور در src/lib/judges/rubrics.ts اصلاح شود.