داورِ داور
متا-ارزیابی — سنجش اینکه خودِ داور هوش مصنوعی چقدر با قضاوت انسان میخواند.
برچسب انسانی
۵
۲ توافق · ۳ اختلاف
نرخ توافق
۴۰.۰٪
بهتنهایی کافی نیست
کاپای کوهن
۰.۰۶
ناچیز
ماتریس درهمریختگی
سطرها حکم انسان، ستونها حکم داور. قطر اصلی توافق است؛ هر خانهی خارج از قطر یک مورد اختلاف را نشان میدهد.
| انسان \ داور | موفق | نسبی | ناموفق | جمع سطر |
|---|---|---|---|---|
| موفق | ۰ | ۰ | ۰ | ۰ |
| نسبی | ۱ | ۲ | ۱ | ۴ |
| ناموفق | ۱ | ۰ | ۰ | ۱ |
موارد اختلاف
۳ موردجایی که انسان و داور به یک نتیجه نرسیدهاند. یادداشتها بهترین راهنما برای اصلاح روبریکاند.
خیلی محترمانه صحبت نکرده . میخوام احترام کامل حفظ بشه
با صمیمیت بیشتری صحبت کن
داور سختگیر نبود
یادداشت روی موارد توافق
۲ موردجایی که حکم داور و انسان یکی بوده ولی انسان نکتهای نوشته است. توافق روی حکم، بهمعنای رضایت از استدلال نیست.
دوست داشتم که چت بات کمی دقیق تر حرف بزنه و حتما درمورد جلسه مشاوره که چقد باارزش هست بیشتر مانور بده
دقیق ترش کن
چرا این مهم است
ما داریم با یک مدل، مدل دیگری را نمره میدهیم — پس چه کسی داور را داوری میکند؟ جواب، همین صفحه است: چند ده کیس را انسان هم برچسب میزند و ما همخوانی داور با انسان را میسنجیم. اما دقت کنید که نرخ توافق بهتنهایی گمراهکننده است: اگر ۹۰٪ کیسها موفق باشند، داوری که چشمبسته همیشه «موفق» بگوید ۹۰٪ توافق میگیرد بدون اینکه ذرهای فهمیده باشد. دقیقاً به همین دلیل کاپای کوهن را حساب میکنیم: کاپا توافقِ فراتر از شانس را اندازه میگیرد. تفسیر رایج: زیر ۰٫۴ ضعیف، ۰٫۴ تا ۰٫۶ متوسط، ۰٫۶ تا ۰٫۸ خوب، بالای ۰٫۸ عالی. اگر کاپا پایین باشد، هیچ عددی در کل این داشبورد قابل اعتماد نیست — نه نمرهی کل، نه تفکیک دستهای، نه مقایسهی دو اجرا — و کار درست این است که بهجای خوشحالی از نمرهها، روبریک داور در src/lib/judges/rubrics.ts اصلاح شود.