آرکان‌ایوال

رمز داشبورد لازم است

این داشبورد با رمز محافظت می‌شود چون اجرای ارزیابی با کلید OpenRouter هزینه تولید می‌کند. رمز در مرورگر شما ذخیره می‌شود.

داورِ داور

متا-ارزیابی — سنجش اینکه خودِ داور هوش مصنوعی چقدر با قضاوت انسان می‌خواند.

برچسب انسانی
۹
۳ توافق · ۶ اختلاف
نرخ توافق
۳۳.۳٪
به‌تنهایی کافی نیست
کاپای کوهن
۰.۱۳
ناچیز

ماتریس درهم‌ریختگی

سطرها حکم انسان، ستون‌ها حکم داور. قطر اصلی توافق است؛ هر خانه‌ی خارج از قطر یک مورد اختلاف را نشان می‌دهد.

انسان \ داورموفقنسبیناموفقجمع سطر
موفق۱۰۰۱
نسبی۲۲۱۵
ناموفق۳۰۰۳

موارد اختلاف

۶ مورد

جایی که انسان و داور به یک نتیجه نرسیده‌اند. یادداشت‌ها بهترین راهنما برای اصلاح روبریک‌اند.

  • c13انسان:نسبیداور:موفق۳۱ روز پیش

    به جای استفاده از : بسیار عالی و میخوام همیشه بگی ماشالا

  • f27انسان:ناموفقداور:موفق۳۲ روز پیش

    من موافق نیستم . من میخوام که حتما از عبارت من دستیار آرکان هستم' استفاده بشه .

  • a5انسان:ناموفقداور:موفق۳۳ روز پیش

    دوست ندارم که از ستاره استفاده بشه در جواب ها : **کسب‌وکارهای کوچک و متوسط (SMEs)**

  • g31انسان:ناموفقداور:موفق۸۲ روز پیش

    خیلی محترمانه صحبت نکرده . میخوام احترام کامل حفظ بشه

  • b8انسان:نسبیداور:ناموفق۸۳ روز پیش

    با صمیمیت بیشتری صحبت کن

  • a2انسان:نسبیداور:موفق۸۵ روز پیش

    داور سخت‌گیر نبود

یادداشت روی موارد توافق

۳ مورد

جایی که حکم داور و انسان یکی بوده ولی انسان نکته‌ای نوشته است. توافق روی حکم، به‌معنای رضایت از استدلال نیست.

  • g31حکم مشترک:موفق۳۳ روز پیش

    این نظری که دادی: ادعای بی‌پشتوانه: ما تا مرحله‌ی اجرا و تبدیل برنامه‌ها به نتایج قابل‌اندازه‌گیری در کنار شما می‌مانیم. این پیام از نظر من بی پشتوانه نیست و هربار که کاربر این سوال رو پرسید میتونی جواب رو همین شکلی بدی

  • a1حکم مشترک:نسبی۸۳ روز پیش

    دوست داشتم که چت بات کمی دقیق تر حرف بزنه و حتما درمورد جلسه مشاوره که چقد باارزش هست بیشتر مانور بده

  • a1حکم مشترک:نسبی۸۵ روز پیش

    دقیق ترش کن

چرا این مهم است
ما داریم با یک مدل، مدل دیگری را نمره می‌دهیم — پس چه کسی داور را داوری می‌کند؟ جواب، همین صفحه است: چند ده کیس را انسان هم برچسب می‌زند و ما هم‌خوانی داور با انسان را می‌سنجیم. اما دقت کنید که نرخ توافق به‌تنهایی گمراه‌کننده است: اگر ۹۰٪ کیس‌ها موفق باشند، داوری که چشم‌بسته همیشه «موفق» بگوید ۹۰٪ توافق می‌گیرد بدون اینکه ذره‌ای فهمیده باشد. دقیقاً به همین دلیل کاپای کوهن را حساب می‌کنیم: کاپا توافقِ فراتر از شانس را اندازه می‌گیرد. تفسیر رایج: زیر ۰٫۴ ضعیف، ۰٫۴ تا ۰٫۶ متوسط، ۰٫۶ تا ۰٫۸ خوب، بالای ۰٫۸ عالی. اگر کاپا پایین باشد، هیچ عددی در کل این داشبورد قابل اعتماد نیست — نه نمره‌ی کل، نه تفکیک دسته‌ای، نه مقایسه‌ی دو اجرا — و کار درست این است که به‌جای خوشحالی از نمره‌ها، روبریک داور در src/lib/judges/rubrics.ts اصلاح شود.