نمای کلی
سنجش خودکار چتبات با داور هوش مصنوعی، پایش ترافیک واقعی، و کنترل هزینه.
آخرین ارزیابی
مشاهدهی گزارش کامل ←نمرهی کل
۹۰/۱۰۰
۱۸ روز پیش
ناموفق
۰
از ۲ کیس
شکاف دانش
۱
کیس بدون منبع بازیابیشده
تأخیر میانگین
۶.۲ ثانیه
p95: ۷.۳ ثانیه
اجرای ارزیابی جدید
هدف بین درخواستها ۳٫۲ ثانیه فاصله میگذارد تا به سقف نرخ چتبات نخورد؛ اجرای کامل چند دقیقه طول میکشد.
اجراهای اخیر
بخشهای داشبورد
از نتیجه تا اقدام
راهنمای آموزشی: هر عدد چه میگوید و بعدش باید چه کرد.
مجموعهی آزمون
خطکش ثابت — کیسهایی که بعد از هر تغییر دوباره اجرا میشوند.
پایش تولید
ترافیک واقعی کاربران: رضایت، شکاف دانش، نرخ تبدیل.
هزینه و تأخیر
هزینهی اجرای بات، هزینهی سنجش آن، و زمان پاسخ.
داورِ داور
آیا داور هوش مصنوعی با قضاوت انسان همخوان است؟
چرا این مهم است
ارزیابی دو لایه دارد و هیچکدام بهتنهایی کافی نیست. مجموعهی آزمون یک خطکش ثابت است: بعد از هر تغییر در پرامپت، مدل یا دانش دوباره اجرا میشود تا بفهمیم بهتر شد یا بدتر. پایش تولید چیزی را نشان میدهد که هیچ مجموعهی آزمونی پیشبینی نمیکند — اینکه کاربران واقعی چه میپرسند و کجا بات کم میآورد. داور فعلی: google/gemini-2.5-flash.