نمای کلی
سنجش خودکار چتبات با داور هوش مصنوعی، پایش ترافیک واقعی، و کنترل هزینه.
آخرین ارزیابی
مشاهدهی گزارش کامل ←نمرهی کل
۹۶/۱۰۰
۳۱ روز پیش
ناموفق
۰
از ۵ کیس
شکاف دانش
۰
کیس بدون منبع بازیابیشده
تأخیر میانگین
۴.۹ ثانیه
p95: ۶.۶ ثانیه
اجرای ارزیابی جدید
هدف بین درخواستها ۳٫۲ ثانیه فاصله میگذارد تا به سقف نرخ چتبات نخورد؛ اجرای کامل چند دقیقه طول میکشد و در صفحهی گزارش تکهتکه جلو میرود. صفحه را تا پایان باز نگه دارید.
اجراهای اخیر
بخشهای داشبورد
از نتیجه تا اقدام
راهنمای آموزشی: هر عدد چه میگوید و بعدش باید چه کرد.
مجموعهی آزمون
خطکش ثابت — کیسهایی که بعد از هر تغییر دوباره اجرا میشوند.
پایش تولید
ترافیک واقعی کاربران: رضایت، شکاف دانش، نرخ تبدیل.
هزینه و تأخیر
هزینهی اجرای بات، هزینهی سنجش آن، و زمان پاسخ.
داورِ داور
آیا داور هوش مصنوعی با قضاوت انسان همخوان است؟
چرا این مهم است
ارزیابی دو لایه دارد و هیچکدام بهتنهایی کافی نیست. مجموعهی آزمون یک خطکش ثابت است: بعد از هر تغییر در پرامپت، مدل یا دانش دوباره اجرا میشود تا بفهمیم بهتر شد یا بدتر. پایش تولید چیزی را نشان میدهد که هیچ مجموعهی آزمونی پیشبینی نمیکند — اینکه کاربران واقعی چه میپرسند و کجا بات کم میآورد. داور فعلی: google/gemini-2.5-flash.