تعریف
مجموعه آزمون استاندارد برای ارزیابی و مقایسه عینی تواناییهای مدلهای هوش مصنوعی.
توضیح کامل
بنچمارکهای معتبر شامل MMLU (دانش عمومی)، HumanEval (کدنویسی)، MATH (ریاضی)، GPQA (سؤالات کارشناسی)، و LiveBench (جلوگیری از حفظ کردن) هستند. امتیاز بنچمارک شامتیاز بنچمارک شاخص کاملی نیست و ممکن اعی همخوانی نداشته باشد.
مثال کاربردی
مدل A در MMLU امتیاز ۹۲٪ دارد یعنی ۹۲٪ سؤالات چندگزینهای ۵۷ رشته را درست پاسخ میدهد.