تعریف
مجموعه ۱۶۴ مسئله کدنویسی پایتون که مدل باید تابع کامل کند و با تستهای واحد اجرا میشود.
توضیح کامل
HumanEval توسط OpenAI طراحی شد. معیار pass@k: احتمال درست بودن حداقل یک پاسخ از k تلاش. مدلهای جدید روی HumanEval بیش از ۹۰٪ میزنند، پس بنچمارکهای سختتر مثل SWE-bench و LiveCodeBench جایگزین شدهاند.
مثال کاربردی
مسئله نمونه: “تابعی بنویس که برج هانوی را با n دیسک حل کند”.