اصطلاح intermediate

بنچمارک HumanEval | HumanEval Benchmark

مجموعه ۱۶۴ مسئله کدنویسی پایتون که مدل باید تابع کامل کند و با تست‌های واحد اجرا می‌شود.

HumanEval Benchmark — بنچمارک HumanEval | HumanEval Benchmark

مجموعه ۱۶۴ مسئله کدنویسی پایتون که مدل باید تابع کامل کند و با تست‌های واحد اجرا می‌شود.

تعریف

مجموعه ۱۶۴ مسئله کدنویسی پایتون که مدل باید تابع کامل کند و با تست‌های واحد اجرا می‌شود.

توضیح کامل

HumanEval توسط OpenAI طراحی شد. معیار pass@k: احتمال درست بودن حداقل یک پاسخ از k تلاش. مدل‌های جدید روی HumanEval بیش از ۹۰٪ می‌زنند، پس بنچمارک‌های سخت‌تر مثل SWE-bench و LiveCodeBench جایگزین شده‌اند.

مثال کاربردی

مسئله نمونه: “تابعی بنویس که برج هانوی را با n دیسک حل کند”.

موارد مرتبط

بنچمارک MMLU | MMLU Benchmark
اصطلاح
ترانسفورمر | Transformer
اصطلاح
مجموعه داده | Dataset
اصطلاح
رمزگشایی سریع | Speculative Decoding
اصطلاح