تعریف
مجموعه دادههای ساختاریافته برای آموزش، اعتبارسنجی و تست مدلهای هوش مصنوعی.
توضیح کامل
معمولاً به سه بخش تقسیم میشود: Train (۷۰-۸۰٪)، Validation (۱۰-۱۵٪) و Test (۱۰-۱۵٪). کیفیت داده (بدون تعصب، نماینده، متنوع) مهمتر از حجم آن است. مجموعه دادههای عمومی مثل Common Crawl، Wikipedia و Books3 پایه آموزش LLMها هستند.
مثال کاربردی
ImageNet با ۱۴ میلیون تصویر برچسبدار انقلابی دانقلابی در بینایی ماشین ایجاد کرد.