تعریف
معماری شبکه عصبی معرفیشده در ۲۰۱۷ (Attention is All You Need) که پایه اکثر مدلهای زبانی مدرن است.
توضیح کامل
نوآوری اصلی ترانسفورمر جایگزینی RNNهای ترتیبی با مکانیزم توجه موازی بود. این امر آموزش بسیار سریعتر روی GPU را ممکن کرد. دو بخش اصلی آن Encoder (درک متن) و Decoder (تولید متن) است؛ مدلهای مختلف یک یا هر دو را دارند.
مثال کاربردی
BERT (Encoder-only) برای طبقهبندی متن و GPT (Decoder-only) برای تولید متن استفاده میشود.