بيرت (نموذج لغوي)

بيرت
معلومات عامة
نوع
نسبة التسمية
النموذج المصدري
حقوق التأليف والنشر محفوظة [لغات أخرى] عدل القيمة على Wikidata
المطور الأصلي
المطورون
Google Research [الإنجليزية] ترجم عدل القيمة على Wikidata
موقع الويب
arxiv.org…[4] (الإنجليزية) عدل القيمة على Wikidata
معلومات تقنية
الحجم
110٬000٬000 وسيط — 340٬000٬000 وسيط عدل القيمة على Wikidata
الإصدار الأول
31 أكتوبر 2018
المستودع
الرخصة

بيرت (بالإنجليزية: BERT) أو تمثيلات المشفر ثنائية الاتجاه من المحولات هو نموذج لغوي قدمه باحثون في جوجل في أكتوبر 2018.[5][6] يتعلم تمثيل النص كسلسلة من المتجهات باستخدام التعلم الذاتي. يستخدم بنية المحول المشفر فقط. يشتهر بتحسينه الكبير مقارنة بالنماذج السابقة الحديثة، وكمثال مبكر على نموذج لغوي كبير. اعتبارًا من عام 2020، أصبح بيرت معيارًا أساسيًا في تجارب معالجة اللغات الطبيعية (NLP).[7]

يتم تدريب بيرت عن طريق التنبؤ بالرموز المقنعة والتنبؤ بالجملة التالية. نتيجة لعملية التدريب هذه، يتعلم بيرت تمثيلات سياقية كامنة للرموز في سياقها، على غرار ELMo والمحول المولد مسبق التدريب 2.[8] وجد تطبيقات للعديد من مهام معالجة اللغات الطبيعية، مثل حل الإحالة المرجعية وحل الاشتراك اللفظي.[9] يُعد خطوة تطورية مقارنة بـ ELMo، وأدى إلى دراسة "علم بيرت"، الذي يحاول تفسير ما يتعلمه بيرت.[7]

تم تنفيذ بيرت في الأصل باللغة الإنجليزية بحجمين للنموذج، BERTBASE (110 مليون معلمة) و BERTLARGE (340 مليون معلمة). تم تدريب كلاهما على مجموعة تورنتو للكتب (800 مليون كلمة) و ويكيبيديا الإنجليزية (2500 مليون كلمة) تم إصدار الأوزان على غيت هاب.[10] في 11 مارس 2020، تم إصدار 24 نموذجًا أصغر، أصغرها BERTTINY مع 4 ملايين معلمة فقط.[10]

البُنيَة

لبيرت بُنية تتكون من محول "مشفر فقط" (encoder ). اختصاراً، يتكون بيرت من 4 وحدات:

  • المُجزئ: تحول هذه الوحدة جزءًا من النص الإنجليزي إلى سلسلة من الأعداد الصحيحة تسمى بالرموز (tokens).
  • التضمين: تحول هذه الوحدة سلسلة الرموز إلى مصفوفة من المتجهات ذات القيم الحقيقية التي تمثل الرموز. يمثل تحويل أنواع الرموز المنفصلة إلى فضاء إقليدي منخفض الأبعاد.
  • المشفر: مجموعة من كتل المحولات مع الانتباه الذاتي، ولكن بدون إخفاء سببي.
  • رأس المهمة: تحول هذه الوحدة متجهات التمثيل النهائية إلى رموز مشفرة مرة أخرى عن طريق إنتاج توزيع احتمالي متوقع لأنواع الرموز. يمكن اعتباره بمثابة وحدة فك ترميز بسيطة، تقوم بفك ترميز التمثيل الكامن إلى أنواع الرموز، أو كـ "طبقة إلغاء تضمين".

رأس المهمة ضروري للتدريب المسبق، ولكنه غالبًا ما يكون غير ضروري لما يسمى "مهام المصب"، مثل الإجابة على الأسئلة أو تصنيف المشاعر. بدلاً من ذلك، يزيل المرء رأس المهمة ويستبدله بوحدة مهيأة حديثًا مناسبة للمهمة، ويقوم بضبط الوحدة الجديدة بدقة. يتم تغذية تمثيل المتجه الكامن للنموذج مباشرة في هذه الوحدة الجديدة، مما يسمح بنقل التعلم بكفاءة في أخذ العينات.[5][11]

التضمين

يصف هذا القسم التضمين المستخدم بواسطة BERTBASE. الآخر، BERTLARGE، مشابه، ولكنه أكبر. المُجزئ الخاص بـ BERT هو WordPiece ، وهي استراتيجية للكلمات الفرعية مثل ترميز أزواج البايت. حجم مفرداته 30000، وأي رمز لا يظهر في مفرداته يتم استبداله بـ [UNK] ("غير معروف"). الطبقة الأولى هي طبقة التضمين، التي تحتوي على ثلاثة مكونات: تضمينات نوع الرمز، وتضمينات الموضع، وتضمينات نوع المقطع.

  • نوع الرمز: نوع الرمز هو طبقة تضمين قياسية، تحول متجهًا ساخنًا إلى متجه كثيف بناءً على نوع الرمز الخاص به.
  • الموضع: تعتمد تضمينات الموضع على موضع الرمز في التسلسل. يستخدم BERT تضمينات موضع مطلقة، حيث يتم تعيين كل موضع في التسلسل إلى متجه ذي قيمة حقيقية. يتكون كل بُعد من المتجه من دالة جيبية تأخذ الموضع في التسلسل كمدخل.
  • نوع المقطع: باستخدام مفردات من 0 أو 1 فقط، تنتج طبقة التضمين هذه متجهًا كثيفًا بناءً على ما إذا كان الرمز ينتمي إلى مقطع النص الأول أو الثاني في هذا الإدخال. بمعنى آخر، جميع الرموز من النوع 1 هي جميع الرموز التي تظهر بعد الرمز الخاص [SEP]. جميع الرموز السابقة هي من النوع 0.

يتم جمع متجهات التضمين الثلاثة معًا لتمثيل تمثيل الرمز الأولي كدالة لهذه الأجزاء الثلاثة من المعلومات. بعد التضمين، يتم تطبيع تمثيل المتجه باستخدام عملية LayerNorm، وإخراج متجه ذي 768 بُعدًا لكل رمز إدخال. بعد ذلك، يتم تمرير متجهات التمثيل للأمام عبر 12 كتلة تشفير محول، ويتم فك ترميزها مرة أخرى إلى فضاء مفردات ذي 30000 بُعدًا باستخدام طبقة تحويل خطي أساسية.

مراجع

  1. "Open Sourcing BERT: State-of-the-Art Pre-training for Natural Language Processing" (بالإنجليزية). Retrieved 2023-03-16.{{استشهاد ويب}}: صيانة الاستشهاد: لغة غير مدعومة (link)
  2. "Open Sourcing BERT: State-of-the-Art Pre-training for Natural Language Processing" (بالإنجليزية). Retrieved 2022-07-31.{{استشهاد ويب}}: صيانة الاستشهاد: لغة غير مدعومة (link)
  3. وصلة مرجع: https://www.theverge.com/2019/12/11/20993407/ai-language-models-muppets-sesame-street-muppetware-elmo-bert-ernie.
  4. وصلة مرجع: https://api.github.com/repos/google-research/bert. الوصول: 3 أكتوبر 2022.
  5. 1 2 A bot will complete this citation soon. Click here to jump the queue أرخايف:1810.04805v2.
  6. "Open Sourcing BERT: State-of-the-Art Pre-training for Natural Language Processing". Google AI Blog (بالإنجليزية). 2 Nov 2018. Archived from the original on 2023-08-18. Retrieved 2019-11-27.
  7. 1 2 Rogers، Anna؛ Kovaleva، Olga؛ Rumshisky، Anna (2020). "A Primer in BERTology: What We Know About How BERT Works". Transactions of the Association for Computational Linguistics. ج. 8: 842–866. arXiv:2002.12327. DOI:10.1162/tacl_a_00349. S2CID:211532403. مؤرشف من الأصل في 2024-12-15.
  8. Ethayarajh، Kawin (1 سبتمبر 2019)، How Contextual are Contextualized Word Representations? Comparing the Geometry of BERT, ELMo, and GPT-2 Embeddings، arXiv:1909.00512
  9. Anderson, Dawn (5 Nov 2019). "A deep dive into BERT: How BERT launched a rocket into natural language understanding". Search Engine Land (بالإنجليزية). Archived from the original on 2024-12-15. Retrieved 2024-08-06.
  10. 1 2 "BERT". GitHub. مؤرشف من الأصل في 2025-01-16. اطلع عليه بتاريخ 2023-03-28.
  11. Zhang، Tianyi؛ Wu، Felix؛ Katiyar، Arzoo؛ Weinberger، Kilian Q.؛ Artzi، Yoav (11 مارس 2021)، Revisiting Few-sample BERT Fine-tuning، arXiv:2006.05987