دالة سوفت ماكس

دالة softmax، والمعروفة أيضًا باسم softargmax [1] :184أو الدالة الأسية المُطبَّعة ، [2] :198تُحوّل متجهًا مكوّنًا من K عددًا حقيقيًا إلى توزيع احتمالي لـ K نتيجة ممكنة. وهي تعميم للدالة اللوجستية إلى أبعاد متعددة، وتُستخدم في الانحدار اللوجستي المتعدد الحدود . غالبًا ما يتم استخدام دالة softmax كدالة التنشيط الأخيرة للشبكة العصبية لتطبيع إخراج الشبكة إلى توزيع الاحتمالات على فئات الإخراج المتوقعة.

تعريف

تأخذ دالة softmax كمدخل متجهًا z من K عددًا حقيقيًا، وتقوم بتطبيعه إلى توزيع احتمالي يتكون من K احتمالًا تتناسب مع الأسس للأسس المدخلة. أي أنه، قبل تطبيق softmax، قد تكون بعض مكونات المتجه سالبة، أو أكبر من واحد؛ وقد لا يكون مجموعها 1؛ ولكن بعد تطبيق softmax، سيكون كل مكون في الفاصل الزمني ، و ستكون المكونات جميعها مجموعها 1، بحيث يمكن تفسيرها كاحتمالات. علاوة على ذلك، فإن مكونات الإدخال الأكبر سوف تتوافق مع احتمالات أكبر.

بِشكل رسمي، فإن دالة softmax القِياسية (الوحدوية) ، أين ، تأخذ مُتجهًا وتُحَسِبُ كُلَ مكون من المُتجه

وفقًا لما يلي:

بعبارة أخرى، تقوم دالة softmax بتطبيق الدالة الأسية القياسية على كل عنصر من متجه الإدخال (المكَّون من عددًا حقيقيًا، ثم تقوم بتطبيع هذه القيم من خلال قسمتها على مجموع كل هذه القيم الأسية. يضمن هذا التطبيع أن يكون مجموع مكونات متجه الإخراج مساوٍ لـ 1. ويعود أصل مصطلح "softmax" مشتق من التأثيرات المكبرة للأسية على أي حد أقصى في متجه الإدخال. مثال ، سوفت ماكس القياسي لـ تقريبا ، وهو ما يعادل تعيين كل وزن الوحدة الإجمالي تقريبًا في النتيجة إلى موضع العنصر الأقصى للمتجه (8).

بشكل عام، بدلاً من e يمكن استخدام قاعدة مختلفة b > 0 . كما كما في السابق، إذا كان b > 1 ، فإن المكونات الأكبر في الإدخال ستؤدي إلى احتمالات أكبر في الإخراج، وزيادة قيمة b ستُنتج توزيعات احتمالية أكثر تركيزًا حول مواضع القيم الأكبر في الإدخال. وعلى العكس، إذا كان 0 < b < 1 ، فإن المكونات الأصغر في الإدخال ستؤدي إلى احتمالات أكبر في الإخراج، وتقليل قيمة b توزيعات احتمالية أكثر تركيزًا حول مواضع أصغر قيم الإدخال. أو [ا] (بالنسبة لـ β الحقيقية) [ب] ينتج التعبيرات: [ج]

قيمة تناسب عكسيًا مع مقلوب β تُعرف أحيانًا بدرجة الحرارة : حيث k عادةً ما تكون 1 أو ثابت بولتزمان و T هي درجة الحرارة. درجة الحرارة أعلى تؤدي إلى توزيع إخراج أكثر تجانسًا (أي مع إنتروبيا أعلى؛ يكون "أكثر عشوائية")، في حين تؤدي درجة الحرارة المنخفضة إلى توزيع إخراج أكثر حدة، مع هيمنة قيمة واحدة.

في بعض المجالات، تكون القاعدة ثابتة، مما يتوافق مع مقياس ثابت، [د]بينما في مجالات أخرى يتم تغيير المعامل β (أو T ).

التفسيرات

الحد الأقصى للوسيط السلس

دالة Softmax هي تقريب سلس لدالة arg max : الدالة التي تكون قيمتها هي مؤشر أكبر عنصر في المتجه. قد يكون اسم "softmax" مضللاً. Softmax ليست أقصى قيمة سلسة (أي تقريب سلس لدالة الحد الأقصى ). يُستخدام مصطلح "softmax" أيضًا للدالة LogSumExp المرتبطة ارتباطًا وثيقًا، وهي أقصى قيمة سلسة. لهذا السبب، يفضل البعض المصطلح الأكثر دقة "softargmax"، على الرغم من أن مصطلح "softmax" تقليدي في التعلم الآلي. [3] يستخدم هذا القسم مصطلح "softargmax" من أجل الوضوح.

بِشكل رسمي، بَدلًا مِنْ اعِتبار arg max كدالة تُنتج مُخرجات تَصنيفية (المقابلة للمؤشر)، نُعتبر دالة arg max التي يكون مخرجها تمثيلًا من النوع أحادي الاتجاه (على افِتراض وُجُود arg أقَصى فريد): حِيثُ تَكُون الإحداثية وفقط إذا كان هو الحد الأقصى لـ ، معنى هي القيمة القصوى الفريدة لـ . مثال على ذلك، في هذا الترميز : لأن العُنصر الثَالث هُو القِيمَة العُظمَى.

يمكن تعميم هذا المفهوم ليشمل الحالات التي تحتوي على أكثر من قيمة عظمى arg max (أي عندما تكون عدة قيم متساوية وتشكل القيم العظمى) من خلال توزيع القيمة 1 بالتساوي بين جميع المواضع التي تحقق القيمة العظمى؛ وذلك بشكل رسمي باستخدام 1/k حيث k هو عدد المواضع التي تحقق القيمة العظمى. على سبيل المثال: نظرًا لأن الحجة الثانية والثالثة هما الحد الأقصى. في حالة تساوي جميع الحجج، فهذا ببساطة النقاط z ذات قيم arg max المتعددة هي نقاط مفردة (أو تفردات، وتشكل المجموعة المفردة) - هذه هي النقاط التي تكون فيها arg max غير متصلة (مع انقطاع قفزة ) - بينما تُعرف النقاط ذات arg max واحدة باسم النقاط غير المفردة أو المنتظمة.

يُمكن تَعميم ذلك ليشمل حالات وُجود عِدة قيم arg max: كما ، يتقارب السوفتماكس مع arg max. هناك مفاهيم مختلفة لتقارب الدالة؛ حيث يتقارب السوفتماكس مع arg max نقطة بنقطة ، مما يعني أنه لكل مدخل ثابت z ، ومع ذلك، لا يتقارب سوفتماكس بشكل موحد مع arg max، مما يعني بديهيًا أن النقاط المختلفة تتقارب بمعدلات مختلفة، وقد تتقارب ببطء بشكل تعسفي. في الواقع، فإن softargmax مستمر، ولكن arg max ليس مستمرًا في المجموعة المفردة حيث يكون الإحداثيان متساويين، في حين أن الحد الموحد للوظائف المستمرة يكون مستمرًا. السبب وراء فشلها في التقارب بشكل موحد هو أنه بالنسبة للُمدخلات حيث يكون الإحداثيان متساويين تقريبًا (وأحدهما هو الحد الأقصى)، فإن arg max هو مؤشر أحدهما أو الآخر، وبالتالي فإن التغيير الصغير في المُدخلات يؤدي إلى تغيير كبير في المخرجات. على سبيل المثال، لكن و لجميع المدخلات: كلما اقتربت النقاط من المجموعة المفردة كلما تقاربت بشكل أبطأ. ومع ذلك، فإن softargmax يتقارب بشكل مضغوط على المجموعة غير المفردة.

وعلى العكس، عندما تؤول ، كما ، فإن softargmax تتقارب إلى arg min بالطريقة نفسها، حيث تكون المجموعة المفردة هنا هي النقاط التي تحتوي على قيمتين تحققان الحد الأدنى arg min . في لغة التحليل الاستوائي ، تُعد softmax تشويهًا أو "تكميمًا" لـ arg max و arg min، وهو ما يتوافق مع استخدام نصف الحلقة اللوغاريتمية بدلاً من نصف الحلقة max-plus (على التوالي min-plus semiring )، واستعادة arg max أو arg min عن طريق أخذ الحد يسمى "التكميم الاستوائي" أو "إزالة التكميم".

كما أنه من الصحيح أيضًا أنه، لأي قيمة ثابتة لـ β، إذا كانت إحدى المدخلات أكبر بكثير من باقي القيم نسبةً إلى درجة الحرارة، ، فإن المخرج يكون تقريبًا هو الحد الأقصى للوسيطة. على سبيل المثال، فرق بمقداره 10 يُعد كبيرًا بالنسبة إلى درجة الحرارة قدرها 1: لكن، إذا كان الفرق صغيرًا نسبةً إلى درجة الحرارة، فلن تكون القيمة قريبة من الـ arg max. على سبيل المثال، فرق مقداره 10 درجات يُعد صغيرًا بالنسبة إلى درجة حرارة قدرها 100درجة: وعندما تؤول ، فإن درجة الحرارة تؤول إلى الصفر، ، وبالتالي تصبح جميع الفروقات في النهاية كبيرة (نسبةً إلى درجة الحرارة تتناقص)، وهو ما يُقدم تفسيرًا آخر لسلوك النهاية.

الميكانيكا الإحصائية

فَي ميكانيكا الإحصاx ، تُعرف دالة السوفترجمكس باسم توزيع بولتزمان (أو توزيع جيبس ): [4] :7مَجموعة المؤشرات تُمثل الحالات الدقيقة للنظام؛ المدخلات هي طاقات تلك الحالة؛ والمقام يُعرف بدالة التقسيم ، وغالبًا ما يُرمز له بـ Z ؛ والعامل β يُسمى البرودة (أو بيتا الديناميكية الحرارية ، أو درجة الحرارة العكسية ).

التطبيقات

تُستخدم دالة softmax في عدة طرق تصنيف متعددة الفئات ، مثل الانحدار اللوجستي المتعدد الحدود (المعروف أيضًا باسم انحدار softmax)، [5] :206–209[6] التحليل التمييزي الخطي متعدد الفئات، مصنفات بايز الساذجة ، والشبكات العصبية الاصطناعية . على وجه التحديد، في الانحدار اللوجستي المتعدد الحدود والتحليل التمييزي الخطي، يكون الإدخال إلى الدالة هو ناتج K دالة خطية مميزة، وتكون الاحتمالية المتوقعة للفئة j المعطاة متجه العينة x ومتجه الأوزان w هي:

يمكن النظر إلى ذلك على أنه تكوين لعددـ K من الدوال الخطية ودالة سوفت ماكس (حيث يرمز إلى الضرب الداخلي لـ و ). العملية تعادل تطبيق عامل خطي مُعرف بواسطة على المتجهات ، وبذلك يتم تحويل الإدخال الأصلي، الذي قد يكون عالي الأبعاد، إلى متجهات في فضاء ذي بعد K أي .

الشبكات العصبية

تُستخدم دالة softmax القياسية غالبًا في الطبقة النهائية من مصنف قائم على الشبكات العصبية. تُدرب هذه الشبكات عادةً في ظل نظام خسارة السجل (أو الإنتروبيا المتقاطعة )، مما يعطي متغيرًا غير خطي للانحدار اللوجستي المتعدد الحدود.

بما أ، الدالة تُحوّل متجهًا وفهرسًا معينًا إلى قيمة حقيقية، فإن المشتقة تحتاج إلى أخذ الفهرس في الاعتبار :

هذا التعبير متماثل في الفهارس وبالتالي يمكن أيضًا التعبير عنه كـ

هُنا، تُستخدم دلتا كرونيكر للتبسيط (قارن بمشتقة لدالة سيجما ، والتي يتم التعبير عنها من خلال الدالة نفسها).

لضمان حسابات الرقمية، من الشائع طرح القيمة العظمى من متجه الإدخال. هذا الأسلوب، رغم أنه لا يغيّر الناتج أو المشتق نظريًا، يعزز الاستقرار من خلال التحكم المباشر في قيمة الأس القصوى المحسوبة.

إذا تم تحجيم الوظيفة باستخدام المعامل ، فيجب ضرب هذه التعبيرات بـ .

انظر إلى نموذج لوجيت متعدد الحدود للحصول على نموذج احتمالي يستخدم دالة تفعيل السوفتماكس.

التعلم التعزيزي

فِي مَجال التعلم التعزيزي ، يُمكن استخدام دالة SoftMax لتحويل القِيم إلى احتِمالات للإجراءات. والدالة المُستخدمة عادةً هي:

حيث تُمثل قيمة الإجراء المكافأة المتوقعة عند اتباع الإجراءa وتُعرف بمعامل الحرارة (في إشارة إلى الميكانيكا الإحصائية ). عند درجات حرارة عالية ( ), تصبح جميع الإجراءات ذات احتمالات متقاربة تقريبًا وكلما انخفضت درجة الحرارة، كلما زاد تأثير المكافآت المتوقعة على الاحتمالية. لدرجات الحرارة المنخفضة ( ), فإن احتمالية الفعل الذي يحمل أعلى مكافأة متوقعة تميل إلى 1.

التعقيد الحسابي والعلاجات

في تطبيقات الشبكات العصبية، غالبًا ما يكون عدد النواتج المحتملة K كبيرًا، كما في حالة نماذج اللغة العصبية التي تتنبأ بالناتج الأكثر احتمالًا من بين مفردات قد تحتوي على ملايين الكلمات الممكنة. [7] يمكن أن يجعل ذلك حسابات طبقة softmax (أي ضرب المصفوفات لتحديد القيم ، يتبعها تطبيق دالة السوفتماكس نفسها) مكلفة حسابيًا. [7] [8] علاوة على ذلك، تتضمن طريقة الانتشار الخلفي للنزول المتدرج لتدريب مثل هذه الشبكة العصبية حساب softmax لكل مثال تدريبي، ويمكن أن يصبح عدد أمثلة التدريب كبيرًا أيضًا. أصبح الجهد الحسابي لـ SoftMax عاملًا مقيدًا رئيسيًا في تطوير نماذج اللغة العصبية الأكبر حجمًا، مما حفز العديد من العلاجات لتقليل أوقات التدريب. [7] [8]

الأساليب التي تُعيد تنظيم طبقة softmax لحساب أكثر كفاءة ، تشمل softmax الهرمي و softmax المتمايز . [9] Softmax الهرمي (الذي قَدمه مورين وبينجيو في عام 2005)يستخدم بنية شجرة ثنائية حيث تكون النواتج (كلمات المفردات) هي الأوراق والعُقد الوسيطة هي "فئات" مختارة بشكل مناسب من النواتج، مشكّلة متغيرات كامنة . [10] [11] يمكن بعد ذلك حساب الاحتمال المرغوب (قيمة softmax) لورقة (ناتج) ما على أنه حاصل ضرب احتمالات جميع العُقد على المسار من الجذر إلى تلك الورقة. [8] من الناحية المثالية، عندما تكون الشجرة متوازنة، فإن ذلك يُقلل من التعقيد الحسابي من ل . [11] في الواقع، تعتمد النتائج على اختيار استراتيجية جيدة لتجميع النواتج في فئات. [8] [11]وقد تم استخدام شجرة هوفمان لهذا الغرض في نماذج word2vec الخاصة بـ جوجل (التي تم تقديمها في عام 2013) لتحقيق القابلية للتوسع. [7]

النوع الثاني من الحلول يعتمد على تقريب الـ softmax (أثناء التدريب) باستخدام وظائف خسارة معدّلة تتجنب حساب عامل التطبيع الكامل. [9] وتشمل هذه الطرق التي تقيد مجموع التطبيع بعينة من النواتج (مثل التعيين بالاهتمام، والتعيين بالهدف). [7] [10]

الخوارزميات العددية

طريقة الـ SoftMax التقليدية عدديًا بسبب عمليات الأسّ الكبيرة. أما طريقة السوفتمكس الآمنة فتحسب بدلًا من ذلك: حيث هو أكبر عنصر مشارك. إن الطرح به يضمن أن الأسس تؤدي إلى 1 على الأكثر.

تأخذ آلية الانتباه في Transformers ثلاثة مدخلات: "متجه الاستعلام" ، وقائمة من "متجهات المفاتيح" ، وقائمة "متجهات القيم" ، وتنتج مجموعًا لمتجهات القيم موزونًا بدالة softmax : تَتضمن طريقة SoftMax التقليدية عِدة دورات على المُدخلات، ما قد يُشكّل عنق زجاجة بسبب عرض نطاق الترددي للذاكرة . طريقة FlashAttention هي خوارزمية تتجنب كثرة الاتصال إذ تدمج هذه العمليات في دورة واحدة، مما يزيد من كثافة العمليات الحسابية . وهيخوارزمية تعمل على نحو متصل وتحسب الكميات التالية: [12] [13] وتُعيد القيمة . في التطبيق العملي، تعمل FlashAttention على عدة استعلامات ومفاتيح في كل دورة، بطريقة مشابهة لعملية ضرب المصفوفات المجزأة . وإذا كانت هناك حاجة للتراجع العكسي،يتم تخزين متجهات الإخراج والمصفوفات الوسيطة وخلال مرحلة التراجع، يتم إعادة تشكيل مصفوفات الانتباه منها، مما يجعلها شكلاً من أشكال"حفظ نقاط التدرج".

الخصائص الرياضية

هندسيًا، تقوم دالة softmax بإسقاط مساحة المتجه إلى حدود المعيار -simplex ، مما يقلل البعد بمقدار واحد (النطاق هو بسيط ذو بعد في فضاء ذي أبعاد، وذلك بسبب القيد الخطي بأن مجموع جميع المخرجات يساوي 1، مما يعني أنه يقع على مستوى فائق .

على طُول القطر الرئيسي تكون دالة SoftMax مجرد توزيع منتظم على المخرجات، :القِيم المُتساوية تُعطي احتمالات متساوية.

بِشَكلٍ أعم، تَكُون دالة السوفتمكس غير مُتَأثِرة بالترجمة بإضافة نفس القيمة إلى كل إحداثي: فإن إضافة إلى المدخلات تؤدي إلى ، لأنها تُضرب كُل أُسٍ فِي نَفسش العَامِل، (لأن ), وبالتالي لا تتغير النسب:

هندسيًا، تكون دالة softmax ثابتة على طول الأقطار: هذا هو البعد الذي يتم التخلص منه، ويتوافق مع كون تانج softmax غير متأثر بالتحويل في قيم الإدخال (اختيار قيمة 0). يمكن تطبيع قيم الإدخال بافتراض أن مجموعها يساوي صفرًا (بطرح المتوسط: حيث )، ثم يأخذ softmax المستوى الفائق للنقاط التي مجموعها صفر، ، إلى البسيط المفتوح للقيم الإيجابية التي مجموعها يساوي 1 ، على نحو مماثل لكيفية أخذ الأس من 0 إلى 1، وهو إيجابي.

وعلى نَقيض ذلك، فَإن دالة سوفتماكس ليست غَيرَ مُتَغِيرة تحت التحجيم. مثال على هذا :

ولكن

ادالة اللوجستية القياسية هِي الحَالة الخَاصة لمِحور أحادي البعد في افضاء ثنائي الأبعاد، على سبيل المثال المحور x في المستوى (x, y) . يَتم تَثبيت أحد المتغيرين عند 0 (لنقل )، وبالتالي ، بينما يُمكن أن يتغير المتغير الآخر، ولنرمز له بـ ، وبالتالي وهِي الوظيفة اللوجستية القياسية، و وهي متممتها (أي أن المجموع يُساوي 1). ويُمكن التَعبير عن المُدخل أحادي البعد بِشكل بَديل على أنَهُ الخَط ، مع المُخَرجات و

التدرجات

تُعتَبر دالة سوفتماكس تدرجًا لدالة LogSumExp : LogSumExp تُعرف الدالة على إنها : .

وبالتالي فإن تدرج softmax هو .

تاريخ

استُخدامت دالة السوفتماكس في الميكانيكا الإحصائية كتوزيع بولتزمان في الورقة التأسيسية Boltzmann (1868) ، [14] وتمت صياغتها وترويجها في الكتاب المدرسي المؤثر Gibbs (1902) . [15]

يُنسب استخدام دالة سوفت ماكس في نظرية القرار إلى R. Duncan Luce ، [16] :1الذي استخدم مسلّمة استقلال البدائل غير ذات الصلة في نظرية الاختيار العقلاني لاستنتاج دالة السوفتمكس في مسلّمة لوس للاختيار بالنسبة للتفضيلات النسبية.[بحاجة لمصدر]

في تعلم الآلة، يُنسب مصطلح "softmax" إلى جون إس. بريدل في ورقتين بحثيتين قُدمتا في مؤتمرين عام 1989،هما Bridle (1990a) : [17] :1و Bridle (1990b) :

نحن مهتمون بالشبكات غير الخطية للأعلاف (Perceptrons متعددة الطبقات ، أو MLPs) مع مخرجات متعددة. نود أن نعامل مخرجات الشبكة كاحتمالات للبدائل (فئات أنماط "" على سبيل المثال ") ، مشروطة بالمدخلات. نحن نبحث عن الإخراج غير الخطية المناسبة وللمعايير المناسبة لتكييف معلمات الشبكة ("على سبيل المثال" الأوزان). نوضح تعديلين: تسجيل الاحتمالات ، وهو بديل لتقليل الخطأ التربيعي ، وتعميم الأسي المتطبيع

لأي مدخلات ، يجب أن تكون جميع المخرجات إيجابية ويجب أن تلتزم الوحدة. ...

بالنظر إلى مجموعة من القيم غير المقيدة ، , يمكننا التأكد من كلا الشرطين باستخدام التحول الأسي الطبيعي: يمكن اعتبار هذا التحول تعميمًا متعدد المدخلات للوجستية ، ويعمل على طبقة الإخراج بأكملها. إنه يحتفظ بترتيب ترتيب قيم الإدخال الخاصة به ، وهو تعميم قابل للتمييز لتشغيل "الفائز بجميع" لاختيار القيمة القصوى. لهذا السبب نود أن نشير إليها باسم softmax.[18]:213

مثال

مع إدخال (1, 2, 3, 4, 1, 2, 3) ، تكون قيمة السوفتمّاكس تقريبًا (0.024, 0.064, 0.175, 0.475, 0.024, 0.064, 0.175) . يتركز معظم الوزن في الإخراج عند قيمة "4" في الإدخال الأصلي. هذا هو الاستخدام الشائع للدالة: إبراز القيم الكبرى وتقليل تأثير القيم التي تقل كثيرًا عن القيمة العظمى. لكن يُلاحظ أن تغيير درجة الحرارة يغيّر الإخراج . فعندما تُضرب درجة الحرارة في 10، تصبح القيم المُدخلة فعليًا (0.1, 0.2, 0.3, 0.4, 0.1, 0.2, 0.3) ويكون الحد الأقصى للرطوبة تقريبًا (0.125, 0.138, 0.153, 0.169, 0.125, 0.138, 0.153) . وهذا يوضح أن درجات الحرارة المرتفعة تقلل من أهمية القيمة القصوى.

حساب هذا المثال باستخدام كود بايثون :

>>> import numpy as np
>>> z = np.array([1.0, 2.0, 3.0, 4.0, 1.0, 2.0, 3.0])
>>> beta = 1.0
>>> np.exp(beta * z) / np.sum(np.exp(beta * z)) 
array([0.02364054, 0.06426166, 0.1746813, 0.474833, 0.02364054,
    0.06426166, 0.1746813])

البدائل

تولّد دالة softmax تنبؤات احتمالية موزعة بكثافة على نطاقها . ويمكن استخدام دوال أخرى مثل sparsemax أو α- entmax عندما يُراد الحصول على تنبؤات احتمالية متفرقة. كذلك يمكن استخدام خدعة إعادة التوسيط Gumbel-softmax عندما تكون هناك حاجة لمحاكاة أخذ العينات من توزيع متقطع بطريقة قابلة للاشتقاق.

انظر أيضًا

  • سوفت بلس
  • الانحدار اللوجستي المتعدد الحدود
  • توزيع دي ريتشليت - طريقة بديلة لأخذ عينات من التوزيعات الفئوية
  • وظيفة التقسيم
  • الميل الأسّي - تعميم Softmax على توزيعات الاحتمالات الأكثر عمومية

ملحوظات

  1. Positive β corresponds to the maximum convention, and is usual in machine learning, corresponding to the highest score having highest probability. The negative −β corresponds to the minimum convention, and is conventional in thermodynamics, corresponding to the lowest energy state having the highest probability; this matches the convention in the Gibbs distribution, interpreting β as coldness.
  2. The notation β is for the thermodynamic beta, which is inverse temperature: ,
  3. For (coldness zero, infinite temperature), , and this becomes the constant function , corresponding to the discrete uniform distribution.
  4. In statistical mechanics, fixing β is interpreted as having coldness and temperature of 1.

المراجع

  1. Goodfellow، Ian؛ Bengio، Yoshua؛ Courville، Aaron (2016). "6.2.2.3 Softmax Units for Multinoulli Output Distributions". Deep Learning. MIT Press. ص. 180–184. ISBN:978-0-26203561-3. مؤرشف من الأصل في 2025-05-25.
  2. Bishop، Christopher M. (2006). Pattern Recognition and Machine Learning. Springer. ISBN:0-387-31073-8.
  3. Goodfellow, Bengio & Courville 2016، صفحات 183–184: The name "softmax" can be somewhat confusing. The function is more closely related to the arg max function than the max function. The term "soft" derives from the fact that the softmax function is continuous and differentiable. The arg max function, with its result represented as a one-hot vector, is not continuous nor differentiable. The softmax function thus provides a "softened" version of the arg max. The corresponding soft version of the maximum function is . It would perhaps be better to call the softmax function "softargmax," but the current name is an entrenched convention.
  4. LeCun، Yann؛ Chopra، Sumit؛ Hadsell، Raia؛ Ranzato، Marc’Aurelio؛ Huang، Fu Jie (2006). "A Tutorial on Energy-Based Learning". في Gökhan Bakır؛ Thomas Hofmann؛ Bernhard Schölkopf؛ Alexander J. Smola؛ Ben Taskar؛ S.V.N Vishwanathan (المحررون). Predicting Structured Data. Neural Information Processing series. MIT Press. ISBN:978-0-26202617-8. مؤرشف من الأصل (PDF) في 2022-06-28.
  5. Bishop، Christopher M. (2006). Pattern Recognition and Machine Learning. Springer. ISBN:0-387-31073-8.Bishop, Christopher M. (2006). Pattern Recognition and Machine Learning. Springer. ISBN 0-387-31073-8.
  6. "Unsupervised Feature Learning and Deep Learning Tutorial". ufldl.stanford.edu. مؤرشف من الأصل في 2025-03-08. اطلع عليه بتاريخ 2024-03-25.
  7. 1 2 3 4 5 Onal, Kezban Dilek; Zhang, Ye; Altingovde, Ismail Sengor; Rahman, Md Mustafizur; Karagoz, Pinar; Braylan, Alex; Dang, Brandon; Chang, Heng-Lu; Kim, Henna (1 Jun 2018). "Neural information retrieval: at the end of the early years". Information Retrieval Journal (بالإنجليزية). 21 (2): 111–182. DOI:10.1007/s10791-017-9321-y. hdl:11245.1/008d6e8f-df13-4abf-8ae9-6ff2e17377f3. ISSN:1573-7659. S2CID:21684923.
  8. 1 2 3 4 Chen، Wenlin؛ Grangier، David؛ Auli، Michael (أغسطس 2016). "Strategies for Training Large Vocabulary Neural Language Models". Proceedings of the 54th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Berlin, Germany: Association for Computational Linguistics: 1975–1985. arXiv:1512.04906. DOI:10.18653/v1/P16-1186. S2CID:6035643. مؤرشف من الأصل في 2025-03-08.
  9. 1 2 Onal, Kezban Dilek; Zhang, Ye; Altingovde, Ismail Sengor; Rahman, Md Mustafizur; Karagoz, Pinar; Braylan, Alex; Dang, Brandon; Chang, Heng-Lu; Kim, Henna (1 Jun 2018). "Neural information retrieval: at the end of the early years". Information Retrieval Journal (بالإنجليزية). 21 (2): 111–182. DOI:10.1007/s10791-017-9321-y. hdl:11245.1/008d6e8f-df13-4abf-8ae9-6ff2e17377f3. ISSN:1573-7659. S2CID:21684923.Onal, Kezban Dilek; Zhang, Ye; Altingovde, Ismail Sengor; Rahman, Md Mustafizur; Karagoz, Pinar; Braylan, Alex; Dang, Brandon; Chang, Heng-Lu; Kim, Henna; McNamara, Quinten; Angert, Aaron (2018-06-01). "Neural information retrieval: at the end of the early years". Information Retrieval Journal. 21 (2): 111–182. doi:10.1007/s10791-017-9321-y. hdl:11245.1/008d6e8f-df13-4abf-8ae9-6ff2e17377f3. ISSN 1573-7659. S2CID 21684923.
  10. 1 2 Chen، Wenlin؛ Grangier، David؛ Auli، Michael (أغسطس 2016). "Strategies for Training Large Vocabulary Neural Language Models". Proceedings of the 54th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Berlin, Germany: Association for Computational Linguistics: 1975–1985. arXiv:1512.04906. DOI:10.18653/v1/P16-1186. S2CID:6035643. مؤرشف من الأصل في 2025-03-08.Chen, Wenlin; Grangier, David; Auli, Michael (August 2016). "Strategies for Training Large Vocabulary Neural Language Models". Proceedings of the 54th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Berlin, Germany: Association for Computational Linguistics: 1975–1985. arXiv:1512.04906. doi:10.18653/v1/P16-1186. S2CID 6035643.
  11. 1 2 3 Morin, Frederic; Bengio, Yoshua (6 Jan 2005). "Hierarchical Probabilistic Neural Network Language Model" (PDF). International Workshop on Artificial Intelligence and Statistics (بالإنجليزية). PMLR: 246–252. Archived from the original (PDF) on 2025-01-22.
  12. Milakov، Maxim؛ Gimelshein، Natalia (2018). "Online normalizer calculation for softmax". arXiv:1805.02867 [cs.PF].
  13. Dao, Tri; Fu, Dan; Ermon, Stefano; Rudra, Atri; Ré, Christopher (6 Dec 2022). "FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness". Advances in Neural Information Processing Systems (بالإنجليزية). 35: 16344–16359. Archived from the original on 2025-05-08.
  14. Boltzmann، Ludwig (1868). "Studien über das Gleichgewicht der lebendigen Kraft zwischen bewegten materiellen Punkten" [Studies on the balance of living force between moving material points]. Wiener Berichte. ج. 58: 517–560.
  15. Gibbs، Josiah Willard (1902). Elementary Principles in Statistical Mechanics.
  16. Gao، Bolin؛ Pavel، Lacra (2017). "On the Properties of the Softmax Function with Application in Game Theory and Reinforcement Learning". arXiv:1704.00805 [math.OC].
  17. Gao، Bolin؛ Pavel، Lacra (2017). "On the Properties of the Softmax Function with Application in Game Theory and Reinforcement Learning". arXiv:1704.00805 [math.OC].Gao, Bolin; Pavel, Lacra (2017). "On the Properties of the Softmax Function with Application in Game Theory and Reinforcement Learning". arXiv:1704.00805 math.OC.
  18. Bridle، John S. (1990b). "Training Stochastic Model Recognition Algorithms as Networks can Lead to Maximum Mutual Information Estimation of Parameters". في D. S. Touretzky (المحرر). Advances in Neural Information Processing Systems 2 (1989). Morgan-Kaufmann. مؤرشف من الأصل في 2020-08-12.