نظام التعرف على الكلام في ويندوز
| المطورون |
|---|
نظام التعرف على الكلام في ويندوز هو نظام للتعرف على الكلام طورته شركة مايكروسوفت وضمنته لأول مرة في نظام التشغيل ويندوز فيستا لكي يُتيح للمُستخدم إمكانية التحكم في واجهة المستخدم الرسومية، وإملاء النصوص في المستندات الرقمية ورسائل البريد الإلكتروني، وتصفح مواقع الويب، واستخدام اختصارات لوحة المفاتيح، والتحكم في مؤشر الفأرة من خلال الأوامر الصوتية. يدعم نظام التعرف على الكلام في ويندوز وحدات ماكرو مخصصة لأداء مهام إضافية أو تكميلية، ويعمل بمثابة منصة للتعرف على الكلام تتم معالجتها محليًا؛ ولا تعتمد على الحوسبة السحابية للتدقيق أو الإملاء أو التعرف، بل تتكيف وفقًا على السياقات والقواعد النحوية وعينات الكلام وجلسات التدريب والمفردات، كما يوفر النظام قاموسًا شخصيًا يسمح للمستخدمين بإضافة أو استبعاد الكلمات أو التعبيرات من الإملاء، ويسمح لهم أيضًا بتسجيل النطق لزيادة دقة التعرف على الكلام، وهو يدعم كذلك نماذج لغوية مخصصة. طورت شركة مايكروسوفت نظام التعرف على الكلام في ويندوز ليكون جزءًا من نظام التشغيل الخاص بها ويندوز فيستا، وكانت ميزات التعرف على الكلام المُضمنة تقتصر قبل ذلك على تطبيقات مثل ويندوز ميديا بلاير. أصبح النظام بعد ذلك متاحًا في الإصدارات اللاحقة من نظام الويندوز، مثل ويندوز 7، وويندوز 8، وويندوز 8.1، وويندوز آر تي، وويندوز 10، وويندوز 11.
التاريخ
شاركت شركة مايكروسوفت في أبحاث التعرف على الكلام وتوليفه لسنوات عديدة قبل تطويرها لنظام التعرف على الكلام في ويندوز، ففي عام 1993، استعانت شركة مايكروسوفت بشيودونغ هوانغ أستاذ علوم الحاسوب في جامعة كارنيجي ميلون ليكون على رأس فريقها الذي يعمل على تطوير نظام للتعرف على الكلام، وقد أثمرت جهود وأبحاث الشركة في عام 1994 عن تقديم واجهة برمجة التطبيقات الصوتية الخاصة بها،[1] ثُمّ استُخدم نظام التعرف على الكلام في منتجات مايكروسوفت الأخرى بدءًا من مجموعة برامج مايكروسوفت أوفيس إكس بي ومايكروسوفت أوفيس 2003 وحتى مُتصفح الويب إنترنت إكسبلورر،[2] ثُمّ أدخلت مايكروسوفت وظائف التعرف على الكلام إلى الإصدارات السابقة من مايكروسوفت ويندوز مثل ويندوز 98 وويندوز 2000 وويندوز ميلينيوم وويندوز إن تي 4.0.[3] ومع دخول الحواسب اللوحية إلى أسواق الحاسوب، ضمنت مايكروسوفت وظائف التعرف على الكلام في الإصدار المخصص للحواسب اللوحية من نظام التشغيل ويندوز إكس بي،[4][5] كما مكنت استخدام الأوامر الصوتية على مشغل وسائط ويندوز.[6] تطلبت جميع هذه الميزات تثبيت نظام التعرف على الكلام كمكون منفصل في أنظمة الويندوز.[5] في الوقت الحالي، تعتمد مجموعة برامج مايكروسوفت أوفيس 2007 والإصدارات الأحدث على خدمات التعرف على الكلام.[7]
في ويندوز فيستا
كشف رجل الأعمال الأمريكي بيل غيتس خلال مؤتمر مطورو الحاسوب المحترفين عام 2003 عن اعتزام شركة مايكروسوفت دمج إمكانيات التعرف على الكلام في نظام التشغيل ويندوز فيستا، وهو ما اعتبر في ذلك الوقت بمثابة تقدم كبير في نظام ويندوز فيستا، سواءً في قدرات النظام على التعرف أو التوليف للكلام في الوقت الفعلي.[8][9] ثُم أعلنت مايكروسوفت خلال مؤتمر ويندوز لهندسة عتاد الحاسوب أن نظام التشغيل الخاص بها ويندوز فيستا سوف ييتضمن ميزات جديدة لتحسين وظائف التعرف على الكلام مثل دعم مصفوفة الميكروفون،[10] وذلك في إطار جهودها الرامية إلى توفير بنية تحتية صوتية عالية الجودة ومتسقة للتعرف على الكلام الطبيعي المستمر والتحكم فيه.[11] ضمنت مايكروسوفت في إصداراتها الأولية أثناء تطوير ويندوز فيستا محرك كلام مزود بميزات تدريب.[12] وبحسب ما ذكره مطورو النظام في العرض التقديمي خلال مؤتمر مطوري الحاسوب المحترفين عام 2003 فقد أتى ويندوز فيستا مزودا أيضًا بواجهة مستخدم صوتية تُتيح التحكم في النظام من خلال الميكروفون، مع ميزات لتكوين واجهة المستخدم الصوتية وتدريبها.[13] وخلال الإعلان عن تطويرها لحزمة من البرامج الخاصة بها، أوضحت مايكروسوفت مدى دمج نظام التعرف على الكلام في منتجاتها، وأنه من خلال التدريب على سياقات الكلام الشائعة ستكون ميزة التحكم الصوتي في القوائم والأيقونات باستخدام الكلام مُفعّلة على مستوى النظام.[14]
خلال مؤتمر ويندوز لهندسة العتاد الحاسوبي لعام 2004، أدرجت مايكروسوفت ميزة التعرف على الكلام كجزء من استراتيجيتها لتحسين الإنتاجية على أجهزة الحواسب المحمولة.[15][16] ركّزت مايكروسوفت في وقت لاحق على تعزيز إمكانية الوصول، وسيناريوهات التنقل الجديدة، ودعم لغات إضافية، وتحسينات في تجربة المستخدم الصوتية، وهو ما كشفت عنه خلال مؤتمر ويندوز لهندسة عتاد الحاسوب لعام 2005. بخلاف دعم الكلام المُضمّن في نظام التشغيل ويندوز إكس بي، والذي كان مُدمجًا مع لوحة إدخال الحاسوب اللوحي مما تطلّب التبديل بين وضعي الأوامر والإملاء المُنفصلين،[17] فقد أتى نظام التشغيل ويندوز فيستا بواجهة مُخصصة لإدخال الكلام على سطح المكتب، مع توحيد وضعي الكلام المُنفصلين، إذ لم يكن بمقدور المستخدمين في السابق نطق أمر صوتي بعد الإملاء أو العكس دون التبديل أولًا بين هذين الوضعين.[18] تضمّن الإصدار التجريبي الأول من ويندوز فيستا ميزة التعرف على الكلام المُدمجة.[19] ولتحفيز موظفي الشركة على تحليل نظام التعرف على الكلام المُدمج في ويندوز بحثًا عن أي خلل أو أخطاء برمجية وتقديم الملاحظات، عرضت مايكروسوفت على مختبريها فرصة الفوز بإصدار مميز من إكس بوكس 360.[20]
خلال العرض التقديمي الذي أجرته مايكروسوفت في 27 يوليو (آب) 2006، قبل إصدار ويندوز فيستا للتصنيع، حدث خطأ برمجي ملحوظ في نظام التعرف على الكلام المُدمج في ويندوز أدى إلى ظهور رسالة غير مقصودة مفادها "عزيزتي العمة، لنضع ضعف القيمة القاتلة لحذف وتحديد الكل"، كما أدت عدة محاولات للإملاء إلى أخطاء متتالية في الإخراج.[21][22] أثار هذا الحادث سخرية الكثير من المحللين والصحفيين الحاضرين خلال العرض التقديمي،[23][24] على الرغم من نجاح النظام في عرض تقديمي آخر أجرته إدارة التطبيقات والتنقل في مايكروسوفت في وقت سابق.[21] كشفت مايكروسوفت لاحقا أن هذه المشكلات كانت ناجمة عن خلل حدث عند تضخيم الصوت تسبب في تشويش جهاز التعرف على الأوامر والإملاء، وتمكنت من إصلاح الخلل قبل إصدار ويندوز فيستا.[25]
أشارت التقارير الصادرة في أوائل عام 2007 إلى وجود ثغرة في نظام ويندوز للتعرف على الكلام يُمكن استغلالها من المهاجمين الذين يستخدمون تقنية التعرف على الكلام في عمليات ضارة من خلال تشغيل أوامر صوتية معينة عبر مكبرات صوت الهدف.[26][27] وكانت هذه أول ثغرة تُكتشف في نظام ويندوز فيستا بعد طرحه رسميا وإتاحته لجميع المُستخدمين.[28] صرحت مايكروسوفت أنه على الرغم من إمكانية حدوث مثل هذا الهجوم نظريًا، إلا أن عددًا من العوامل المخففة والمتطلبات الأساسية قد تحد من فعاليته أو تمنعه تمامًا، فمثلًا، سيتطلب هذا الهجوم أن يكون جهاز التعرف لدى الهدف نشطًا ومُهيأً لتفسير هذه الأوامر بشكل صحيح، إلى جانب تمكين الميكروفونات ومكبرات الصوت وضبطها على مستويات صوت كافية؛ كما سيتطلب الهجوم من الحاسوب إجراء عمليات مرئية وإصدار ملاحظات صوتية دون أن يلاحظ المستخدمون. وسيمنع التحكم في حساب المستخدم حدوث العمليات ذات الامتيازات.[29]
مراجع
- ↑ Brown، Robert. "Exploring New Speech Recognition And Synthesis APIs In Windows Vista". MSDN Magazine. مايكروسوفت. مؤرشف من الأصل في 2008-03-07. اطلع عليه بتاريخ 2015-06-26.
- ↑ "How To Use Speech Recognition in Windows XP". Windows Support. مايكروسوفت. مؤرشف من الأصل في 2015-03-14. اطلع عليه بتاريخ 2020-05-15.
- ↑ "Description of the speech recognition and handwriting recognition methods in Word 2002". Windows Support. مايكروسوفت. مؤرشف من الأصل في 2015-07-03. اطلع عليه بتاريخ 2018-03-26.
- ↑ Thurrott، Paul (25 يونيو 2002). "Windows XP Tablet PC Edition Review". Windows IT Pro. Penton. مؤرشف من الأصل في 2011-07-19. اطلع عليه بتاريخ 2020-05-15.
- 1 2 Dresevic، Bodin (2005). "Natural Input On Mobile PC Systems". مايكروسوفت. مؤرشف من الأصل (PPT) في 2005-12-14. اطلع عليه بتاريخ 2020-05-15.
- ↑ Thurrott، Paul (6 أكتوبر 2010). "Plus! for Windows XP Review". Windows IT Pro. Penton. مؤرشف من الأصل في 2011-07-05. اطلع عليه بتاريخ 2020-05-15.
- ↑ "What happened to speech recognition?". Office Support. مايكروسوفت. مؤرشف من الأصل في 2016-11-10. اطلع عليه بتاريخ 2020-05-15.
- ↑ "Bill Gates' Web Site — Speech Transcript, Microsoft Professional Developers Conference 2003". مايكروسوفت. 27 أكتوبر 2003. مؤرشف من الأصل في 2004-02-03. اطلع عليه بتاريخ 2020-05-15.
- ↑ Thurrott، Paul؛ Furman، Keith (26 أكتوبر 2003). "Live from PDC 2003: Day 1, Monday". Windows IT Pro. Penton. مؤرشف من الأصل في 2013-09-11. اطلع عليه بتاريخ 2020-05-15.
- ↑ Stam، Nick (16 أبريل 2002). "WinHEC: The Pregame Show". PC Magazine. Ziff Davis Media. مؤرشف من الأصل في 2015-07-03. اطلع عليه بتاريخ 2020-05-15.
- ↑ Flandern Van، Mike (2002). "Audio Considerations for Voice-Enabled Applications". Windows Hardware Engineering Conference. مايكروسوفت. مؤرشف من الأصل (EXE) في 2002-05-06. اطلع عليه بتاريخ 2018-03-30.
- ↑ Spanbauer، Scott (4 ديسمبر 2003). "Your Next OS: Windows 2006?". TechHive. IDG. مؤرشف من الأصل في 2015-11-04. اطلع عليه بتاريخ 2015-06-25.
- ↑ Gjerstad، Kevin؛ Chambers، Rob (2003). "Keyboard, Speech, and Pen Input in Your Controls". Professional Developers Conference. مايكروسوفت. مؤرشف من الأصل (PPT) في 2012-12-19. اطلع عليه بتاريخ 2018-03-30.
- ↑ "Interacting with the Computer using Speech Input and Speech Output". MSDN. مايكروسوفت. 2003. مؤرشف من الأصل في 2004-01-04. اطلع عليه بتاريخ 2015-06-28.
- ↑ Suokko، Matti (2004). "Windows For Mobile PCs And Tablet PCs — CY05 And Beyond". مايكروسوفت. مؤرشف من الأصل (PPT) في 2005-12-14. اطلع عليه بتاريخ 2020-05-15.
- ↑ Fish، Darrin (2004). "Windows For Mobile PCs and Tablet PCs — CY04". مايكروسوفت. مؤرشف من الأصل (PPT) في 2005-12-14. اطلع عليه بتاريخ 2020-05-15.
- ↑ Dresevic، Bodin (2005). "Natural Input on Mobile PC Systems". مايكروسوفت. مؤرشف من الأصل (PPT) في 2005-12-14. اطلع عليه بتاريخ 2020-05-15.
- ↑ Chambers، Rob (1 أغسطس 2005). "Commanding and Dictation — One mode or two in Windows Vista?". MSDN. مايكروسوفت. مؤرشف من الأصل في 2016-03-04. اطلع عليه بتاريخ 2015-06-30.
- ↑ Thurrott، Paul (6 أكتوبر 2010). "Windows Vista Beta 1 Review (Part 3)". Windows IT Pro. Penton. مؤرشف من الأصل في 2014-08-23. اطلع عليه بتاريخ 2020-05-15.
- ↑ Levy، Brian (2006). "Microsoft Speech Recognition poster". مؤرشف من الأصل في 2006-10-11. اطلع عليه بتاريخ 2020-05-15.
- 1 2 Auchard، Eric (28 يوليو 2006). "Updated – When good demos go (very, very) bad". تومسون رويترز. مؤرشف من الأصل في 2011-05-21. اطلع عليه بتاريخ 2018-03-29.
- ↑ "Software glitch foils Microsoft demo". إن بي سي نيوز. 2 أغسطس 2006. مؤرشف من الأصل في 2018-03-28. اطلع عليه بتاريخ 2020-05-15.
- ↑ Montalbano، Elizabeth (31 يوليو 2006). "Vista voice-recognition feature needs work". InfoWorld. IDG. مؤرشف من الأصل في 2006-08-05. اطلع عليه بتاريخ 2015-06-26.
- ↑ Montalbano، Elizabeth (31 يوليو 2006). "Vista's Voice Recognition Stammers". TechHive. IDG. مؤرشف من الأصل في 2015-07-03. اطلع عليه بتاريخ 2020-05-15.
- ↑ Chambers، Rob (29 يوليو 2006). "FAM: Vista SR Demo failure — And now you know the rest of the story ..." MSDN. مايكروسوفت. مؤرشف من الأصل في 2011-05-22. اطلع عليه بتاريخ 2020-05-15.
- ↑ "Vista has speech recognition hole". بي بي سي نيوز. BBC. 1 فبراير 2007. مؤرشف من الأصل في 2007-02-03. اطلع عليه بتاريخ 2020-05-15.
- ↑ Miller، Paul (1 فبراير 2007). "Remote 'exploit' of Vista Speech reveals fatal flaw". إنغادجيت. إيه أو إل. مؤرشف من الأصل في 2018-07-04. اطلع عليه بتاريخ 2015-06-28.
- ↑ Roberts، Paul (1 فبراير 2007). "Honeymoon's Over: First Windows Vista Flaw". PCWorld. IDG. مؤرشف من الأصل في 2007-02-04. اطلع عليه بتاريخ 2015-06-28.
- ↑ "Issue regarding Windows Vista Speech Recognition". TechNet. مايكروسوفت. 31 يناير 2007. مؤرشف من الأصل في 2016-05-20. اطلع عليه بتاريخ 2018-03-31.